Anthropic 高管:Astra 对齐最佳,行业应重视提示注入
Anthropic 高管称 Astra 是其迄今最强大且对齐最好的模型,并指约两个月前已在实际中解决 Claude 模型的提示注入问题。其引用推文显示 OpenAI 新模型在提示注入风险上与 Gemini Flash 和 Opus 4.8 大致相当。他呼吁行业投入更多精力训练模型抵抗提示注入,并称将持续评估其他实验室以推动安全对齐。
- Anthropic 高管称 Astra 对齐最佳
- 已解决 Claude 提示注入问题
Важные обновления из публичных лент, организованные в хронологию тем, живые сегодняшние дайджесты и завершенные дайджесты за предыдущий день.
人工智能、AI Agent、大模型、开源模型、AI 产品、模型服务与生态变化。
OpenAI 宣布用约 10000 个 AI 智能体 88 小时解决纳维-斯托克斯问题,陶哲轩点赞并表担忧;OpenAI 称解决 Navier-Stokes 难题引发争议;OpenAI 宣布用智能体群求解 Navier-Stokes 千禧年大奖难题
Anthropic 高管称 Astra 是其迄今最强大且对齐最好的模型,并指约两个月前已在实际中解决 Claude 模型的提示注入问题。其引用推文显示 OpenAI 新模型在提示注入风险上与 Gemini Flash 和 Opus 4.8 大致相当。他呼吁行业投入更多精力训练模型抵抗提示注入,并称将持续评估其他实验室以推动安全对齐。
Meta 发布面向个人事务的 Muse AI 智能体,由 Muse Spark 1.3 模型驱动,可连接邮箱、日历、购物和支付服务,并在应用关闭后持续工作。
OpenAI 发布 GPT Image 2.5,主打更快、更逼真、更强一致性,配合 GPT-6 的各种能力,引发行业关注。
卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。
OpenAI 发布 ChatGPT Images 2.5,主打更快、更清晰、更智能的图像生成。更新包括更快的生成速度、更自然可辨识的图像保真度、多次编辑间细节保持一致,以及通过评论式修改只改动想要的部分。
BestBlogs 早报汇总 09-09 要闻:OpenAI 推出 ChatGPT Images 2.5,每周生成超 30 亿张图片,延迟最高降低 50%;面壁智能开源 MiniCPM5-2B,以 2B 参数登顶 AA 榜单全球 4B 以下第一。另有 OpenAI 解决 Navier-Stokes 千年难题、Google DeepMind 发布 AlphaGenome Atlas 等动态。
OpenAI 发布 ChatGPT Images 2.5,每周生成超 30 亿张图,延迟较 Images 2.0 最高降 50%,强化参考对象保持与局部编辑。Grok Bot 产品负责人复盘一个月打造可信 Agent 的委托体验。Claude 圆桌展示三家团队基于 Managed Agents 构建会议、销售与产品分析产品。
Claude Code v2.1.266 修复了 2.1.265 引入的回归问题,该问题导致单独设置 CLAUDE_CODE_USE_GATEWAY 环境变量时强制要求 Cloud 网关登录,使搭配 API key 或自定义认证头的配置全部请求失败。此版本恢复该变量单独设置时被忽略的行为,无需更改配置。
OpenAI 用未发布模型在约88小时内给出 Navier-Stokes 存在与光滑性问题(七大千禧年难题之一)的解答,并通过 GPT-6 Astra 完成17小时 Lean 形式化验证,全程发送490万条消息、消耗约3000亿输出 token。
OpenAI 9 月 9 日发布 ChatGPT Images 2.5,图像生成延迟最多降低 50%,新增 Sketch 草图参考、模板库、图片内评论标注等功能,为当前最先进的图像生成模型。DeepSeek 宣布将于 9 月 10 日 12 时起下调 Flash 系列模型价格,输出价格调整为每百万 Token 4 元。
一项研究将 LLM 置于虚构的 Toma City 招聘任务中,在四个无真实差异的部落间做选择,发现模型会像人类一样将偶然差异放大为稳定偏见。评论者认为实验设定存在争议,但讨论延伸到现实招聘中的隐性身份信号及 LLM 作为决策代理的潜在风险。
消息源通过挖掘 tvOS 27 Beta 代码发现 AppleTV18,1 硬件踪迹,预估为苹果新款 Apple TV 4K。该设备将配备 A19 或 A19 Pro 芯片,内存可能提升至 8GB 或 12GB,以满足运行 Apple Intelligence 的要求。系统代码还显示新款 Apple TV 将支持 Siri AI,并配备升级款 Siri Remote 遥控器。
菲尔兹奖得主陶哲轩对 AI 迅速解决开放数学问题表示担忧,认为这可能耗尽数学界的长期研究资源。讨论以 Navier-Stokes 方程的新进展为引,探讨 AI 生成证明的质量、数学洞察的价值以及开放问题是否会被一次性利用。
Anthropic 确认,攻击者用信息窃取恶意软件盗取 Claude 登录会话,访问用户账号并消耗额度,例如生成未经授权的 Claude Code OAuth 令牌。
Meta 于 9 月 9 日正式发布个人智能体 Muse(内部代号 Hatch),初期仅在美国上线,可自主完成发邮件、卖车、预订旅行等任务,提供免费基础版及每月 20 美元和 100 美元订阅套餐。
Mark Zuckerberg 透露 Meta 正在使用 Prometheus(其 1 吉瓦 AI 算力集群)扩展训练 post-Watermelon 模型。Watermelon 是未发布的 Avocado/Spark 后继者,据称为 Meta 迄今最大模型,据报训练算力约为前者的 10 倍。
OpenAI 于 9 月 8 日宣布,其未公开的内部模型(性能远超 GPT-6 Astra)解决了千禧年大奖难题之一的纳维-斯托克斯存在性与光滑性问题,通过约 10000 个 AI 智能体协作在约 88 小时内生成了证明,证明初始平滑流体可在有限时间内出现奇点。
Inception 发布 Mercury 2.5,称其为目前能力最强、规模最大的扩散大语言模型,智能较 Mercury 2 提升 40%,可对标 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5。该模型已在 OpenRouter 上提供试用,主打低延迟与成本优势。
OpenAI 于 9 月 9 日发布图像生成模型 ChatGPT Images 2.5,在细节锐度、自然光照和纹理提升的同时,延迟较 2026 年 4 月的 Images 2 最多降低 50%。
一个基于 Transformers.js 的 React 应用,可点击或悬停生成的 token,查看影响其生成的历史 token 的注意力权重。可视化通过缩放值向量幅度并跨所有注意力头和层聚合实现,能展示模型从原文复制信息及组合多短语语义的过程。应用使用 6 亿参数模型,并预生成提示词以便即时加载。
OpenAI 推出 ChatGPT Images 2.5,官方称该图像模型已在 ChatGPT Images 和 API 的 GPT-Image 模型中生成超过 30 亿张图片。
DeepSeek 开放平台公告,自 2026 年 9 月 10 日 12 时起调整 Flash 系列定价。空闲时段输入缓存命中每百万 Token 0.02 元(降幅 60%)、缓存未命中 1 元(降幅 33.33%)、输出 4 元(降幅 11.11%),高峰时段价格为空闲时段两倍。
一篇新论文提出通过离散扩散实现大语言模型的无损加速,相关论文已发布在 Hugging Face 上。
Muse 构建了大量连接器,运行在安全虚拟机中,用户数据不用于广告。支持连接 Gmail、Google 日历、Outlook、Plaid、Opentable、Google Docs、Spotify、Function Health、Withings、Tailscale、Peloton 等服务。
Muse 宣布手机端体验入口开放,用户可通过 muse.ai/join 在手机上试用。
Sam Altman 转发演示视频并感叹“我也想要一个!”,视频中 Astra 机器人被赋予画笔和相机,自主摸索操控并实地绘制金门大桥,通过尝试不断进步。
OpenAI 发布 GPT-Image-2.5-Sunburst 和 Flare,在 Text-to-Image、Image Edit 和 Multi-Image Edit 三个 Arena 榜单均位列第一和第二。
OpenAI 展示 ChatGPT Images 2.5 在时尚领域的应用,相比上一代模型,2.5 能让设计更生动,避免平淡效果。
Harness 工程是目前最热门的技能之一。最近一次 YC Paper Club 分享中,有专家概述了该领域,并整理了一份顶级论文清单,现已发布为合集,供开发者学习参考。
Muse 个人智能体产品发布,获得早期试用者好评。评论指出,当模型智能不再是瓶颈时,个人上下文管理成为关键,运行在安全计算环境中的个人智能体是未来方向。