Anthropic 高管:Astra 对齐最佳,行业应重视提示注入
Anthropic 高管称 Astra 是其迄今最强大且对齐最好的模型,并指约两个月前已在实际中解决 Claude 模型的提示注入问题。其引用推文显示 OpenAI 新模型在提示注入风险上与 Gemini Flash 和 Opus 4.8 大致相当。他呼吁行业投入更多精力训练模型抵抗提示注入,并称将持续评估其他实验室以推动安全对齐。
- Anthropic 高管称 Astra 对齐最佳
- 已解决 Claude 提示注入问题
Các cập nhật quan trọng từ nguồn cấp công khai, được tổ chức thành dòng thời gian chủ đề, bản tin trực tiếp hôm nay và bản tin hoàn chỉnh của ngày trước.
人工智能、AI Agent、大模型、开源模型、AI 产品、模型服务与生态变化。
OpenAI 宣布用约 10000 个 AI 智能体 88 小时解决纳维-斯托克斯问题,陶哲轩点赞并表担忧;OpenAI 称解决 Navier-Stokes 难题引发争议;OpenAI 宣布用智能体群求解 Navier-Stokes 千禧年大奖难题
Anthropic 高管称 Astra 是其迄今最强大且对齐最好的模型,并指约两个月前已在实际中解决 Claude 模型的提示注入问题。其引用推文显示 OpenAI 新模型在提示注入风险上与 Gemini Flash 和 Opus 4.8 大致相当。他呼吁行业投入更多精力训练模型抵抗提示注入,并称将持续评估其他实验室以推动安全对齐。
Meta 发布面向个人事务的 Muse AI 智能体,由 Muse Spark 1.3 模型驱动,可连接邮箱、日历、购物和支付服务,并在应用关闭后持续工作。
OpenAI 发布 GPT Image 2.5,主打更快、更逼真、更强一致性,配合 GPT-6 的各种能力,引发行业关注。
卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。
OpenAI 发布 ChatGPT Images 2.5,主打更快、更清晰、更智能的图像生成。更新包括更快的生成速度、更自然可辨识的图像保真度、多次编辑间细节保持一致,以及通过评论式修改只改动想要的部分。
BestBlogs 早报汇总 09-09 要闻:OpenAI 推出 ChatGPT Images 2.5,每周生成超 30 亿张图片,延迟最高降低 50%;面壁智能开源 MiniCPM5-2B,以 2B 参数登顶 AA 榜单全球 4B 以下第一。另有 OpenAI 解决 Navier-Stokes 千年难题、Google DeepMind 发布 AlphaGenome Atlas 等动态。
OpenAI 发布 ChatGPT Images 2.5,每周生成超 30 亿张图,延迟较 Images 2.0 最高降 50%,强化参考对象保持与局部编辑。Grok Bot 产品负责人复盘一个月打造可信 Agent 的委托体验。Claude 圆桌展示三家团队基于 Managed Agents 构建会议、销售与产品分析产品。
Claude Code v2.1.266 修复了 2.1.265 引入的回归问题,该问题导致单独设置 CLAUDE_CODE_USE_GATEWAY 环境变量时强制要求 Cloud 网关登录,使搭配 API key 或自定义认证头的配置全部请求失败。此版本恢复该变量单独设置时被忽略的行为,无需更改配置。
OpenAI 用未发布模型在约88小时内给出 Navier-Stokes 存在与光滑性问题(七大千禧年难题之一)的解答,并通过 GPT-6 Astra 完成17小时 Lean 形式化验证,全程发送490万条消息、消耗约3000亿输出 token。
OpenAI 9 月 9 日发布 ChatGPT Images 2.5,图像生成延迟最多降低 50%,新增 Sketch 草图参考、模板库、图片内评论标注等功能,为当前最先进的图像生成模型。DeepSeek 宣布将于 9 月 10 日 12 时起下调 Flash 系列模型价格,输出价格调整为每百万 Token 4 元。
一项研究将 LLM 置于虚构的 Toma City 招聘任务中,在四个无真实差异的部落间做选择,发现模型会像人类一样将偶然差异放大为稳定偏见。评论者认为实验设定存在争议,但讨论延伸到现实招聘中的隐性身份信号及 LLM 作为决策代理的潜在风险。
消息源通过挖掘 tvOS 27 Beta 代码发现 AppleTV18,1 硬件踪迹,预估为苹果新款 Apple TV 4K。该设备将配备 A19 或 A19 Pro 芯片,内存可能提升至 8GB 或 12GB,以满足运行 Apple Intelligence 的要求。系统代码还显示新款 Apple TV 将支持 Siri AI,并配备升级款 Siri Remote 遥控器。
菲尔兹奖得主陶哲轩对 AI 迅速解决开放数学问题表示担忧,认为这可能耗尽数学界的长期研究资源。讨论以 Navier-Stokes 方程的新进展为引,探讨 AI 生成证明的质量、数学洞察的价值以及开放问题是否会被一次性利用。
Anthropic 确认,攻击者用信息窃取恶意软件盗取 Claude 登录会话,访问用户账号并消耗额度,例如生成未经授权的 Claude Code OAuth 令牌。
Meta 于 9 月 9 日正式发布个人智能体 Muse(内部代号 Hatch),初期仅在美国上线,可自主完成发邮件、卖车、预订旅行等任务,提供免费基础版及每月 20 美元和 100 美元订阅套餐。
Mark Zuckerberg 透露 Meta 正在使用 Prometheus(其 1 吉瓦 AI 算力集群)扩展训练 post-Watermelon 模型。Watermelon 是未发布的 Avocado/Spark 后继者,据称为 Meta 迄今最大模型,据报训练算力约为前者的 10 倍。
OpenAI 于 9 月 8 日宣布,其未公开的内部模型(性能远超 GPT-6 Astra)解决了千禧年大奖难题之一的纳维-斯托克斯存在性与光滑性问题,通过约 10000 个 AI 智能体协作在约 88 小时内生成了证明,证明初始平滑流体可在有限时间内出现奇点。
Inception 发布 Mercury 2.5,称其为目前能力最强、规模最大的扩散大语言模型,智能较 Mercury 2 提升 40%,可对标 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5。该模型已在 OpenRouter 上提供试用,主打低延迟与成本优势。
OpenAI 于 9 月 9 日发布图像生成模型 ChatGPT Images 2.5,在细节锐度、自然光照和纹理提升的同时,延迟较 2026 年 4 月的 Images 2 最多降低 50%。
一个基于 Transformers.js 的 React 应用,可点击或悬停生成的 token,查看影响其生成的历史 token 的注意力权重。可视化通过缩放值向量幅度并跨所有注意力头和层聚合实现,能展示模型从原文复制信息及组合多短语语义的过程。应用使用 6 亿参数模型,并预生成提示词以便即时加载。
OpenAI 推出 ChatGPT Images 2.5,官方称该图像模型已在 ChatGPT Images 和 API 的 GPT-Image 模型中生成超过 30 亿张图片。
DeepSeek 开放平台公告,自 2026 年 9 月 10 日 12 时起调整 Flash 系列定价。空闲时段输入缓存命中每百万 Token 0.02 元(降幅 60%)、缓存未命中 1 元(降幅 33.33%)、输出 4 元(降幅 11.11%),高峰时段价格为空闲时段两倍。
一篇新论文提出通过离散扩散实现大语言模型的无损加速,相关论文已发布在 Hugging Face 上。
Muse 构建了大量连接器,运行在安全虚拟机中,用户数据不用于广告。支持连接 Gmail、Google 日历、Outlook、Plaid、Opentable、Google Docs、Spotify、Function Health、Withings、Tailscale、Peloton 等服务。
Muse 宣布手机端体验入口开放,用户可通过 muse.ai/join 在手机上试用。
Sam Altman 转发演示视频并感叹“我也想要一个!”,视频中 Astra 机器人被赋予画笔和相机,自主摸索操控并实地绘制金门大桥,通过尝试不断进步。
OpenAI 发布 GPT-Image-2.5-Sunburst 和 Flare,在 Text-to-Image、Image Edit 和 Multi-Image Edit 三个 Arena 榜单均位列第一和第二。
OpenAI 展示 ChatGPT Images 2.5 在时尚领域的应用,相比上一代模型,2.5 能让设计更生动,避免平淡效果。
Harness 工程是目前最热门的技能之一。最近一次 YC Paper Club 分享中,有专家概述了该领域,并整理了一份顶级论文清单,现已发布为合集,供开发者学习参考。
Muse 个人智能体产品发布,获得早期试用者好评。评论指出,当模型智能不再是瓶颈时,个人上下文管理成为关键,运行在安全计算环境中的个人智能体是未来方向。