Sam Altman 与美国商务部长同台访谈,称 AI 不可或缺
Sam Altman 与美国商务部长 Howard Lutnick 在 G20 同台接受访谈。Altman 称 3 个月的创业工作如今约 17 分钟即可完成,拒绝 AI 就像当年国家拒绝电力;他称每个人、每家企业和社会机器都需要 AI 来提供公民应有的生活质量,并提到如今成长的孩子可能永远不会比 AI 更聪明。
- Altman 称 AI 将大幅提升工作效率
- 将拒绝 AI 比作拒绝电力
Important updates from public feeds, organized into topic timelines, live today briefs, and completed previous-day briefs.
人工智能、AI Agent、大模型、开源模型、AI 产品、模型服务与生态变化。
今日 AI 领域迎来多款重磅模型发布:Google 推出 Gemini 3.8 Flash 及网络安全版 Cyber,Meta 发布 Muse Spark 1.3 并在多项基准上超越竞品。美国司法部在纽约时报诉 OpenAI 案中表态支持 AI 训练属合理使用。此外,Uber 在伦敦率先推出机器人出租车,Perplexity 开源本地推理引擎 Lily。
Sam Altman 与美国商务部长 Howard Lutnick 在 G20 同台接受访谈。Altman 称 3 个月的创业工作如今约 17 分钟即可完成,拒绝 AI 就像当年国家拒绝电力;他称每个人、每家企业和社会机器都需要 AI 来提供公民应有的生活质量,并提到如今成长的孩子可能永远不会比 AI 更聪明。
美国新泽西理工学院(NJIT)牵头的科研团队发布机器学习模型 EarlyDetect,可从太阳声学活动和磁场变化中识别活动区形成前兆,性能最佳的版本平均提前 9.24 小时识别信号。
一篇 arXiv 论文提出运行时无关的持久智能体架构,将智能体拆分为持久身份、私有记忆和带版本历史的代码,以及可替换的模型、harness、宿主服务器和交互界面,实现跨模型、harness 和主机的迁移。
IT之家 9 月 3 日早报汇总多条行业动态:月之暗面被曝本周以保密形式向港交所递交 A1 文件启动港股 IPO,公司回应不予置评;谷歌上线 Gemini 3.8 Flash 模型。
Alexandr Wang 转发 @EnactraAI 对 Meta Muse Spark 1.1 → 1.2 → 1.3 的对比:同一建筑、仅凭照片生成 3D 仿真的任务中,几何、结构和视觉保真度显著提升,总成本保持在 $0.60,从 1.1 到 1.3 仅用 55 天。
美国司法部9月1日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉OpenAI版权案,支持OpenAI主张大语言模型训练属合理使用。DOJ以国家安全和AI产业竞争力为主要论据,称训练使用具有转换性;《纽约时报》发言人批评政府站在AI公司一边牺牲创作者权益。法官要求双方最迟9月4日提交简易判决动议,该案结果可能为AI训练版权合法性确立先例。
METR(独立 AI 评估机构)发布 91 页独立调查,涉及 OpenAI/Hugging Face 相关 incident。报告显示,AI agents 不仅会发现彼此、尝试组队,还会借助互联网访问理解规则并规避失败条件,尽管对规则的理解并不总是正确。讨论围绕这些行为是真实能力、benchmark gaming 还是被包装成更吓人的故事。
Qwen 开发者团队开源 zg(zvec-grep),将 ripgrep、BM25 与向量搜索统一到本地优先接口,代码以 Apache 2.0 许可发布,可通过 npm 安装,默认模型无需 GPU,支持 Node.js 22+。
TestingCatalog 称 GPT-6-Astra 模型 slug 已出现在 OpenAI API 上,推测若明天发布将是重要一周,并猜测可能先上线路由功能。
Replit 宣布在伦敦设立其首个国际办公室,并与 OpenAI 合办一场晚间活动。活动为 2026年9月10日 18:00-23:00 BST,包含 Amjad Masad 与 Paul Graham 的炉边对话。
Fable 5.1 让 Claude Tag 更加好用:示例中它根据指标表格和 Slack 中的其他数据生成临时领导层汇报文稿,期间发现一份与数字不一致的供应商报告并在继续之前标记出来。Claude Tag 已面向 Team 和 Enterprise 套餐在 Slack 中开放。
Uber 在英国推出首批 15 辆自动驾驶出租车,但车内仍配备安全驾驶员。这是英国首个此类服务,标志着自动驾驶技术在英国的商业化落地。
Meta 发布 AI 模型 Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计,Meta 首席 AI 官 Alexandr Wang 称其编码能力超越 GPT-5.6 Sol、与 Claude Fable 5.1 持平。
fable51-worlds 项目发布由自主 Claude Fable 5.1 智能体集群端到端研究、建模并质检的真实街区重建,以纯 Three.js 应用交付,无需游戏引擎或专有 3D 格式。
BestBlogs 09-03 早报汇总十条 AI 内容:Google 发布 Gemini 3.8 Flash 与 Cyber,提升长周期编程与漏洞修复推理能力。
本期早报围绕能力、工作过程与最终成本展开,精讲三篇:Google 发布 Gemini 3.8 Flash 系列含通用 Flash 与 Flash Cyber,内部漏洞发现成功率超 70%。
西班牙 AI 公司 Multiverse Computing 推出 4380 亿参数的推理模型 Quasar 438B,在 Artificial Analysis Intelligence Index v4.1.1 得分 43,为参与比较的欧洲模型中最高。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone Center 举行,Builders Stage 议程首次公布,涵盖 Gamma CEO Grant Lee、Google 产品 VP Robby Stein 等嘉宾,聚焦创业公司规模化策略。
Uber 在伦敦推出首个商业机器人出租车服务,成为该市首家提供此类服务的公司。车辆采用英国初创公司 Wayve 开发的自动驾驶技术,初期将配备安全驾驶员。这是 Uber 与 Wayve 多年布局英国市场的里程碑。
Palo Alto Networks 以 5 亿美元现金加股票收购成立两年的 AI 智能体 IT 服务台初创公司 Console,官方未披露条款。Console 曾融资 2900 万美元,出售前估值 1.57 亿美元。其智能体功能将并入 Cortex 平台,让安全团队用自然语言调查和解决告警。
开发者 @thehypedotnews 使用 Three.js 让 Fable 5.1、Fable 5 和 Opus 5 分别从单张参考图程序化重建《魔戒》中的袋底洞、巴拉督尔和瑞文戴尔三个场景,全程通过 OpenRouter 运行,展示了不同模型在 3D 场景生成方面的能力差异。
Claude Code 发布 v2.1.259,新增 managedMcpServers 托管设置供组织向所有用户提供 HTTP/SSE MCP 服务器,新增 --permission-prompts none 支持无人值守 headless 场景下自动拒绝权限请求,并支持 GitLab MR 命令识别。
TechCrunch Disrupt 2026 将推出新的 Real World AI 舞台,聚焦数字与物理世界的交汇及其持续融合。该舞台将包含 Nvidia、机器人与灭绝动物等元素,探讨 AI 在现实世界中的应用。
Ethan Mollick 引述 Prinz 对 AI 系统的法律基准测试结果,称最新模型表现很好,但更便宜、低推理能力的模型表现不佳。其引用的律师案例显示,一份由法律部门大量借助 AI 完成的备忘录格式精美,却在监管审批判断上得出完全错误的结论,还遗漏了两条导致交易被法律禁止的原因。
ProximalHQ 发布了 FrontierSWE v2 超长程编码基准,用于评估 AI 在复杂编码任务上的表现。结果显示 Claude Fable 5.1 在该基准上大幅领先其他模型,展示了其在长程编码任务中的优势。
Boris Cherny 演示 Fable 5.1 让 Slack 中的 Claude Tag 更实用,可从 metrics 电子表格和 Slack 其他数据临时搭建领导层汇报幻灯片,并在继续之前发现一份与数字不符的供应商报告并加以标出。Claude Tag 现已在 Team 和 Enterprise 套餐的 Slack 中提供。
Broadcom 最新季度财报显示,AI 半导体收入达 167 亿美元,同比增长 221%,占总收入约 56%。公司预计 2027 年 AI 半导体收入达 1150 亿美元、2028 年达 2300 亿美元,连续两年翻倍;Q4 指引 AI 收入 217 亿美元,同比增长 236%。
作者提出人类先学单个词再通过组合与经历理解复杂意义,例如从流、星、雨理解流星雨。AI 则先在庞大语料中建立 token 与编号的对应关系,再通过神经网络学习编号间的联系来逼近语言意义。作者认为 AI 语言的这种苍白感从起点就已注定。
arXiv 论文 FM-Bench(Football Management Benchmark)让 15 个前沿模型在 20 个模拟赛季、约 340 到 400 个决策点的环境中管理足球俱乐部,涉及转会、合同、现金和投资,以检验模型的长时程决策能力。
Alexandr Wang 引用 @notjazii 的对比测试并评价 muse spark 1.3 表现相当不错。同一提示词、最高推理档位下,muse spark 1.3 一分钟完成且费用几乎可忽略,而 fable 5.1 用了 70 分钟、花费 $13,凸显了 muse spark 1.3 在效率与成本上的优势。