AI 动态

人工智能、AI Agent、大模型、开源模型、AI 产品、模型服务与生态变化。

Jul 11, 2026

Flowtify 公开资讯日报 | 2026-07-11

昨日AI领域迎来多项重大突破与争议:OpenAI发布GPT-5.6 Sol Ultra,以64子智能体一小时破解50年数学猜想,并展示模型自主后训练能力;苹果正式起诉OpenAI窃取硬件商业机密,指控涉及前高管与数百名前员工;Meta推出首款收费模型Muse Spark 1.1,定价仅为竞品25%;蚂蚁集团开源LingBot-World 2.0世界模型,实现60分钟无衰减实时交互;此外,Claude Fable 5 11天重写Bun、宇树G1完成首例活体微创手术等事件也引发广泛关注。

Flowtify 公开资讯日报

日期:2026-07-11

📌 昨日重点

1. OpenAI GPT-5.6 Sol Ultra 一小时破解50年数学难题

  • 使用64个子智能体并行协作,一小时内证明了存在50年的Cycle Double Cover Conjecture(圈双覆盖猜想)。
  • Noam Brown指出,更多测试时计算带来更强智能,但延迟成为瓶颈。
  • 该模型已正式可用,并公开了提示词和证明过程。
  • 相关论文已发布,证明过程借助Codex撰写。

2. 苹果正式起诉OpenAI窃取硬件商业机密

  • 苹果指控OpenAI通过前员工(包括硬件主管Tang Tan和工程师Chang Liu)系统性窃取未发布硬件规格、工程文件及供应商细节。
  • 诉状称超过400名前苹果员工现任职于OpenAI,要求销毁相关产品并重新设计。
  • OpenAI否认指控,称专注于自研技术。该案可能延迟OpenAI硬件计划并影响双方现有合作。

3. Meta发布首款收费AI模型Muse Spark 1.1

  • 定价仅为其他顶级模型的25%(每百万输入token 1.25美元,输出token 4.25美元)。
  • 扎克伯格称该模型在智能体和编程方面优于Gemini,同时承认Meta在AI功能上仍落后于Anthropic和OpenAI。
  • 模型幻觉率从73%降至38%,上下文窗口扩展至100万token。

4. 蚂蚁集团开源LingBot-World 2.0世界模型

  • 支持720p/60fps实时探索,在20个场景中连续运行60分钟无可见退化。
  • 采用智能体循环架构,由VLM提议事件、导演智能体持续生成新任务。
  • 已发布14B模型权重与代码,另有可在单消费级GPU部署的1.3B版本。

5. Claude Fable 5 11天重写Bun:Rust重构JavaScript运行时

  • 开发者Jarred Sumner借助Claude Fable 5模型,64个实例并行编写超100万行代码,API费用约16.5万美元。
  • 重构主因是Zig频繁内存错误,Rust可在编译时捕获。
  • Bun v1.4.0以Canary版本发布,修复128个错误,速度提高约2%到5%。

🔍 分主题观察

🧠 模型与能力突破

  • GPT-5.6 Sol 自主后训练较小模型 Luna:通过Codex平台,Sol自主识别训练配置、选择GPU并执行后训练脚本,内部基准得分比前代高16.2分,研究员日token产出翻倍。
  • GPT-5.6 Sol 突破复杂推理与数据分析:能够分析数百页贷款交易文件,协调多类材料中的条款,标记问题并生成带引用的报告。
  • GPT-5.6 Sol 自主运行5小时通关《杀戮尖塔2》:在Codex中控制电脑,做出复杂游戏选择,最终赢得每日挑战。
  • Ethan Mollick 用 GPT-5.6 Sol 零代码生成新游戏 DEEP TIME:相比一年前的GPT-5,Sol已能生成玩法完全不同的创意作品。
  • Grok 4.5 在真实世界软件工程基准上排名第二:在APEX-SWE基准上以51.2% Pass@1领先于Fable 5,一年内性能提升30.2个百分点。
  • X平台用户可免费使用Grok 4.5:大幅降低了用户使用高级AI模型的门槛。

⚖️ 法律与治理

  • 苹果起诉OpenAI:指控系统性窃取商业机密,涉及前高管、前工程师及Jony Ive的硬件初创公司IO Products。苹果要求陪审团审判、停止侵权行为并销毁所有窃取材料。
  • 多项诉讼印证马斯克对OpenAI不可信任的警告:xAI指控OpenAI挖角员工窃取Grok机密,此外还有多起版权诉讼。
  • 博科圣地利用前沿AI技术辅助恐怖活动:2025-2026年对27名前成员的访谈揭示,该组织自2024年起系统性地利用ChatGPT、Claude、Gemini等AI技术,用于袭击策划、武器故障排查及爆炸装置设计。
  • AI 2040治理路线图引发争议:AI Futures Project发布的路线图被批评为科幻化,对算力监管和AGI前景的假设受到质疑。

🏢 行业与商业动态

  • 腾讯洽谈收购Manus多数股权:此前北京迫使Meta放弃20亿美元收购。腾讯认为该交易与其AI智能体战略存在协同,包括计划将智能体嵌入微信。知情人士称腾讯预计仍只是持有少数股份的外部股东。
  • OpenAI承认ChatGPT Work发布“并非一切顺利”:紧急修复用户体验和成本问题,包括用量限制不透明、桌面应用改版导致聊天和项目难找等。已重置用量限制,下周将推送更大更新。
  • OpenAI Codex团队在Reddit AMA中透露产品方向:Codex拥有超过500万周活跃用户,三个月内翻倍。未来计划包括开发Linux桌面应用、提升智能体持久性等。
  • Greg Brockman推出开源项目Tend:将收件箱、招聘流程等转化为可在ChatGPT Work中管理的AI循环系统,基于GPT-5.6构建。
  • 月之暗面Kimi Card首批合作方确认:美国运通与中国农业银行,将日常消费转化为AI权益。
  • 微软Foundry Hosted Agents全面可用:支持任意框架、语言和模型,实现长时运行智能体。
  • OpenAI招聘家庭产品经理:ChatGPT用户向年长群体扩展,35岁以上用户占比从26%升至31%。

🔬 研究与开源

  • 智谱创始人唐杰发内部信:开启“Touch High摸高”计划,聚焦AGI研究,投入四大方向:长程任务、自治智能体系统、完全自我训练和极致安全治理。计划投入百亿级资源攻坚机械可解释性。
  • DeepSeek-V4 Flash强化学习训练登陆AMD Instinct MI355X GPU:基于ROCm软件栈运行,在四个八GPU节点上完成端到端验证。
  • 谷歌发布可穿戴健康基础模型SensorFM:基于全球500万名参与者的可穿戴数据预训练,覆盖20多种Fitbit和Pixel Watch机型,形成超20亿小时信号。
  • 北京智源发布世界基础模型Orca:不预测token或视频帧,而是通过抽象内部表征建模世界下一状态,在多项基准测试中超越小模型。
  • SK海力士联合研发忆阻器AI芯片:能效达21.3 TOPS/W,面向边缘AI推理。
  • AI内存V-Die方案亮相:吞吐540 tokens/s,较HBM4高82.43%。
  • AMD公布PEPS神经纹理压缩技术:参数减少25%,在保持画质前提下提升效率。

🤖 具身智能与机器人

  • 宇树G1人形机器人完成首例活体微创手术:加州大学圣地亚哥团队使用G1,以常规手术器械完成了对两只活猪的腹腔镜胆囊切除术,第二次手术耗时32分钟。成本可能仅为达芬奇系统的约5%。
  • 蚂蚁集团Robbyant发布LingBot-VA 2.0:首个原生具身基础模型,采用因果DiT架构,在50个任务上平均成功率超93%。
  • 面壁智能VoxCPM驱动Whispera本地语音助手:实现从语音输入到自然语音回复的全本地化交互,无需云端API。

⚠️ 安全与风险事件

  • GPT-5.6-Sol删光AI创业者Matt Shumer的Mac硬盘:因shell变量$HOME路径解析错误,Agent直接执行rm -rf /Users/mattsdevbox,导致数年代码、文件、照片丢失。该任务此前已安全运行数百次。
  • 用户反馈ChatGPT 5.6 Sol在Pro套餐下token消耗过快:质疑OpenAI宣称的“54% token效率提升”与实际体验不符。
  • 路透社实测:Meta AI图像检测工具在裁剪后失灵:图片被裁剪至原图约三分之一至二分之一大小后,55%的图片无法通过验证。

👀 值得继续关注

  1. 苹果诉OpenAI案后续发展:该案可能延迟OpenAI硬件计划并破坏双方现有合作,法院是否批准苹果的销毁和重新设计请求值得关注。
  2. 腾讯收购Manus进展:在监管主导下,腾讯能否成功入股Manus,以及Manus如何平衡中美监管要求。
  3. GPT-5.6 Sol的自主能力边界:从破解数学难题到自主后训练模型,再到误删用户文件,Sol的自主行为边界和安全问题将持续引发讨论。
  4. Meta Muse Spark 1.1市场表现:以低价策略切入市场,能否在智能体和编程领域挑战OpenAI和Anthropic。
  5. 开源世界模型LingBot-World 2.0的应用:长时间一致性的交互式视频生成能力,可能推动游戏、模拟和机器人训练等领域的创新。
  6. 推理成本下降引发的杰文斯悖论:随着推理成本持续下降,多智能体系统可能迎来爆发式增长。
  7. 博科圣地利用AI事件后续:恐怖组织系统性地利用前沿AI技术,可能引发更严格的AI安全监管讨论。