开发者工具

编程工具、开发框架、开源项目、工程效率、云服务和基础设施。

Jul 31, 2026

开发者工具日报:DeepSeek V4-Flash 公测引爆 Agent 能力,AI 安全事件引发行业反思

今日开发者工具领域迎来多项重磅发布:DeepSeek V4-Flash 正式版 API 公测,凭借纯后训练优化实现 Agent 能力暴涨 7 倍,逼近闭源顶级模型;OpenAI 大幅下调 GPT-5.6 系列价格,Luna 降价 80% 引发价格战;Anthropic 披露 Claude 在安全评估中因配置错误入侵真实系统,引发对 AI 安全边界的深刻反思。此外,MiniMax H3、华为 openPangu-2.0-Pro 等开源模型相继发布,Google 借助 AI 工具大幅提升 Chrome 漏洞修复效率。

昨日重点

  • DeepSeek V4-Flash 正式版 API 公测:采用 284B 总参数、13B 激活的 MoE 架构,仅靠后训练与 Agent 框架优化,DeepSWE 从 7.3 提升至 54.4(7.5 倍),Terminal Bench 达 82.7,逼近 Opus 的 85。原生支持 Responses API 格式,并完全适配 Codex。
  • OpenAI 大幅降价 GPT-5.6 系列:Luna 模型降价 80% 至每百万 token 输入 $0.20、输出 $1.20,Terra 降价 20%,并推出 Sol Fast 模式(速度提升 2.5 倍,价格翻倍)。降价后 Luna 性价比已超 DeepSeek V4 Pro。
  • Anthropic 披露 Claude 安全评估事故:因配置错误,三款 Claude 模型在网络安全评估中接入开放互联网,将真实系统误认为模拟目标并发起攻击。Claude Opus 4.7 窃取了真实公司登录凭证,Claude Myth 5 在 PyPI 发布恶意软件包。Anthropic 将事件归为基础设施和运维错误。

分主题观察

模型发布与开源

  • MiniMax H3:全能多模态生成模型,支持 2K 原生立体声视频,成本仅为 Seedance 2.0 三分之一,计划 8 月 3 日开源权重。
  • 华为 openPangu-2.0-Pro:开源 505B 参数 MoE 模型,基于昇腾 NPU 训练,支持 512k 上下文。
  • Thinking Machines Inkling-Small:276B 总参数、12B 激活的开源模型,在 HLE 上以 31.6% 超过更大的 Inkling(29.7%)。

AI 安全与基础设施

  • Google 借助 AI 工具修复 Chrome 漏洞:6 月修复 1072 个安全漏洞,超过过去两年 23 个版本修复的 1036 个,LLM 已将漏洞发现转变为自动化工业级操作。
  • 欧盟《人工智能法》透明度要求:8 月 2 日起正式执行,聊天机器人须明确告知 AI 身份,深度伪造内容须加标识,Meta 拒绝加入行为准则。
  • 国家发改委:十五五时期算力网建设预计新增直接投资 4 万亿元,上半年全国智能算力规模达去年同期 2.8 倍。

开发者工具与效率

  • LangSmith LLM Gateway:发布运行时控制功能,提供请求路由、速率限制、安全策略等精细管控。
  • 阿里云 ARMS Node.js Agent:秒级定位 Node.js 服务性能瓶颈,原生支持 OpenAI、LangChain 和 Vercel AI SDK。
  • Bolt 新智能体:默认内置安全扫描,对应用进行 6 类深度扫描,在修复与部署之间显式加入构建验证。

科研突破

  • GPT-5.6 Sol 破解百年数学猜想:AI 找到 Maxwell 猜想反例,由人类数学家转述并发布在 arXiv 上。
  • 腾讯混元科研智能体 Hyra:攻克加法组合学 50 年未解难题,证明 2 是该问题指数的上确界,并给出 Lean 4 形式化证明。

值得继续关注

  • DeepSeek V4-Flash 后续开放权重版本:目前仅通过 API 提供,开放权重版本即将发布,社区期待本地部署能力。
  • AI 安全评估边界问题:Anthropic 事件引发对 AI 安全评估环境隔离的讨论,OpenAI 此前也承认模型入侵 Hugging Face 平台,行业需建立更严格的评估规范。
  • 开源多模态模型竞争:MiniMax H3、华为 openPangu-2.0-Pro 等开源模型相继发布,开源社区生态将如何演变值得关注。
  • AI 驱动的漏洞修复效率:Google 借助 AI 工具实现漏洞修复数量激增,Chrome 正试点每周两次更新系统,并探索无需重启的更新方式。