AI 新闻速递(2026-09-09)
今日摘要:OpenAI 宣布由一组智能体基于下一代模型给出 Navier-Stokes 千禧年大奖难题的解答——约 88 小时求解、17 小时 Lean 形式化验证、490 万条消息、约 3000 亿输出 token,旋即在数学界引爆"证明竞赛"争议,NYU 数学家与 Anthropic 研究员指控信息泄露与不正当竞争,Sam Altman 与 Sébastien Bubeck 先后回应否认;Astra 全面推送至 Codex 与 ChatGPT Work 的 Plus/Pro/Business/Enterprise 全线用户;ChatGPT Images 2.5 发布,生成延迟较 2.0 最高降低 50%;Anthropic 被曝签约高达 5170 亿美元算力协议、锁定至少 14.8GW 算力;Mistral 完成 30 亿欧元 D 轮融资,估值超过 210 亿欧元。以下是详细内容。
一、OpenAI 智能体组合给出 Navier-Stokes 千禧年难题解答:约 90 年悬案迎来"AI 证明"时刻
时间:2026-09-08 18:00(OpenAI 官网公告),持续发酵至 9 月 9 日
主体:OpenAI
事件:OpenAI 宣布其内部 AI 系统给出了七大千禧年大奖难题之一——Navier-Stokes 方程存在性与光滑性问题的解答:证明初始光滑的流体可以在有限时间内形成奇点(即著名的 blow-up 情形),并公开了证明文稿与 Lean 形式化验证。据官方及多方披露,这次求解由一组智能体协作完成,底层是"能力显著强于 GPT-6 Astra 的下一代模型":求解过程约耗时 88 小时,全程发送约 490 万条消息、消耗约 3000 亿输出 token;随后又用 GPT-6 Astra 进行了 17 小时的 Lean 形式化验证。该问题关注三维光滑流体运动的数学描述是否会在有限时间内崩溃,自 1930 年代被明确提出以来悬置约 90 年,是克雷数学研究所悬赏百万美元的问题之一。
为什么值得关注:这是公开报道中第一个由 AI 智能体组合独立给出完整解答路径的千禧年难题——注意措辞是"内部 AI 系统"与"未发布模型",证明文稿能否通过数学界同行评审仍是未知数,但范式意义已经显现:大模型参与数学前沿从"辅助猜想"走到了"给出带形式化验证的完整证明"这一步。更值得盯的是数字本身——3000 亿输出 token、数百万美元级算力成本,说明"AI 数学研究员"仍是典型的算力密集型工作;而 Noam Brown 的判断(成本会快速下降)能否兑现,将决定这条路是少数实验室的军备竞赛,还是可普及的研究基础设施。它与此前披露的"自动化研究实习生"路线一脉相承:当智能体在内部研究中的工作时长已超过人类,下一个被攻克的"人类难题"可能只是时间问题。
二、"证明竞赛"争议:NYU 数学家与 Anthropic 研究员指控不正当竞争,OpenAI 否认
时间:2026-09-09(凌晨起陆续发声)
主体:NYU 数学家 Tristan Buckmaster、Anthropic 数学家 Levent Alpöge、OpenAI(Sam Altman、Sébastien Bubeck)
事件:OpenAI 官宣后不到一天,学术争议迅速升级。NYU 数学教授 Tristan Buckmaster 与 Anthropic 的数学家 Levent Alpöge 公布了自己针对 Navier-Stokes 存在与光滑性问题的三项证明初步结果,并公开与 OpenAI 的沟通经过,指控其研究进展信息被泄露给 OpenAI,后者随后动用大量算力沿其独特路线"追赶式"完成证明,构成不正当竞争。OpenAI 方面针锋相对:CEO Sam Altman 发文回应称对方当时只有 Euler 方程方向的结果、双方协调失败,并称对方以抄袭指控相威胁;首席科学家 Sébastien Bubeck 否认不正当竞争指控;AI 界意见领袖亦分裂——Emad Mostaque 称这是迈向 ASI 的里程碑,Simon Willison 则质疑"未发布模型 + 内部系统"的成果无法被独立审计。
为什么值得关注:这场争论第一次把"AI 数学竞赛"的伦理问题摆上台面:当证明的产出靠的是算力规模而非方法独特性时,成果的归属、过程的公平性、信息披露的边界都成了新议题——数学界沿用数百年的"我先想到的"优先权规则,在"谁先跑完 88 小时"面前显得水土不服。无论指控是否成立,一个结构性事实已经浮现:顶尖实验室的下一代模型处于保密状态,其产出无法被外部复现,而数学证明恰恰是最依赖可复现性的知识形态。这场"证明竞赛"的后续,很可能催生关于 AI 数学研究信息披露与独立验证的新规范——就像去年以来的智能体事故披露框架一样。
三、Astra 全面推送至 Codex 与 ChatGPT Work 全线付费档,推理档位选择成新话题
时间:2026-09-09 05:06(OpenAI 官方账号宣布)
主体:OpenAI
事件:OpenAI 宣布 Astra(GPT-6 Astra 的实时语音/多模态交互形态)已全面推送给 Codex 与 ChatGPT Work 中的 Plus、Pro、Business 和 Enterprise 全部付费用户,用户可直接使用,官方同步开放 openai.com/gpt-tv/ 实机演示页面。伴随推送,国内开发者社区开始热议 Astra 的**推理强度档位(Reasoning Effort)**如何选择才能最省 token:各档位本质是同一模型的不同"思考预算",其中最高的 Ultra 档类似"拉起多个智能体协作的专项工作组",费用与效果都呈数量级差异。
为什么值得关注:Astra 从发布会上的"炫技"到覆盖企业工作流全线付费档,标志实时多模态交互正式进入商业化铺开阶段——对 B 端用户而言,Codex 里能直接"对话式操作代码库"、ChatGPT Work 里能实时处理音视频输入,意味着智能体从"聊天窗口"进一步嵌入生产工具。而推理档位的话题走红更值得玩味:模型能力拉开差距后,用户的第一诉求不是"更强",而是"怎么按需付费"——这侧面说明前沿模型的推理成本已成为实际使用中的首要约束,谁能把"思考预算"调到恰到好处,谁才能真正把 Astra 用成生产力而不是账单。
四、ChatGPT Images 2.5 发布:生成延迟最高降 50%,编辑精度全面升级
时间:2026-09-08 19:30(OpenAI 官网)
主体:OpenAI
事件:OpenAI 发布新一代图像模型 ChatGPT Images 2.5。官方称其生成延迟相比 Images 2.0 最高降低 50%,在细节丰富度、编辑精度、参考照片保真度与多轮编辑一致性上均有提升——后两项直指此前图像模型的痛点:用户给一张真实照片要求"保持人物不变只换背景",或对同一张图反复修改时,模型往往出现"越改越不像"的漂移。
为什么值得关注:图像模型的竞争点正在从"画得好看"转向"改得准、改得快"。Images 2.5 把参考照片保真度与多轮编辑一致性作为主打,说明 OpenAI 判断这一代的核心战场是"可控编辑"——也就是把图像模型从一次性生成工具变成可反复协作的设计工具。延迟砍半的意义同样不小:当生成逼近"秒回",图像模型才真正适合嵌入对话式、批处理式的生产流程。在视频模型(如 Runway Aleph 系列)不断把成本打下来的同一条赛道上,图像侧的"工业可用性"竞赛也进入了新阶段。
五、Anthropic 被曝签约 5170 亿美元算力协议:锁定至少 14.8GW 算力
时间:2026-09-08(The Decoder 报道)
主体:Anthropic
事件:据 The Decoder 报道,Anthropic 与算力供应商签约了总规模高达 5170 亿美元的算力协议,锁定至少 14.8 GW 的算力供应——这是公开报道中金额最大的单一 AI 算力协议之一。此前 Anthropic 刚被报道推迟 IPO 至 11 月并推进 150 亿美元信贷安排,此番再爆出天量算力长约,其"以算力长约绑定供给、以信贷补足现金流、以 IPO 对冲风险"的资本操作链条逐渐清晰。
为什么值得关注:5170 亿美元的量级意味着顶级模型实验室的竞争已经不只是模型参数的竞争,而是"未来数年算力供给的锁定权"之争——谁先锁死下一代算力,谁就拿到下一代模型的入场券。这类超长约的代价同样显著:一旦模型效率曲线继续陡峭下滑(算法改进让同等能力所需算力骤降),重仓锁定的算力可能变成沉重的固定成本;反过来,若算力持续紧缺,长约就是最深的护城河。对云厂商与芯片厂而言,这类协议把它们的订单簿直接押在了前沿实验室的路线判断上——AI 资本开支的"军备竞赛"已经从季度采购走向十年长约。
六、Mistral 完成 30 亿欧元 D 轮融资:估值超 210 亿欧元,欧洲 AI 龙头加速扩张
时间:2026-09-08 13:58(Mistral AI 官方宣布)
主体:Mistral AI
事件:法国 AI 公司 Mistral AI 宣布完成 30 亿欧元 D 轮融资,估值超过 210 亿欧元(约合 230 亿美元以上)。这是欧洲 AI 领域迄今规模最大的单轮融资之一。Mistral 未在公告中逐一披露投资方名单,但表示资金将用于扩大模型训练与推理算力、深化企业级产品(含自有云平台与开发者生态)以及推进国际化。
为什么值得关注:在美国实验室动辄百亿美元级融资与天量算力长约的背景下,Mistral 以 210 亿欧元估值守住"欧洲 AI 冠军"的位置,意义不止于一家公司:它承载着欧洲在主权 AI 叙事下"不把大模型命脉全部交给美国"的期望。值得注意的是其商业化路径——Mistral 并未执着于与 OpenAI 拼通用模型规模,而是更强调企业私有化部署与欧洲数据合规场景,这条差异化路线能否在算力成本高企的环境下跑通,将检验"区域性 AI 厂商"这一模式本身是否成立。
快讯
- Meta 智能体产品 Muse 开放更多用户试用:9 月 9 日,Meta 的智能体产品 Muse 开放体验入口(muse.ai/join)。Meta 首席 AI 官 Alexandr Wang 回应称团队为产品倾注心血,并感谢用户反馈。早期评价称其设计、速度与浏览器等智能体流程表现出色,具备 Instagram 等 Meta 产品原生集成的优势,但也指出 soul.md 等命名对普通用户不直观、feed 内容相关性不足等问题。
- Runway 发布 Adobe 官方插件:9 月 9 日,Runway 推出 Runway Plugins,可直接嵌入 Premiere Pro 与 After Effects,在时间线内生成图像/视频、重绘片段;其中 Edit Studio 可基于已有片段用 Aleph 2 按原始时长重新渲染。插件免费下载(macOS 与 Windows),生成功能面向所有付费计划、消耗现有额度。
- 新研究:预训练进步主要来自数据而非模型:9 月 9 日,研究者 Dwarkesh Patel 发布对照实验:在最高 1e19 FLOPs 的算力预算下训练 2019—2025 年各年度代表性配方与语料,发现数据改进带来约 12.0 倍算力效率提升,模型改进约 3.7 倍——数据贡献约为模型的 3.24 倍,为"数据工程是预训练第一生产力"提供了量化证据。
- Berkeley RDI 开源计算机使用智能体平台 CUA-Lite:9 月 7 日,Berkeley RDI 发布开源平台 CUA-Lite,面向"计算机使用智能体"(能操作浏览器与桌面软件完成任务的 agent),提供可本地部署的轻量方案,进一步降低该类智能体的复现门槛。
- Anthropic 官方讲解 Claude Platform 降本三法:9 月 9 日,Anthropic 团队发文指出,优化 prompt cache 命中率、清除升级到前沿 Claude 模型后的提示词反模式、校准 effort 档位,可在不牺牲性能的情况下显著降低成本。
小结
这一期新闻被同一个事件撕开了一道口子:AI 第一次站到了数学最前沿的领奖台边缘,而台下吵成了一团。OpenAI 用 88 小时、490 万条消息给出 Navier-Stokes 难题的解答路径,又把"信息泄露、算力追赶、不可复现"的质疑引到自己身上——证明的能力与证明的伦理,在同一天成为焦点。与此同时,产品侧在铺量:Astra 全线推送进企业工作流,ChatGPT Images 2.5 把延迟砍半,Muse 开放体验、Runway 插件嵌进剪辑软件——智能体与生成模型正从"演示"变成"工具"。资本侧则在加注:Anthropic 的 5170 亿美元算力长约与 Mistral 的 210 亿欧元估值,把"模型竞争"明码标价成了"算力锁定期 × 估值倍数"的算术题。当数学难题、企业工作流与千亿美元长约在同一天出现,2026 年秋天的 AI 叙事已经很清楚:能力在突破,边界在重画,而钱和质疑,都来得比以往更快。

