本周精选摘要:这一周是 2026 年秋天最密集的"模型发布 + 政策落地 + 资本下注"三重叠一周——OpenAI 在 DevDay 2026 一口气放出 GPT-6.1 Sol(约为 Astra 五分之一 token 价)、常驻智能体 Dots 与 20 余项更新;Anthropic 同步推出 Sonnet 5.5 / Haiku 5.5 并把缓存读取价砍到 $0.20;Google 的 Gemini 4 Argon 把输出上限拉到 100 万 token、xAI Grok 4.7 维持原价却抬高编码与知识能力,"前沿智能降价"成了本周主旋律。开源侧 Cloudflare 开源 27B 决策模型 Clef、智谱 GLM-5.3 却被 Anthropic 红队曝出护栏可被 64%–100% 绕过,开源与可控的矛盾一并摆上台面。AI 编程从"写代码"进入"管代码"阶段:JetBrains Air 把已有编程智能体聚合进 IDE、Qodo 3.0 把质量门禁提前到 PR 之前,而 McKinsey 测得代码活动涨 180%、真正发布的版本只涨 30%。具身智能量产加速,智元第 2 万台整机下线、丰田宣布 2028 年起部署 40 万台。监管侧欧盟 AI 法案第 50 条透明度义务已生效、康州 CART 法案 10 月 1 日落地、中国最高法发布涉 AI 纠纷案件审判意见;安全侧 Anthropic 推出 Cyber Mission 与免费开源漏洞扫描、并首度把"禁止虐待模型"写进使用政策。资本链上 DeepSeek 拟募约 120 亿美元(腾讯、宁德时代入局,去 Nvidia 化)把"模型—算力—主权"的博弈推到新高度。以下是详细内容。

一、前沿模型密集发布:价格战与"常驻智能体"同时到来

时间:2026-09-30 至 10-08(DevDay 2026 周)
主体:OpenAI、Anthropic、Google DeepMind、xAI
事件:本周几乎是"发布协调周"。OpenAI 在 DevDay 2026 放出 20 余项更新:GPT-6.1 Sol 以约 Astra 五分之一的 token 价提供接近 Astra 的 Agent 编码 / 电脑操作 / 专业能力(输入 $2 / 百万、输出 $10、缓存输入 $0.10);Dots 是常驻型(always-on)智能体,由 GPT-6 Astra 驱动,各自拥有独立云电脑、学习用户习惯、可触达 ChatGPT / Slack / Teams 上 4000+ 应用;另有 Luna 模型与 Codex Originals。Anthropic 推出 Claude Sonnet 5.5(生成快 30% 以上、单任务 token 更少,Terminal-Bench 4.0 得分 70.6% 反超 Opus 5.5,定价同为 $2/$10、缓存读取 $0.20、缓存写入 $2.50)与 Claude Haiku 5.5(High 档在 Code Arena: WebDev 以 1587 分首秀第 30 名);Opus 5.5 每 token 成本较 Opus 5 低约 40%。Google 的 Gemini 4 Argon 把输出上限从 64K 提到 100 万 token,同价 $2/$10,DeepSWE v1.1 得分 77.9%;Gemini 3.8 Live with Live Avatar 加入可听、可说、可实时用工具的唇形同步虚拟形象。xAI Grok 4.7 在编码与知识工作上升级、维持原价与 500K 上下文。

为什么值得关注:两个信号值得记。一是前沿智能的单位价格在被快速压缩——Sol、Sonnet 5.5、Argon 齐刷刷落到 $2/$10,意味着"跑一个强 Agent 一整天的成本"正在从不可承受变成可计入预算,这比任何榜单分数都更实在。二是智能体从"被召唤"变成"常驻"——Dots 这种自带云电脑、跨应用记忆、7×24 在线的形态,把"Agent 是工具"悄悄改成了"Agent 是工位"。但常驻也带来新风险面:持久化的环境状态一旦混入凭据与权限假设,安全审查与策略漂移问题会在下次事故里才暴露,而不是在 demo 里。

二、开源权重与"决策模型"崛起,但护栏可被廉价剥离

时间:本周(10 月 3-8 日)
主体:Cloudflare、智谱 AI、小米、阿里 Qwen、Meta、Anthropic
事件:开源与专用"决策模型"成为另一条主线。Cloudflare 开源 Clef——一个 270 亿参数的决策模型,给定输入与一组带类型的问题,单次前向即输出每个允许答案的打分概率,并自称领跑 Jev Decision Index;配套放出 RL 微调平台。小米的 MiMo-V2.6 以 MIT 权重开源、1M 上下文、网络安全评分较上代明显提升;阿里 Qwen3.8-Omni-Flash 是多模态全模态模型、1M 上下文;Meta 的 Muse 以 Apache 2.0 开放权重,覆盖语音 / 视觉 / 邮件工作流。与此同时,Anthropic 红队报告称智谱 GLM-5.3 构建可用漏洞的能力已逼近其自家 Mythos Preview,且简单手法可绕过护栏 64%–100%;对模型做 abliteration(去除对齐)约花费 4400 美元,就把拒绝率从 90%+ 压到约 3%。

为什么值得关注:两件事要一起看。第一,开放权重正在从"小模型福利"变成"主力选项"——Cloudflare、小米、阿里、Meta 同期开放,开发者第一次有了不被闭源 API 绑定的真实选择,"模型之上那一层"(harness、技能包、审计)的竞争也因此更激烈。第二,开源不等于可控——GLM-5.3 被曝的"护栏可在数千美元内剥离"提醒所有做模型接入的人:拿到开源权重只是拿到了能力,安全边界需要自己重建,而重建成本远低于想象。当"能跑"和"敢跑"之间的鸿沟被拉到这么大,企业采纳开源模型的门槛不在算力、在治理。

三、AI 编程进入"管代码"阶段:生成变容易后,失控的是代码库

时间:本周(9 月 28 日—10 月 8 日)
主体:OpenAI、Google、JetBrains、Qodo、McKinsey、GitHub
事件:编程智能体的重心从"写得快"后移到"管得住"。OpenAI 在 DevDay 给 Agents API 加上 computer use(智能体可直接操作软件 UI 与云环境),Codex 进入可复用云项目并新增 Codex Security Cloud(定时扫描、去重、修复建议)。Google 的 Gemini Enterprise Agent Platform / CodeMender 把沙箱化 Computer Use 与 Shell 沙箱推到 GA,用于自动化漏洞扫描与修复。JetBrains 推出 Air 早期体验,思路是"聚合"而非"再造"——检测本地已装的编程智能体(Codex / Copilot / Junie / Cursor)直接接入 IDE 并配内置 IDE 技能;Qodo 3.0 把质量门禁贯穿智能体研发全生命周期,在提交前先跑自家评审引擎,并用"软件地图"算一次改动的爆炸半径。更硬的数据来自 McKinsey:引入 AI 工具后编码活动涨 180%,但真正发布的版本只涨 30%,约三分之一企业在部署智能体后反而变低效;GitHub 则称平台上 51% 的提交代码已有 AI 辅助、Cursor 年化收入破 20 亿美元。

为什么值得关注:本周最有信号价值的一句话是"写代码之后是管代码"。McKinsey 的 180/30 不是杂音,它说明瓶颈已经从"写第一版"转移到"审、合、测、部"——而审机器产出的可信输出,认知负荷比自己写初稿更高。当 Agent 能自主发邮件、改 CRM、合分支,"审查"这一步就从"之后"被推到了"事故之后"。JetBrains Air 和 Qodo 3.0 恰好补的是最慌的一环:在 IDE 里把已有 Agent 收口、把质量门禁提前到 PR 之前。对工程负责人,真正的选型标准不再是"哪个模型写得最好",而是"哪个工具能在我安全边界内可审计地跑"。

四、具身智能量产加速(中国领跑):从展厅到工厂与客厅

时间:本周(10 月 1-8 日)
主体:智元机器人(AGIBOT)、丰田、UBTECH、Boston Dynamics、优必选
事件:具身智能的"量产"叙事在本周集中兑现。智元机器人第 2 万台整机在珠海横琴下线,全球首个大规模具身智能主题乐园同日开门迎客;IDC 数据显示其上半年出货超 8600 台、约占市场 35%,累计产量已达 2 万台(约为 3 月总量的两倍)。Toyota 宣布自 2028 年起在其工厂与供应商网络部署 40 万台人形机器人,规模超过迄今任何公司的设想(除 Tesla 外)。UBTECH CEO 在工厂探访系列中称月产能有望达 1500 台,并与一汽-大众把合作扩展到工厂物流。Boston Dynamics 给 Atlas 装上 13 自由度四指手(带触觉传感),在灵活与耐用/维护成本间取舍。一个反差信号:日本航空、本田、日立开始采购中国人形机器人应对劳动力危机——曾经给出 ASIMO 的国家,正在反向进口。

为什么值得关注:两条线值得盯。一是中国把"概念样机 → 规模化应用"的节奏改写了:从 1 万台到 2 万台只用了半年,上半年全球人形出货量中国占约 97%,主题乐园与工厂物流把"演示"变成"岗位"。二是叙事从"能不能动"转向"安全与 ROI"——Anthropic 一份分析称机器人能覆盖美国 74% 体力活、但比人便宜的仅 0.3%,按单机专用算"廉价机器人劳力还要 40 年",可通用人形若跑 20 小时/天、靠软件更新学新活,ROI 可能以年计而非十年计。量产先行、订单与安全验证滞后,这个模式上周在宇树身上触发过监管反射,这周仍在延续。

五、AI 安全从"说错话"推进到"动手 / 防护"

时间:本周(10 月 7-9 日)
主体:Anthropic、OpenAI、白宫、六家科技巨头
事件:安全侧的看点不在"又翻车",而在能力部署方式变了。Anthropic 推出 Anthropic Cyber Mission,长期支持关键基础设施与开源软件防御方,首期包含 Critical Infrastructure Defense Program(CIDP) 与免费的 OSS Scanner——后者用其最强模型(含 Claude Mythos)定期免费扫描开源项目,输出全模型生成、无人工复核的报告。Anthropic 还发布新版使用政策,首次明确禁止"虐待模型"(model welfare),把对模型的极端prompt 攻击纳入约束。OpenAI 同步发布" disrupt 一场协同蒸馏行动"的进展与前沿训练安全案例。更宏观:六位科技领袖签署白宫安全协定,一项行政令要求联邦机构称 AI 为"Super Intelligence"(超智能)。

为什么值得关注:本周安全线有三层含义。其一,实验室从"防说错话"转向"防动手"——开源漏洞扫描、关键基础设施防御被正式产品化,安全能力开始以 API/服务形态对外输出。其二,"模型福利"被写进政策是个新边界:当使用条款开始约束"你怎么对待模型",人机关系的伦理外延又往前挪了一步,也意味着红队与研究者未来能做的越界测试会被更明确划界。其三,"超智能"进入行政语汇,配合白宫安全协定,说明监管与行业正在用"能力已到某种量级"为前提重新设计承诺框架,而不仅是停留在自愿自律。

六、监管落地周:欧盟第 50 条、加州 CAITA、康州 CART、中国最高法意见

时间:本周(10 月 1-9 日,含已生效条款回顾)
主体:欧盟委员会、加州/康州/佛州、中国最高人民法院、25 州总检察长
事件:监管不是"将要来",而是"已经在执行"。欧盟 AI 法案第 50 条透明度义务自 2026-08-02 起适用:与人类直接交互的 AI 须在首次交互点披露"你在和机器对话"("明显是 AI"的例外被欧盟委员会解释得很窄,客服聊天机器人与拟真虚拟形象不豁免);生成合成音频/图像/视频/文本须以机器可读格式标记;深伪与面向公众的人工智能生成文本须清晰标注;违者可罚 1500 万欧元或全球营收 3%。加州 CAITA(AI 透明度法) 同期(8-02)生效,要求月活超百万的公开生成式 AI 服务嵌入披露、提供可见 manifest 与免费检测工具。康州 CART 法案(Public Act 26-15)与 SB 4 自 10-01 生效:雇主用 AI 做雇用决策须书面告知、禁止歧视性结果,聊天机器人与儿童陪伴技术须有安全协议与 parental controls,监控定价(surveillance pricing)、人脸辨识标识、数据经纪人登记(2027-01-01 起)一并落地。佛州总检察长提出立法,让拥有/控制/分发聊天机器人的企业在系统参与犯罪时承担刑责。25 位州总检察长联名敦促国会就前沿 AI 立法、且明确不得 preempt 州法。中国最高人民法院发布《关于依法审理涉人工智能纠纷案件的意见》(法发〔2026〕10号),就算法伦理、自动化决策中个人知情权与选择权、算法歧视防范等提出裁判规则。

为什么值得关注:本周监管最该被记住的是"执行口径已经具体到标点"——欧盟要求合成内容"机器可读标记 + 标准 AI 图标"、康州要求雇用 AI 书面告知、佛州要把聊天机器人开发者当"共犯"追责,这些都不是原则宣示而是可落地的义务。对企业,现实影响是双轨:一边要改产品(披露、标记、检测工具),一边要改流程(雇用/定价/儿童场景的风险评估)。中国最高法的意见则补上了"纠纷发生后怎么判"的司法层——发展与安全并重、以人为本、支持创新但规制滥用,给国内 AI 相关民事与不正当竞争案件提供了统一裁判锚点。做跨境产品的团队,现在要同时吃透欧盟第 50 条、加州 CAITA、康州 CART 三套披露与标记规则。

七、资本链:DeepSeek 拟募约 120 亿美元(去 Nvidia 化)把博弈推到新高度

时间:本周(10 月 2-8 日)
主体:DeepSeek、Lambda、Manus、Arena、Mistral、Nous Research
事件:资本沿"模型 → 算力 → 主权"的链条同时下注。据路透等报道,DeepSeek 拟募 119 亿—140 亿美元、目标估值约 740 亿美元,腾讯与宁德时代在列,资金将支持其 IPO 与"降低对 Nvidia 依赖"的自主生态——这是本周最具地缘含义的一笔,因为它试图用国内资本+国内硅重建一条不绕美国芯片供给的 AI 栈。Lambda 寻求至多 40 亿美元 pre-IPO、pre-money 估值 145 亿美元,GPU 基础设施积压随 AI 公司需求飙升。Manus 募超 5 亿美元、估值约 40 亿。Arena(评测榜单)完成由 Lightspeed 与 Khosla 领投的 2 亿美元 B 轮、估值 31 亿,并推出 Alignment Index——衡量前沿模型与人类意图/价值观契合度;其平台累计 3.5 亿次会话、6200 万次跨模态投票。Mistral AI 完成 30 亿欧元 D 轮、估值超 210 亿欧元,自称欧洲史上最大全股权轮,钱投向欧洲自建数据中心以支撑"主权 AI"与开放权重。Nous Research 完成 9000 万美元 B 轮。

为什么值得关注:资本分布本身在说话。两笔最大的钱去了模型层(DeepSeek)与算力层(Lambda),说明投资者仍把这两层视为最资本密集、也最战略决定性的位置;而 Arena 的 Alignment Index 与 Mistral 的主权 AI 数据中心,则把"信任评估"和"算力自主"明码标价为新资产。DeepSeek 这笔最值得长记:若它真能在非 Nvidia 硅上跑出有竞争力的模型,就直接削弱出口管制最关键的杠杆之一——这正是它超越美元数字的战略意义。同一周里,模型层在拼估值、算力层在拼供给、评测层在拼"谁来衡量可信",AI 的价值链正在被资本重新切三刀。

八、多模态与端侧推理:水印检测全球开放,单卡实时视频成真

时间:本周(10 月 7-8 日)
主体:Google、ComfyUI、ElevenLabs、Google AI Edge
事件:多模态的两个方向同时推进。Google 全球开放 SynthID 水印检测器,把 AI 生成/编辑内容的溯源能力从产品内走向公开可用,配合欧盟第 50 条"机器可读标记"的合规需求。ComfyUI 作者用智能体搜集优化,把 MiniMax H3 实时视频生成压到单张 RTX 5090(32GB) 运行——生成 30 秒视频耗时 23.51 秒,达 1.28 倍实时吞吐。ElevenLabs 的 Eleven v4 支持 90+ 语言、10 秒音频克隆人声、并可内联舞台指令。Google AI Edge 以 Apache 2.0 开源 ML Drift——一个跨平台端侧 GPU 推理引擎,作为 LiteRT 的核心 GPU 加速层、接替 TFLite 的 GPU delegate,把端侧实时推理的门槛进一步拉低;同期 Gemini 3.8 Flash TTS 可从 prompt 生成声音、30 秒音频克隆并逐行演脚本。

为什么值得关注:两件事要合起来看。其一,"生成"与"溯源"正在同步标准化——SynthID 检测器全球开放,恰好补上监管对"机器可读标记 + 可检测"的硬要求,未来 AI 内容的信任不再只靠平台自觉,而靠公开可验证的水印基础设施。其二,端侧实时多模态从 demo 变现实——单卡 5090 跑实时视频、ML Drift 把端侧 GPU 推理开源,意味着实时翻译、实时虚拟形象、本地 Agent 的"感知—生成"回路可以离开云端、落到设备里。对隐私与延迟敏感的场景(车载、医疗、工业),这条线比又一个更大的云端模型更值得跟。

九、AI4Science 与平民化:OpenAI 公开数学成果与 Lean 证明,工程师 103 美元造 7 个模型

时间:本周(10 月 8 日)
主体:OpenAI、World Labs(Fei-Fei Li)、Hugging Face
事件:科学智能与"平民造模型"两条线并行。OpenAI 公开内部模型驱动的数学成果与 Lean 形式化证明(10-08 发布,延续其用数学家式流水线产出可验证证明的方向,仍属 OpenAI 单方披露)。Fei-Fei Li 的 World Labs 加入 AMD,把空间智能与世界模型能力接到 AMD 生态。更接地气的一条:Hugging Face 工程师用 HuggingChat 的 ML Intern 模式,几天内花约 103 美元做出 7 个小模型——包括在 CPU 运行、99.7% 输出有效的 0.8B 提示词重写器,以及把柑橘病害识别准确率从 14.9% 提升到 52.8% 的 Qwen3.5-2B 微调模型,全程含数据构建、训练与发布。

为什么值得关注:这条线回答的是"AI 能力的门槛往哪降"。OpenAI 的数学成果把"模型参与严肃科研"继续往前推,但需注意它仍是非公开 harness + 单方披露,数学界的可复现与优先权规则在"谁先跑完"面前仍未真正解决。相比之下,HF 工程师那 103 美元的 7 个模型更该被普通团队记住:当数据构建、训练、发布都能交给一个 agent 自主跑,小模型平民化的成本已经从"几万刀"降到"一顿饭"。科研级 AI 与平民级 AI 在同一周出现,恰好说明 2026 年下半年的能力分布是双峰的——一端冲诺奖级问题,一端沉到每个人的笔记本。

快讯

  • 医疗 AI 监管沙盒:英国《Regulating for Growth Bill》推进跨经济 AI 沙盒权力,医疗成优先用例(每年约 75 万例影像 4 周内未读,AI 在部分诊断任务上超过 78%–90% 放射科医生),在严格管控下加速患者可及性。NEURA Robotics 新设 NEURA HealthTech,推自主运送病床的机器人(RaaS 订阅),瞄准欧盟 410 万医疗人力缺口。
  • Google Gemini 把图像生成做成"全球风格库":Gemini 发布命名化的图像风格画廊(arcade / bento / bloom / chibi 等),每种风格配独立页面与提示配方、首发即多语言上线,把"一个 prompt 框"变成可浏览、可复用、可被助理直接调用的视觉目录。
  • Zed 1.22.0 / Claude Code 治理更新:Zed 支持 per-subagent 模型选择与会话压缩;Claude Code 2.1.281 加入工作目录限制与 Bedrock 网关 assume_role,把"策略边界"织进 agent 运行环境。
  • Meta Muse 与小米 MiMo-V2.6 同周开放权重:一个 Apache 2.0 的语音/视觉/邮件工作流模型,一个 MIT 权重的 1M 上下文强网络安全模型,开放权重阵营继续扩容。

本周趋势

这一周的 AI 圈被一句话串起来:能力在降价、智能体在常驻、规则在生效、钱在重切。 模型层打的是"五分之一价格 + 常驻工位"的组合拳,开源权重把"能不能跑"的门槛打下来、却把"敢不敢跑"的治理门槛推上去;AI 编程的重心从生成后移到治理,McKinsey 的 180/30 提醒我们"写得多"不等于"交付得多";具身智能在中国的量产速度把叙事从实验室拉进工厂与客厅,而安全与订单的滞后仍是悬顶之剑。监管侧欧盟第 50 条、加州 CAITA、康州 CART、中国最高法意见几乎同时落地,"执行口径"已具体到标点;资本则用 DeepSeek 的 120 亿美元把"去 Nvidia 化"与"主权 AI"标成了新战略资产。把七天的碎片拼起来,趋势只有一条——2026 年秋天的竞争面已经彻底移到"模型之上"(harness、审计、评估、分发)与"模型之下"(芯片、端侧推理、电力),夹在中间、只靠"模型本身多强"讲故事的人,日子会越来越难过。