昨天的主题是"Agent 拿到执行权、机器人学会想清楚再做"(Claude Code 自动模式今日正式生效、世界模型成 WAIC 主旋律)。今天两条线继续外溢:AI 编程从"拼模型"卷到"拼编排与拼价格",具身智能从"秀demo"卷到"靠视频秒学动作 + 靠国标管数据质量"。挑了 5 条,每条附上为什么值得关注。


1. Y Combinator 开源 QM:模型无关的多智能体编排框架,Harness 层再添一子

事件:7 月 31 日,Y Combinator 宣布开源其内部使用的多智能体编排框架 QM(MIT 协议,代码已在 GitHub 的 yc-software 组织公开)。YC 称 QM 是"为公司而非单人设计的多人协作框架",已在自家会计、法务、活动、工程(含 QM 自身的开发)全流程跑起来。其关键设计是模型无关的核心编排循环——同一套 orchestration 可以同时挂在 Pi、OpenCode、Codex 或 Claude Code 之上,自带 Slack 与 Web 界面,云优先。

为什么值得关注:QM 不和下方的 coding agent 抢饭碗,而是坐在它们上面那一层——正是昨天新闻里反复出现的"Harness 层"(记忆、权限、沙箱、编排)。它的开源释放了一个明确信号:工程团队越来越愿意把差异化建在模型之外的编排与治理上,而不是绑死某一家前沿模型。对中小团队而言,这意味着你可以用同一套 QM 调度多家模型,按成本/能力/风险随时换底层,避免被单一供应商锁定。


2. AI 编程价格战白热化:开源大模型集体压价,每百万 token 跌破 0.2 美元

事件:过去三周,编码模型的"成本地板"被连番击穿:7 月 17 日 Moonshot 发布 Kimi K3(2.8T 参数、1M 上下文、开源权重,主攻推理与长程编码);7 月 30 日 OpenAI 将 GPT-5.6 Luna 输入价从 $1.00 砍到 $0.20/M、输出从 $6.00 砍到 $1.20/M(降价 80%);8 月 3 日 DeepSeek 推出 V4-Flash($0.14/M 输入、$0.28/M 输出,基准测试单次成本约 $0.03),同日阿里发布 Qwen3.8-Max(2.4T 参数、1M 上下文、每次请求激活 95B 的 MoE 设计)。与此同时,Cursor 已按"agent 请求消耗 token 是普通提问的十倍"重构了定价。

为什么值得关注:这把昨天"模型与 Agent 正在分离"的趋势又推了一步——买 coding 环境不再等于选一家模型。但价格战的真相是:agentic 工作会巡检仓库、调工具、跑测试、重试、拉起子 agent,单次工程任务的真实成本远高于"每百万 token"标价。对团队而言,真正该看的是"一个完整任务跑完花多少、在哪些管控下跑完",而非单价。开源权重 + 低价,正在把"自托管编码栈"从极客玩具变成财务上站得住的选项。


3. X Square Robot 开源 HOST:看 29 秒视频就能学动作,具身迈向"实时模仿"

事件:X Square Robot 开源了推理时学习框架 HOST,让一台人形机器人观看一段约 29 秒的人类示范视频,即可复现该技能,成功率约 62%。该方法把具身智能从"离线微调"推向"推理时即时模仿"——机器人不需要从头训练,而是在部署现场看一眼就会。

为什么值得关注:这是具身智能里"数据飞轮"思路的轻量化版本。过去教机器人一个新动作,往往要采集大量示范再做离线训练;HOST 把学习搬到了推理时刻,显著降低新技能的上手成本。62% 的零样本复现率虽不完美,却验证了"视频示范 → 即时策略"这条路线的可行性,和昨天 τ0-VLA、VLAW 的"先想后做"形成互补:一个解决"想得周全",一个解决"学得快"。若成功率随数据闭环继续抬升,现场教机器人将成常态。


4. Google 发布 Gemini Robotics 2:首次实现机器人"全身智能控制"

事件:8 月 3 日,谷歌发布 Gemini Robotics 2 模型,首次实现机器人的"全身智能控制"——从视觉理解、任务规划到双臂/双足协调运动由一个统一模型贯通,被业界称为具身"大脑"瓶颈的实质性突破。结合此前 π0.7、τ0-VLA 等 VLA 路线的进展,机器人正从"单臂定点操作"走向"全躯身在开放环境中自主行动"。

为什么值得关注:此前的 VLA 多聚焦"机械臂 + 抓取/摆放"这类局部动作,Gemini Robotics 2 把控制粒度拉到全身协调,意味着模型要同时理解空间、平衡、时序与接触力。这恰好接住昨天新闻里"世界模型 + VLA 融合"的主旋律——当机器人要调动整个身体,它比任何时候都需要在行动前做世界推演与前瞻规划。对产业而言,全身控制是家政、陪护、搬运等通用场景的前提,谷歌下场把标准线又抬高了一截。


5. 越疆发"具身全栖"人形鹿萌 + 工信部数据集质量标准落地:消费级与规范化同步走

事件:8 月 5 日,越疆科技发布全球首款"具身全栖"人形机器人 DOBOT LUMO(高近 1.3 米),依托自研"空弈"具身大模型,支持多模态情绪感知、三维空间理解与主动行动,主打家庭陪伴、教育消费与二次开发场景,可在草地、沙地、鹅卵石等多地形连续行走。同日,工信部批准《具身智能数据集质量要求及评价方法》将于 11 月 1 日实施,从完整性、一致性等八维度规范数据质量,填补行业空白,标志数据集建设由"规模导向"转向"质量导向"。

为什么值得关注:这两条合起来,是具身智能"落地两端一起补"的缩影:一端是消费级人形真正走进家庭(情绪交互、主动陪伴、越用越懂你),另一端是数据有了国家层面的质量红线。前者决定市场天花板,后者决定训练出来的策略靠不靠谱——没有高质量数据,再炫的演示也训不出稳的策略。对从业者而言,"数据集合规 + 消费场景验证"会像 AI 编程的"安全护栏"一样,成为下一阶段具身公司的硬门槛。


快讯

  • Liquid AI 把完整 Agent 搬上手机:发布 LFM2.5-2.6B(26.9 亿参数,占用 <2.5GB),在智能手机上以约 30 token/s 跑通规划、工具调用、多步任务,能力据称追平 4 倍大小的模型,云端成本近零、数据不出设备。
  • 宇树科创板 IPO 进入打新:四足机器人龙头宇树科技启动科创板初步询价,拟募资约 42 亿元、估值约 420 亿元,最快 8 月底登陆,创始人晋级亿万富豪;AgiBot 据称已在其后超越宇树成全球最大人形厂商。
  • 8 月机器人"超级月":8/12–14 第四届上海具身智能机器人产业大会、8/19–23 世界机器人大会(北京,300+ 企业、2000+ 展品)、8/22–26 第二届世界人形机器人运动会(50 赛项)密集排期。
  • Digit v5 走向真实部署:Forbes 报道 Agility Robotics 的人形机器人 Digit v5 正从实验室可控环境转向真实工况,具身落地进入"公开压力测试"阶段。
  • 上半年工业机器人产量 53.8 万套:同比增 28%,手术机器人出口增 330%,深圳协作机器人出货量居全球第一,产业从概念走向业绩兑现。

小结

今天的主线是**"编码栈拆层降价,机器人靠视频秒学 + 靠国标管数"**。

AI 编程这条线,两件事同时发生:一是 Harness 层开源化(YC 的 QM 把编排从模型里抽出来、可换可插),二是 模型价格地板被踩穿(Kimi K3 / GPT-5.6 Luna 降 80% / DeepSeek V4-Flash / Qwen3.8-Max)。二者指向同一个结论——编码智能体的竞争,正从"谁的模型强"彻底转向"谁的编排稳、谁的总任务成本低"

具身智能这条线,HOST 让机器人"看 29 秒就会"、Gemini Robotics 2 打通全身控制、鹿萌进家庭 + 数据集国标落地,说明行业在同时补"学得快来"和"管得住质量"两块短板。这和昨天"世界模型预演"一脉相承——自主系统要先能学、能想、还能被规范

昨天关键词是"给执行权、装预演盘",今天关键词是"拆编排、压价格、视频即学、数据有标"。明天继续。