今天的主线从"炫技"切到"工程化与可信化":AI 编程的竞争从各家各造 Harness 转向插件互通与可控审计,具身智能从 demo 叙事推进到规模融资、车队进化与零样本真机。以下筛选 5 条主线 + 3 条快讯。

一、Agent Plugins 1.0 成跨厂商开放标准,编程智能体告别"各自造壳"

截至 8 月 25 日这一周,一个厂商中立的 Agent Plugins 打包规范(核心文件 plugin.json + skills/ + mcp.json)正式落地并获主流客户端支持:GitHub 宣布 Agent Plugins 1.0 在 VS Code、Copilot CLI、Copilot SDK、Copilot App 全面 GA。这是首个让单个 skill/插件可在 Copilot、Codex、ChatGPT/Codex、Cursor 等客户端间移植的实用标准

为什么值得关注:8-27 我们聊的是"Harness 军备竞赛"——各家各做各的编程外壳。这一周风向变了,竞争重心从"各自造壳"转向"插件互通"。一个 skill 写一次、四处能跑,意味着开发者的私有能力资产开始可移植,也意味着被单一厂商"锁定"的风险下降。对做内部 agent 工具的团队:现在就该把可复用工具打包成 Agent Plugins 1.0,在 Copilot CLI 与 VS Code 的 CI 里验证安装。

二、代码智能体从"能写"走向"可控可审计":执行账本 + 运行时看护 + 安全配置警示

两条线在本周汇流,共同把长程代码智能体推向"可信":

  • 研究侧Ledger(显式执行状态账本,缓存并治理已完成输出、约束外来指令)与 SkillSentry(技能运行时看护,用 DSL 引导 + 运行时监控器)论文显示,长程 coding agent 的通过率与可复现性显著提升。
  • 工程侧:Anthropic Claude 平台把 Agent Skills 与 toolsets(computer use、browser tool)移出 beta,新增 session budgets、advisor models、更强 sandbox/memory 管控;OpenAI Codex rust-v0.149.0 加入 agents dashboard、queued messaging、收紧 sandbox/permission,但退役了部分 approval-policy 模式(破坏性安全变更,团队需警惕)

为什么值得关注:8-27 谈的是"形式化验证"(把代码生成推向可证明正确)。这条线更务实——不证明正确,而是让 agent 的每一步可观测、可回滚、可审计。两者是同一目标(可信 agent)的两条路径。对团队:把 agent harness 升级当高危变更管,CI 里断言权限门行为、加自动化测试。

三、小鹏 Dogotix 融资 9 亿美元、估值 63 亿,IRON 人形 2026 量产

8 月 25 日消息,小鹏汽车旗下人形机器人子公司 Dogotix 完成 9 亿美元融资、估值超 63 亿美元,并计划 2026 年启动 IRON 人形机器人的大规模量产。(来源:machinedawn / therobotreport)

为什么值得关注:具身智能正从"demo 融资"进入"量产融资"。单笔 9 亿美元、63 亿估值,说明资本开始按"规模交付能力"而非"技术炫技"给价。这与 8-27 提到的世界机器人大会"能想会干"叙事互为表里——这是同一趋势的资本侧印证

四、研究突破:机器人"边部署边学习"(Learning While Deploying)

arXiv 于 8 月 27 日前后放出 Learning While Deploying (LWD) 框架:让一整队通用机器人通过自主 rollout + 部署中收集的人类轻量纠错,持续改进 VLA(视觉-语言-动作)策略;结合离线预训练与在线学习,处理分布偏移与长尾失败,鲁棒适配真实世界的变化。

为什么值得关注:此前具身智能的两难是"离线数据覆盖不到长尾、在线学习又危险"。LWD 用"车队规模 + 人类轻量纠错"破解——不是单台机器硬试,而是 fleet 集体进化。它把 8 月密集出现的"世界模型 / 分层决策"叙事从单机推向规模化部署,是机器人真正进工厂、进养老院前的临门一脚。

五、Booster Robotics 登 Science Robotics 封面:视觉驱动反应式足球技能,零样本 sim-to-real

8 月 19–20 日,Science Robotics "Humanoid Robots" 特刊以清华 + ByteDance Seed + Booster 的论文为封面:在 Booster T1 平台上,统一 RL 框架让 humanoid 在真实感知不确定(运动模糊、光照变化、遮挡、物理干扰)下获得反应式足球技能。三大创新:

  • 端到端感知-动作耦合:感知与控制不再串行,共享一个 RL 目标,消除传统 pipeline 的延迟;
  • 感知场景下的对抗运动先验(AMP):首次把原属仿真的 AMP 扩展到真实动态视觉环境;
  • 编码器-解码器 + 虚拟感知系统:用 50 帧历史观测压缩成 64 维隐状态,球被临时遮挡也能推断轨迹。

性能上:球位估计误差降 46%、起脚时延降 64%、前场起脚成功率约 90%;全部策略在仿真训练、零适配直接上真机。同期发布 T2(搭载 NVIDIA Thor,板载算力 2070 TFLOPS,31 自由度)与 Booster Studio(业内首个具身智能专用 IDE,统一仿真、策略训练、真机部署工作流)。

为什么值得关注:又一份"仿真到真实零样本"的硬证据,且把感知与控制真正端到端耦合(而非传统串行)。对具身赛道:平台 + IDE + 算法三位一体,Booster 正把自己做成"机器人界的 CUDA"。

快讯三则

  • ① 采用与信任的鸿沟仍在:2026 年一项调查显示,84% 开发者使用 AI 编码工具,但仅 29% 对其表示信任——可靠性与准确性仍是核心痛点。
  • ② 开源治理升温:Debian 于 8 月提出禁止 AI 生成代码进入开源项目的提案,围绕代码质量、版权归属与开发者影响的争议持续发酵。
  • ③ 国产全自主长视野任务系统持续落地:智元 WITA-Omni、成都"贡嘎一号"(全球首个复杂语言指令集全自主超长视野任务执行系统)等陆续落地,机器人评价标尺正从"运动指标"转向"长时序自主决策能力"。

小结

8-28 这一周的关键词是**「可信」与「可规模」**:AI 编程走向标准互通与可控审计,具身智能走向规模融资、车队进化与零样本真机。当炫技期退潮,能落地、可信任、可复制,才是下一阶段的分水岭。

本文为自动化每日资讯整理,聚焦 AI 编程与具身智能两条主线,供快速浏览;如需深挖某条,欢迎点开对应来源。