昨天的关键词是"大会实景、国产 VLA 开源、自主交付 GA、Agent 接生产库、效率军备赛"。今天两条线各自往前挪了一格:AI 编程从"工具能力比拼"拐向"产品封装与入口之争"——零配置多智能体、单模型自适应快慢思考、把屏幕当最大接口;具身智能则从"本体与模型"拐向"大脑自进化 + 硬件价格拐点 + 制度基础设施"。挑了 5 条,每条附上为什么值得关注。


1. AI 编程 | Grok Bot 走红硅谷:零配置 + 云端虚拟机 + 多智能体原生协同,被称"又一个 Claude Code 时刻"

事件:xAI 推出的 Grok Bot 近日在硅谷引发热议。投资人 Gavin Baker 在 X 上称其为"AI 的又一个 Claude Code 时刻",自述个人 AI 使用量因此增长约 100 倍,并举例:在 Grok Bot 里从零构建一个播客摘要器只花了约 15 秒。产品设计的三个关键词很清楚:极致零配置(不用选模型、不调参数、不配本地环境,打开即用)、强制云端虚拟机(每个 Bot 在云上独立运行,可 7×24 小时后台执行)、多智能体原生协同(Bot 之间自动传递上下文、接力完成任务)。定价方面,个人订阅约 200 美元/月,团队席位约 120 美元/月。连续创业者 Andrew Wilkinson 表示用完立刻关掉了手上另外两个 Agent 工具。质疑声也集中:聊天式界面不够严肃、底层模型未见领先、Token 消耗与成本偏高。

为什么值得关注:这条的价值不在"又一个 Agent",而在竞争焦点的位移——从"模型能不能做"变成"产品替不替用户做决定"。过去一年编码 Agent 的门槛几乎都花在配置上:选模型、配 MCP、装依赖、调权限。Grok Bot 走的是"苹果式封装":把所有技术选择替用户做掉,代价是丧失可控性和绑定单一模型。这恰好是当下 Agent 产品的核心张力——可控性 vs 上手成本。对做工具的团队,这条提示:用户抱怨的往往不是模型不够聪明,而是"我还没跑起来就先被环境劝退了";对用户,选型时要问清楚:我要的是能长期编排的工作流,还是 15 秒就见效的一次性产出?


2. AI 编程 | DeepSeek V3.1 发布:一个权重两种思考模式,SWE-bench Verified 约 66%、TerminalBench 约 31.3%

事件:8 月 20 日晚,DeepSeek 正式发布 V3.1,官方定位是"迈向 Agent 时代的第一步"。核心变化是把过去 V3(快答)与 R1(深度推理)拆成两个模型的能力整合进同一套权重:非思考模式对应 deepseek-chat,思考模式对应 deepseek-reasoner,App 内一键切换,API 同时提供 Anthropic 兼容接口。方向性数据:SWE-bench Verified 约 66%(R1-0528 约 44.6%),命令行任务 TerminalBench 约 31.3%(R1-0528 约 5.7%);思考模式下输出 token 减少约 20%–50%,推理表现与 R1-0528 相当。上下文统一扩到 128K,新增 strict Function Calling(Beta)。

为什么值得关注:对 Agent 工程来说,这是"少了一层调度"的实质简化。过去典型做法是手工路由:简单任务丢快模型、复杂任务丢慢模型,再自己写规则判断该走哪条——规则一旦写错,要么烧钱要么答得浅。V3.1 把这层判断收进模型内部,意味着多步工具调用、长链路任务的编排复杂度直接下降一个层级。更值得盯的是 TerminalBench 从 5.7% 跳到 31.3%:命令行是 Agent 真正"动手"的地方(装依赖、跑测试、读报错),这个分数的量级变化,比通用榜单排名更能说明它离"能干活"近了多少。


3. AI 编程 | 阿里 Qwen-UI-Agent:不改造世界,先学会用世界本来的样子

事件:8 月 20 日,阿里千问发布面向真实设备的 GUI 智能体基座模型 Qwen-UI-Agent,覆盖手机、PC、网页浏览器与深度搜索四类环境,可模拟人类点击、输入、滑动,直接操作没有开放 API 的传统软件。公布的基准成绩:移动端 MobileWorld 82.1%、真机基准 MobileWorld-Real 92.2%、AndroidDaily 97.5%;PC 端 OSWorld-Verified 79.5%;网页端 WebArena 73.6%;界面元素定位 ScreenSpot-Pro 81.5%。训练环境覆盖 100 多台真实手机、150 多款应用,并自建 400 多个任务的真机评测基准。安全设计上,高风险请求直接拒绝;涉及支付、删文件、隐私授权等敏感操作会停在最后一步等用户确认

为什么值得关注:过去一年 Agent 扩能力主要靠 MCP、CLI 和 API,但现实里绝大多数软件根本没有可调用的接口——尤其是企业内部的老系统、单机工具、行业软件。"把屏幕当成最大接口"是一条绕过生态改造的路径:不要求世界为 Agent 让路,而是让 Agent 学会人类那套操作。真机基准 92.2% 这个数字尤其关键,因为 GUI Agent 最容易在仿真里刷高分、到真机上被弹窗、加载延迟、分辨率差异打回原形。如果这条路跑通,Agent 会从"工具调用者"变成"数字设备上的通用执行器",RPA、办公自动化、手机助手都要重估边界。那个"敏感操作停在最后一步"的设计也值得抄——自动化的可用性上限,常常取决于它在哪里主动停下来


4. 具身智能 | 宇树王兴兴首提"物理 AI 机器人自进化",同日发 7 轴仿生机械臂 R1:9900 元起

事件:8 月 20 日,在 2026 世界机器人大会上,宇树科技董事长兼 CTO 王兴兴首次公开阐释 "物理 AI 机器人自进化":依托前沿大模型,人只设定规则、经验约束与工具边界,由模型自主检索前沿论文与开源方案、自动生成机器人控制代码并部署验证。他称这是宇树目前资金与人力投入最多的方向,并坦言"做身体宇树全球第一,做大脑这仗不好打"。同日宇树发布首款万元以下机械臂 R1,9900 元起:7 轴仿生关节、自重 5.5kg、最大臂展 650mm(搭灵巧手)、额定负载 2kg、重复定位精度约 0.1mm,支持力反馈、碰撞检测与"位置 + 力矩"双模控制,末端可快换夹爪或灵巧手,并将陆续开源核心控制程序与接口协议。

为什么值得关注:两件事其实是同一盘棋的两头。"自进化"指向的是 AI 编程能力向物理世界的溢出——让大模型写的不再是 Web 后端,而是控制器代码,然后在真机上验证、失败、重写。这条链路一旦跑顺,"从论文到落地"的周期会被压缩成"从论文到一次自动化实验"。而 R1 是这条链路的实验器材降价:传统七轴力控协作臂动辄数万到十几万,9900 元直接砍掉一个数量级,配上开源控制接口,等于把工业机械臂变成了"桌面级通用工具"。数据飞轮要转起来,前提是采集设备足够便宜、足够多——低价硬件 + 开源生态,正是宇树在四足时代跑通过一次的打法


5. 具身智能 | 全国首个具身机器人演出"沙盒审批"落地北京经开区:3 家企业、7 台机器人、14 名安全员

事件:8 月 20 日,北京经济技术开发区(亦庄)在 2026 世界机器人大会现场,为 3 家企业的具身机器人演出颁发 "沙盒审批"准入证明,并上线全国首个机器人沙盒审批全流程管理系统。所谓沙盒审批,是在守住安全底线的前提下,为创新业态划出风险可控的试错空间,允许与现行标准不一致的产品与服务在"盒内"合规试验,流程为:入盒申请 → 符合性审查 → 沙盒试验 → 过程监督 → 出盒审批。首批入盒企业覆盖情感交互表演、器乐合奏、编队舞蹈三类演艺形态;管理系统已接入 3 家企业、7 台机器人、14 名专职安全员、16 套远程监控探头

为什么值得关注:这条容易被当成"政务新闻"划过去,但它解的是具身智能落地最硬的一道卡:机器人要进公共场景,却没有对应的准入标准——没标准就没法批,没法批就只能停在展台上。沙盒的意义是把"没有先例"从否决理由变成可管理的流程,同时把安全责任具体化到"多少台设备、多少个安全员、多少路监控"这种可核查的数字上。当技术曲线还在爬坡,制度曲线的斜率就成了商业化速度的分母。对从业者的现实提示:接下来评估一个具身场景能不能做,除了看模型成功率,还得看当地有没有这类试错通道。


快讯

  • DeepSeek Harness RC.8:距 RC.7 仅两天,补齐多模态(/goal/plan 支持图文混合输入),Claude Code 与 Codex 被纳入编排体系、可作为子代理按需安装调用,web_search 支持并发查询,Windows PTY 支持持久化 PowerShell 会话。Harness 正在从"一个框架"变成"统一调度层"。
  • Slack Code 上线:在 Slack 频道里 @ 编码 Agent 即自动开一个"代码频道",展示任务计划、代码 diff、PR 与可运行预览,成员可实时评论、叫停、审批,完成后频道归档作审计日志;全套餐免费开放。AI 编程从"单人终端"搬进"团队频道"。
  • 嵌入式 IDE 集体 Agent 化:TI CCStudio 正式支持 Claude Code 与 Codex(经 AI Assistant Configurator 配置),Microchip 的 MPLAB AI 编码助手进入 Extension Pack,Silicon Labs 推 Simplicity AI SDK 覆盖 IoT 开发全生命周期。Agent 开始参与完整的软件开发与验证流程。
  • 字节 Seed-OSS-36B 开源:36B 稠密模型、12T tokens 训练、原生 512K 上下文、思考预算可按 512 token 粒度调节,Apache 2.0,并放出"无合成数据"Base 版方便后训练研究。
  • 具身数据侧:光轮智能发布十万小时级开源人类数据集 EgoSuite-Open100k;大会现场行业共识是"高质量数据缺口仍达两个数量级",六维力传感器从高配变标配。

小结

今天的主线是**"AI 编程的入口之争 + 具身智能的大脑与制度补课"**。

AI 编程这条线,三件事指向同一个方向:能力之外,谁把复杂度吃掉,谁就拿到入口。Grok Bot 用零配置 + 云端 VM + 多 Bot 协同把上手成本压到 15 秒;DeepSeek V3.1 把"快答还是深想"的路由判断收进单一权重,省掉一层人工调度;Qwen-UI-Agent 干脆放弃改造生态,把屏幕当作最通用的接口。加上 Slack Code 把 Agent 搬进团队频道、嵌入式 IDE 集体接入编码 Agent,可以说——Agent 的战场已经从"模型跑分"下移到"封装、入口、协作位置"这三件产品活上

具身智能这条线补的是两块短板:大脑与制度。宇树把"让大模型自主读论文、写控制代码、真机验证"作为投入最重的方向,是把 AI 编程能力接进物理世界;R1 用 9900 元把七轴力控臂打进消费级,给数据飞轮换上便宜的采集器材;北京经开区的沙盒审批则给"没有标准的新业态"开出一条合法试错通道。技术、成本、制度三条曲线同时往前挪一格,规模化落地才真的有戏。

昨天关键词是"大会实景、国产 VLA 开源、自主交付 GA、Agent 接生产库、效率军备赛",今天关键词是"零配置封装、单模型自适应、屏幕即接口、大脑自进化、万元力控臂、沙盒审批"。明天继续。