拼音如何切词:从音节歧义到中文分词的完整链路
引子你敲下 woaizhongguo,输入法瞬间吐出「我爱中国」。中间那道没有空格的拼音串,是怎么被「切」成「我 / 爱 / 中 / 国」四个词的? 这件事远比看上去难。汉语书面语没有词边界,而拼音作为汉字的转写,同样没有边界——声母、韵母可以无休止地黏连成一长串字母,且大量合法的切分方式同时存在。拼音切词(pinyin segmentation)本质上要解决两层问题:先把这串字母切成合法的音节,再把音节序列解码成最像人话的汉字与词。 本文顺着「切音 → 解码 → 分词」的链路逐层拆开,并用可运行的最小代码把歧义和消歧都演示出来。 一、第一层:拼音音节切分(切音)拼音的最小单位是音节:一个音节由「声母(可空)+ 韵母」构成,如 zh + ang = zhang,或零声母的 an、er。切音的目标,是把无空格的字母串切成一串「每一个片段都是合法音节」的序列。 做法很朴素:准备一张合法音节词典,再用动态规划(或回溯枚举)把所有合法切分找出来。下面这张图是切音的执行模型——它像在一串字符上不断「试切」,只要切出来的片段在词典里就放行: 12345...
2026-08-26 AI新闻速递
今天 AI 圈的主线很清晰:coding agent 从「终端 / CLI」走向「协作空间与 IDE 原生」,具身智能在资本与「机器人大脑」叙事上加速,基础设施则进入「agentic 经济性」的硬碰硬竞争。以下筛选 5 条值得关注的动态,并附 3 条快讯与一段小结。 一、Slack Code 发布:把 coding agent 搬进项目频道8 月 20 日,Slack 发布 Slack Code,把 AI 编程智能体直接放进项目频道(code channel),和人类队友同处一个对话空间。团队可以跟随 agent 的活动、审阅改动、查看实时 HTML 预览,也能随时让 agent 改方向、暂停或停止。 为什么值得关注:它把「写代码」这件事从终端里拽出来,塞回团队原本就在聊天的频道里——产品、设计、非工程同学不用开终端也能参与。高风险的「推到生产」动作仍需专家审批,agent 继承既有权限与安全策略。口号是 "No ticket, no meeting, no waiting – just a fix, shipped"。这代表 coding agen...
AI 新闻速递|2026-08-25:编程工具掀起千亿整合潮、模型默认权换防、终端 Agent 上云、具身智能卡在"数据鸡生蛋"、人形机器人迈进家门
昨天的关键词是"人形机器人上球场当考官、Copilot 插件标准破壁、开发智能体接管 DevOps、Claude Code 锁资源、Oracle 给 AI 代码设红线"。今天两条线各自再往前挪一格:AI 编程从"单点能力比拼"拐向"资本与平台层面的整合 + 模型默认权换防 + 终端 Agent 向云与多云扩散";具身智能则从"炫技阅兵"拐向"规模化落地前的真瓶颈——数据与进家门的第一步"。挑了 5 条,每条附上为什么值得关注。 1. AI 编程 | 千亿整合潮:SpaceX 600 亿收 Cursor、Stripe 75 亿收 OpenRouter、OpenAI 30 亿收 Windsurf事件:8 月 20 日前后,Developer Tools Watch 盘点出一笔约 6000 亿美元的 AI 编程整合浪潮:SpaceX 宣布以 600 亿美元全股票收购 Cursor(预计 2026 Q3 交割,意在把 Cursor 与 xAI 的 Grok、Colossus 超算拼成...
AI 新闻速递|2026-08-24:人形机器人上球场当"考官"、Copilot 插件标准破壁、开发智能体接管 DevOps、Claude Code 锁资源、Oracle 给 AI 代码设红线
昨天的关键词是"国产旗舰同一周阅兵、定价峰谷分层、具身从估值锚到出货量锚"。今天两条线各自再往前挪一格:AI 编程从"单个 Agent 能写代码"拐向"可移植的技能资产 + 全生命周期 DevOps 接管 + 资源与信任护栏";具身智能则从"本体炫技"拐向"在真实动态环境里被当成考官来考"。挑了 5 条,每条附上为什么值得关注。 1. 具身智能 | 世界人形机器人运动会开赛:网球、乒乓球成了具身智能的"动态考场"事件:8 月 22–23 日,第二届世界人形机器人运动会在北京开赛。最抢眼的是人形机器人真的上场打球——银河通用(Galaxy General Robotics)的 Galbot ET1 在开幕式上与技术人员对打网球,能自主判断落点、移动步法、挥拍回球;超维动力的 KAI 则完成了首个人形机器人自主乒乓球完整对局。厂商披露,这类系统普遍采用"大脑(高层决策)+ 小脑(全身运动协调)"双层级架构,训练数据来自真人动作捕捉 + 虚拟...
AI 新闻速递|2026-08-21:Grok Bot 走红硅谷、DeepSeek V3.1 双模式合一、Qwen-UI-Agent 把屏幕当接口、宇树提「物理 AI 自进化」+ 万元机械臂、机器人演出沙盒审批
昨天的关键词是"大会实景、国产 VLA 开源、自主交付 GA、Agent 接生产库、效率军备赛"。今天两条线各自往前挪了一格:AI 编程从"工具能力比拼"拐向"产品封装与入口之争"——零配置多智能体、单模型自适应快慢思考、把屏幕当最大接口;具身智能则从"本体与模型"拐向"大脑自进化 + 硬件价格拐点 + 制度基础设施"。挑了 5 条,每条附上为什么值得关注。 1. AI 编程 | Grok Bot 走红硅谷:零配置 + 云端虚拟机 + 多智能体原生协同,被称"又一个 Claude Code 时刻"事件:xAI 推出的 Grok Bot 近日在硅谷引发热议。投资人 Gavin Baker 在 X 上称其为"AI 的又一个 Claude Code 时刻",自述个人 AI 使用量因此增长约 100 倍,并举例:在 Grok Bot 里从零构建一个播客摘要器只花了约 15 秒。产品设计的三个关键词很清楚:极致零配置(不用选模型、不调参数、不配本...
AI 新闻速递|2026-08-20:世界机器人大会开幕、小米 XR-1 开源 VLA、Copilot Autopilot GA、MongoDB 给 Agent 接生产库、Cursor 构建提速 3×
昨天的主题是"大厂下场做终端 Agent、CLI 成主接口、具身智能上市前夜、脑电攻数据瓶颈、控制消费级化"(Muse Code、OpenCode、Agility、Encord、Enigma)。今天两条线继续拐弯:具身智能从"商业化叙事"拐进"大会实景交付 + 国产 VLA 基础模型开源",AI 编程从"终端 Agent 单点突破"拐进"自主从需求到 PR 的 GA + 给 Agent 接生产数据 + 基础设施效率军备赛"。挑了 5 条,每条附上为什么值得关注。 1. 具身智能 | 2026 世界机器人大会开幕:天工 Omni 家用小型人形、Pelican-Unify 1.0 具身多模态大模型、星海图 G0.5 前置仓实景接单事件:8 月 19 日,以"人机共生产需共融"为主题的 2026 世界机器人大会在北京亦庄启幕。本届最突出的信号是具身智能从"能跑会跳"向"能想会干"加速进化:① 北京人形机器人创新中心展出面向...
AI 新闻速递|2026-08-19:Muse Code 入局、OpenCode 破 14 万星、Agility 上市前夜、脑电标注攻数据瓶颈、机器人控制"调音量"
昨天的主题是"运行时开源、AI 反向养开源、内部工具开源化;视频跨形态预训练、机器人进真实照护"(DeepSeek Harness、Vercel Agent 工厂、Spotify Xirp、Dyna DYNA-2、深圳 0755)。今天两条线继续拐弯:AI 编程从"开源运行时/工具"拐进"大厂亲自下场做终端 Agent + CLI-native 成为主接口",具身智能从"视频预训练/进养老院"拐进"商业化上市前夜 + 用脑电攻真实数据瓶颈 + 把控制做成消费级交互"。挑了 5 条,每条附上为什么值得关注。 1. Meta 发布 Muse Code 终端编码智能体:Muse Spark 1.2 驱动、并行子 Agent 跑在隔离 git worktree、事件日志可重放事件:8 月 5 日,Meta Superintelligence Labs 推出首款专属终端编码智能体 Muse Code(公开 Beta,单命令安装于 macOS/Linux),...
AI 新闻速递|2026-08-18:Agent 运行时开源、AI 反向维护开源库、视频预训练跨形态、机器人进养老院
昨天的主题是"开源登顶、安全反噬、插件互通、全身协同、原生全模态"(GLM-5.3、Ghostjacking、Agent Plugins、北大灵巧手、智元 WITA-Omni)。今天两条线继续拐弯:AI 编程从"用现成工具"拐进"底层运行时开源 + AI 自己维护开源库 + 大厂内部工具开源化",具身智能从"全身协同/全模态"拐进"纯人类视频跨形态预训练 + 真实照护场景落地"。挑了 5 条,每条附上为什么值得关注。 1. DeepSeek 开源 Harness v0.1:Agent 运行时本体 MIT 放出,插件架构可换模型/工具/UI事件:8 月中旬,DeepSeek 将内部自用的编码 Agent 运行时 Harness v0.1 以 MIT 协议公开发布,任何人可免费商用与修改。它的核心是一套名为 Cordis 的插件架构——开发者能不动"连接各部件的胶水代码",直接替换底层模型、工具、文件系统访问、用户界面任一环节;兼...
AI 新闻速递|2026-08-17:GLM-5.3 登顶开源编程、Agent 安全拉响警报、机器人打通全身协同
昨天的主题是"编排开源、价格踩穿、视频即学、数据有标"(YC 的 QM、编码模型价格战、X Square HOST、Gemini Robotics 2、越疆鹿萌 + 数据集国标)。今天两条线继续深化:AI 编程从"卷模型"拐进"开源登顶 + 安全反噬 + 跨工具互通",具身智能从"全身控制"拐进"全身协同闭环 + 原生全模态"。挑了 5 条,每条附上为什么值得关注。 1. 智谱发布 GLM-5.3:号称"编程能力最强的开源模型",后训练 Scaling 显神通事件:8 月 14 日,智谱发布 GLM-5.3。与 GLM-5.2 相比基座模型未变,靠"极致的后训练 Scaling"把智能上界大幅抬高——更长程的任务环境、更丰富的环境类型、超长的后训练时间。智谱称其为编程能力最强的开源模型:内部体感评测较 GLM-5.2 提升约 50%,在 Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准...
AI 新闻速递|2026-08-14:YC 开源多智能体编排、编码模型价格战白热化、29 秒视频教机器人学动作
昨天的主题是"Agent 拿到执行权、机器人学会想清楚再做"(Claude Code 自动模式今日正式生效、世界模型成 WAIC 主旋律)。今天两条线继续外溢:AI 编程从"拼模型"卷到"拼编排与拼价格",具身智能从"秀demo"卷到"靠视频秒学动作 + 靠国标管数据质量"。挑了 5 条,每条附上为什么值得关注。 1. Y Combinator 开源 QM:模型无关的多智能体编排框架,Harness 层再添一子事件:7 月 31 日,Y Combinator 宣布开源其内部使用的多智能体编排框架 QM(MIT 协议,代码已在 GitHub 的 yc-software 组织公开)。YC 称 QM 是"为公司而非单人设计的多人协作框架",已在自家会计、法务、活动、工程(含 QM 自身的开发)全流程跑起来。其关键设计是模型无关的核心编排循环——同一套 orchestration 可以同时挂在 Pi、OpenCode、Codex 或 Claude Code 之上,...
AI 新闻速递|2026-08-13:Meta 开源本地 Agent、Claude Code 自动模式、世界模型成具身主旋律
昨天的主题是"政策把两条线接进 KPI"(上海点名 Coding 平台、天津出机器人方案),今天两条线各自往"能落地"又推了一步:AI 编程在抢"自动执行 + 本地化 + 安全护栏"三件事,具身智能在把"世界模型预演"从概念变成架构标配。挑了 5 条,每条附上为什么值得关注。 1. Meta 开源 300 亿参数 Muse Glimmer,本地 Agent 模型正面冲击云端 API事件:8 月 10 日,Meta 超级智能实验室发布 Muse Glimmer——一个 300 亿参数的多模态 Agent 模型,以 Apache 2.0 协议开源权重至 Hugging Face。这是 Muse 产品线(Spark、Muse Code)中首个开放权重的模型,专为常驻本地的 Agent 工作流设计,经 4bit 量化后仅需 24GB 显存即可本地运行,SWE-Bench Verified 达 76.0 分。同期 Meta 推出终端式编程智能体 Muse Code,采用异步后台多 Agent 架构与隔离 ...
AI 新闻速递|2026-08-12:上海点名 Coding 平台、天津出机器人方案、高盛押注人形机器人
昨天聊的是"给自主执行加护栏"(Docker 沙箱、agent-skills 判断力),今天两条主线各自往前推进了一步:AI 编程从"工具"被写进了城市级产业政策,具身智能从"讲故事"被写进了地方政府的产量 KPI。挑了 5 条,每条附上为什么值得关注。 1. 上海"十五五"规划点名 Coding 平台:软件业冲 4 万亿,配套十万卡智算集群事件:上海印发《上海市软件和信息服务业发展"十五五"规划》,提出到 2030 年把该产业打造成经济增长"动力源",规模力争达到 4 万亿元;明确"支持软件企业广泛使用 Coding 平台",并实施"百千万"智算集群工程——在松江、临港、青浦等地布局十万卡级超大规模智算集群,推动自主芯片与主流大模型深度融合。 为什么值得关注:这是少见地把"AI 编程工具"写进省级产业规划的案例。过去 Coding 平台(GitHub Copilot、Claude Code、Cur...
AI 新闻速递|2026-08-11:宇树登陆科创板、Docker 给 Agent 造沙箱、英伟达搭 5000 亿融资盘
昨天聊的是"格局变天",今天聊的是"落到实处"。具身智能开始上市敲钟、批量出货,AI 编程开始补基础设施——沙箱、技能库、本地小模型。挑了 5 条,每条附上为什么值得关注。 1. 宇树科技科创板申购,A 股迎来"人形机器人第一股"事件:宇树科技今日在科创板开启新股申购,上市市值约 609 亿元,中一签需缴款 7.54 万元,网上中签率仅 0.0181%,中签者账面浮盈有望超 30 万元。这是 A 股第一家真正意义上的人形机器人整机公司登陆资本市场。 为什么值得关注:具身智能过去两年一直在一级市场里"烧钱讲故事",估值高但缺乏公开定价锚。宇树上市,等于把这条赛道第一次拉到了二级市场的显微镜下——季度财报、毛利率、出货量、研发费用率,全都要公开对账。0.0181% 的中签率说明市场情绪极度亢奋,但真正的考验在上市之后:人形机器人能不能从"科技公司"变成"制造业公司",靠的不是发布会,是良率和订单。这家公司的股价曲线,未来会成为整个赛道最直观的体温计。 2. 中...
AI 新闻速递|2026-08-10:Cursor 并入 SpaceX、Claude Code 自动模式上线、具身智能融资潮
今天的信息量有点大。AI 编程工具的格局在变天,具身智能的钱在猛灌。挑了几条值得停下来看一眼的,每条都附上为什么值得关注。 1. SpaceX 收购 Cursor 最快本周末完成,新产品或启用 Grok 品牌事件:据外媒报道,SpaceX 对 AI 编程工具公司 Cursor 的 600 亿美元收购交易最快本周末完成,最晚本月底前收尾。交易完成后 Cursor 品牌可能在未来几个月逐步退出,即将推出的通用型智能代理产品或被命名为 Grok Bot。现有工具短期内不会更名,交易仍需监管批准。 为什么值得关注:这是 AI coding 领域迄今体量最大的并购之一,意义不只是"换了个东家"——它意味着 Cursor 从一个独立工具厂商,变成马斯克生态里 Grok 体系的一员。通用智能代理(Agent)正在取代"编辑器"成为 AI 编程的核心形态,而 Grok Bot 这类产品瞄准的正是"一句话跑完整个任务"的终极形态。加上 xAI 的算力与数据,Cursor 的下一步很可能重新定义编程助手的竞争规则。 2. Anthro...
RoPE旋转位置编码——让大模型"记住"字词顺序的旋转魔法:读《RoFormer》论文有感
一、为什么大模型需要"位置"?作为一名长期写 C++ 和关注大模型的工程师,我最早对**位置编码(Positional Encoding)**产生兴趣,是因为一个看似反直觉的问题: Transformer 本身,是"看不见顺序"的。 自注意力机制(Self-Attention)计算的是两个 token 之间的"相关程度": 1Attention(Q, K, V) = softmax(Q·Kᵀ / √d) · V 注意这个公式——Q·Kᵀ 是点积,衡量的是内容相似度。把"我爱你"和"你爱我"送进 Transformer,如果不加位置信息,模型看到的几乎是一模一样的东西。因为"我"和"你"不管谁在前谁在后,它们的点积都一样。 这就引出了一个大问题:语言是讲究顺序的。"猫追老鼠"和"老鼠追猫"完全是两回事。所以我们必须给每个 token 注入"它是第几个"的信息——这就是位置编码存在...
RAG原理就一句话——检索、拼接、加工:写给想祛魅的你
系列导读:本文是"检索与 RAG"系列的第三篇(收尾篇)——前两篇分别认识了 RAG、深挖了检索环节的坑,本篇回归本质,用一句话看穿 RAG 的骨架。本系列阅读顺序: 《RAG检索增强生成——让大模型学会翻书作答》(认识 RAG) 《权重大却不相关——BM25检索失效场景与两阶段救赎》(深挖检索环节) 本文《RAG原理就一句话——检索、拼接、加工》(回归本质,收尾) 一、RAG 被讲复杂了打开任何一篇 RAG 教程,你会看到:向量数据库、embedding、切分策略、重排、混合检索、RRF 融合、引用溯源、评估指标……名词堆成一座山。 但如果你剥掉所有包装,RAG 的原理真的只有一句话: 用传统软件工程的办法,把用户输入对应的知识搜索出来,拼到大模型的提示词里,让大模型帮你二次加工一下。 就这么简单。私域文件知识库问答是这样,联网搜索是这样,企业内部文档检索也是这样——框架完全同构。 这篇不教你搭系统,只帮你把 RAG 看穿:它到底是什么、每一环在干什么、为什么教程写得天花乱坠。 二、拆开看:三个环节,一个都不新RAG 的全流程可以拆成三个环节: ...
RAG检索增强生成——让大模型学会翻书作答:读《Retrieval-Augmented Generation》论文有感
系列导读:本文是"检索与 RAG"系列的第一篇——先认识 RAG 是什么(为什么需要它、它的架构是什么)。本系列共三篇,阅读顺序如下: 本文《RAG检索增强生成——让大模型学会翻书作答》(认识 RAG) 《权重大却不相关——BM25检索失效场景与两阶段救赎》(深挖检索环节的坑) 《RAG原理就一句话——检索、拼接、加工》(回归本质,一句话看穿 RAG) 一、大模型的知识困境作为一个 C++ 工程师,我一直在思考一个问题:为什么大语言模型知道很多东西,但又常常"胡说八道"? 比如,如果你问 GPT-3 "2024年美国总统是谁",它可能会给你一个错误的答案——因为它的知识截止到2021年。更糟糕的是,它可能会编造一个不存在的事实,还说得煞有介事。 这就是大模型的"知识困境": 知识过时:训练完成后,参数就被冻结了,无法获取最新信息 容易幻觉:经常生成看似合理但实际上错误的内容 缺乏可解释性:无法追溯答案的来源 专业知识不足:对于冷门或专业领域的知识,模型的准确性大打折扣 这正是《Retrie...
思维链提示——让大模型学会推理的神奇方法:读《Chain-of-Thought Prompting》论文有感
一、为什么大模型需要"思考"作为一个 C++ 工程师,我一直在思考一个问题:为什么大语言模型在处理简单任务时表现出色,但在需要多步推理的复杂问题上却常常翻车? 比如这个数学题: "小明有5个苹果,小红比小明多3个苹果,小李的苹果是小红的2倍。问小李有多少个苹果?" 标准提示下的模型可能会直接给出答案,但不一定正确。而如果让模型"一步一步思考",结果就会大不相同。 这正是《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》这篇论文要解决的问题。 二、什么是思维链提示(Chain-of-Thought Prompting)2.1 核心思想思维链提示(Chain-of-Thought Prompting,简称 CoT)的核心思想非常简单: 在提示中加入一些包含中间推理步骤的示例,让模型学会"一步步思考"。 对比一下两种提示方式: 标准提示(Standard Prompting): 12Q: 小明有5个苹果,小红...
Codex Desktop gpt-5.5调用失败解决方案
一、遇到问题今天在使用 Codex Desktop 0.142.2 时,发现一个非常令人困扰的问题:当我切换到 gpt-5.5 模型时,每次发送请求都会立即失败,错误信息是: 1This model is not supported when using X-OpenAI-Internal-Codex-Responses-Lite. 具体表现就是: 在 Windows 上打开 Codex Desktop,进入某个线程 切换模型到 gpt-5.5 发送任何提示词,请求都会立刻失败 没有任何助手回复产生 最奇怪的是,同一台机器上的 gpt-5.4 模型完全正常,而且就在同一天稍早的时候,gpt-5.5 在其他线程里还正常工作过。这说明不是简单的配置问题,而是某个动态变化导致的。 二、我的排查过程2.1 从错误信息入手看到这个错误信息,我首先注意到了 X-OpenAI-Internal-Codex-Responses-Lite 这个 HTTP 头。从命名来看,这应该是一种"轻量级响应模式"。 问题很明显:Codex 在请求时发送了这个 Lite 头,但 gpt...
算法早已实现:读AI寓言故事有感
一、迷雾森林里的算法灵魂最近让AI写了几篇关于算法的寓言故事,读来颇有感触。故事里,林大山在迷雾森林里"乱走"着探路,扔下石子做记号,碰到树就绕过去——这不就是RRT算法吗?当我看到这个隐喻时,忽然意识到:计算机算法并不是凭空创造的,它们早就以某种形式存在于我们的生活中。 我们总觉得算法是高深的、抽象的、只存在于代码世界里的东西。但事实上,算法的本质就是解决问题的方法和步骤。人类在几千年的生存实践中,早就摸索出了各种各样的算法,只是我们没有用"算法"这个词来称呼它们。 二、生活中的算法原型细细想来,生活中的算法无处不在。猜数字游戏是二分查找,每次将搜索范围缩小一半;找零钱是贪心算法,每一步都选择当前最优方案;地图导航是Dijkstra算法,从起点逐步扩展到终点;人生决策是动态规划,将大问题分解为子问题求解;手机通讯录是哈希表,通过哈希值直接定位存储位置。 算法的发展,其实是一个从生活到代码的抽象过程:观察现象 → 总结规律 → 形式化表达 → 代码实现 → 优化改进。以RRT算法为例,林大山在迷雾森林里随机探路是生活原型,通过随机采样快速探...
一次与 AI 的代码重构对话实录:十一个决策如何成形
一、起点代码库主体为 C++,约 2000 行核心业务逻辑,运行在 ARM 嵌入式和 x86 双平台上,通过 MQTT 与远程设备通信,串口与多个外设交互。我在这个项目上工作了一年,近期整理出一份架构重构计划(Strand + Offload 模式),但缺少外部视角的校验。 我将代码库和重构计划一并提交给 AI,要求其以独立视角进行全面审查。AI 的初始动作是并行扫描目录结构、核心文件、依赖关系和 CMake 构建系统,在五分钟内建立起对代码库的整体理解。 二、第一轮:信息差暴露AI 输出了涵盖十个维度的架构评估报告——线程模型、瓶颈识别、改进方案、组件交互优化、可扩展性增强、第三方库集成策略、Device/DeviceNode 关注点分离、SystemFactory 设计模式改进、实施路线图、风险矩阵。 覆盖全面,但有三处与实际情况不符: 计算卸载方案中 ComputePool 的设计是冗余的。项目已引入 ZLMediaKit,其内置的 WorkThreadPool 可直接复用。 第三方库仅有 x86 预编译版本,而目标平台为 ARM,跨架构编译的管理策略未被考虑...
Vibe Check 即一切:读 Olshansky《Vibe Checks Are All You Need》
一、你每天都在做 Vibe Check,只是不承认Olshansky 在他的文章《Vibe Checks Are All You Need》里扔出了一个让人不太舒服但难以反驳的判断:日常实践中 ~99% 的 LLM "评估"本质上都是 vibe check——直觉驱动的、主观的、非量化的感受判断。 什么叫 vibe check?就是你打开 ChatGPT/Claude/Gemini,扔一个问题进去,看一眼输出,然后心里给出一个模糊结论:"还行""不太行""这次挺聪明""刚才那段胡说八道"。这个过程没有评分量表,没有对照基线,没有统计显著性计算——它纯粹是你作为人类用户对模型输出的一次主观感受采样。 大多数人不会把这种体验称为"评估"。他们会说"我只是在试用""我在了解这个模型""我先随便玩玩"。但 Olshansky 的观点是:别骗自己了,你就是在做评估——只不过用的是最原始的方式。...
DeepSeek v4 Pro 在 TRAE 中输出乱序问题的最终解决
四月底,我写了一篇《DeepSeek v4 Pro 在 TRAE 中输出乱序问题分析与解决》,详细记录了 DeepSeek v4 Pro 在 TRAE IDE 中出现词级/片段级输出乱序的问题,并给出了一个核心推测:DeepSeek v4 Pro 作为推理模型,在 SSE 流中同时发送 reasoning_content 和 content 两种字段,而 TRAE 的解析器未能正确分离它们。 一个多月过去了,问题已经解决。本文是最终篇——记录根因的确认、修复的实际发生方式,以及一个耐人寻味的事实:整个过程中,我们从未收到任何一封邮件回复。 一、时间线回顾 时间 事件 4 月中旬 首次在 TRAE 中配置 DeepSeek v4 Pro,发现长回复几乎必然乱序 4 月 27 日 发布问题分析文章,向 TRAE 和 DeepSeek 双方提交 issue / 反馈 4 月底 — 5 月中旬 不定期复测,乱序问题仍然存在。未收到任何官方邮件或 issue 回复 5 月 20 日左右 TRAE 推送了一次版本更新(Windows 客户端 + 内...
公司即算法图:读 Daniel Miessler《Companies Are Just a Graph of Algorithms》
一、核心命题:一切皆算法Daniel Miessler 在《Companies Are Just a Graph of Algorithms》中提出了一个简洁而有力的框架:公司不过是一张算法图(Graph of Algorithms)。 他举了一个叫 "Memories" 的虚构公司案例——这家公司接收用户照片、修复、风格化、添加字幕、输出高清大图。整个业务流程可以拆解为一系列步骤: 1用户上传 → 高质量扫描 → 质量检查与修复 → 风格化处理 → 添加字幕 → 输出下载 每一步本身又是一个子算法,可以继续细拆。而支撑业务运转的还有更多并行流:公司注册、招聘、税务、基础设施、市场营销、客户支持——每一项都是一组算法节点,彼此用"发送到""接收自"的关系连线,构成一张完整的有向图。 这个视角并不新鲜——把企业看作输入-处理-输出的系统,是管理学和系统工程几十年前就在做的事情。但 Miessler 真正想说的是后半句:AI 即将让这张图变得完全透明,而透明是优化的前置条件。 二、"透明即燃料":为什么...
DeepSeek v4 Pro 在 TRAE 中输出乱序问题分析与解决
在 Windows 版 TRAE IDE 中通过 DeepSeek v4 Pro 模型辅助编程和写作时(通过 SSH 远程连接到 Linux 开发环境),我遇到了一个令人困扰的现象:模型的思考过程和编写过程出现严重的输出乱序——文字片段像被洗牌一样随机排列,完全无法阅读。 问题的诡异之处在于:不是偶尔乱序,而是几乎每次长回复都会出现。下面是一段真实的乱序输出: 真实的乱序输出示例: DeepekSe是模型Tra 通过界e面面的UI添加 ,的存储在别 ,的地方在你。TraIDE e看到中Deep-ekSe24 v ro-p正在并使用##。 DeepSe ek -v4的por乱序输出 原因深层的Deep Seek根本模型 原因是)流式响应(Streaming 机制 T与e ra IDE响应的 处理不兼容 : 可以看到,不同来源的文字被不规则地插花式交错在一起。这并非某一段落整体后移或前移,而是真正的词级/片段级交错——两个文本流被以非预期的方式交替拼接到了一行中。 本文将记录问题的完整排查过程、目前最合理的推断和实际可行的应对方案。需要说明的是,关于根因的分析目前仍...

