今天Anthropic那份报告里,藏着OPC创业者最不该忽略的一句“反向指标”
GPT-5.3和Claude 4.6都在往“少幻觉”走,你的交付流程跟上没
模型不编了,你的流程却还按它会编来设计。
这大概是这两天最值得琢磨的一件事。GPT-5.3和Claude 4.6都在往"少幻觉"走,豆包2.1 Pro干脆把"告别胡言乱语"写进了更新说明——这几个版本的更新口径和一线体感少见地指向同一件事:编造在减少,Agent跑复杂任务时不再中途给你埋雷。
大部分人的第一反应是松一口气。我的反应是:你那些为了防幻觉而加上的人工兜底,正在变成成本。
讲个具体的。过去一年小团队的交付链路基本这么搭:模型出初稿,人复核事实,人补上下文,人做最终判断。这套流程成立的前提是模型不可信,所以人必须站在每一环。幻觉率往下走,模型的可信区间在变宽,但流程没变。结果就是,本来该由模型扛的活,你还压在人身上;本来能一次跑完的链路,你还切成三段走。
模型变强,你的交付反而更慢。这不是模型的锅。
关键变量在Workflow,不在Model。 网易有道周枫昨天那句话说得挺准,AI能力竞争正在进入"Model + Agent + Workflow"时代。前两层是通用能力,谁都能调用;第三层才是你的护城河,也是你真正交付给客户的东西。模型往不编的方向走,Workflow的复杂度却在往上涨——验收标准、上下文注入、失败重试、结果留痕,这些不是换个更强的模型就能自动消掉的。
换个说法:模型越准,流程设计的权重越高。
那具体该动哪里?三个方向。
- 把验收标准前置。别再让人通读一遍判断对错,让模型按你写死的规则自检,输出结构化结果,人只看异常项。
- 把复核从"读"改成"跑"。能执行验证的别用眼睛验,能拿数据对账的别靠印象。
- 把交付切面收窄。与其让一个模型从头做到尾,不如让它在最擅长的那一段发力,剩下的交给Agent编排。
听着朴素,但真做的人不多。原因也很实在——改流程比换模型痛苦。换模型今天决定、明天见效;改流程要重写SOP、重新定岗,还要承认之前那套已经过时了。
这就回到一个更现实的问题:小团队没有流程团队,老板本人往往就是那个流程。舍予AI智能体的定位是"老板的第一支AI战队",我理解它要接的不是某一个环节,而是老板脑子里那套还没写下来的交付标准。幻觉少了,这件事第一次变得可行——因为标准一旦写清楚,模型真的能稳定执行。
反过来看,如果你的交付还停在"模型出、人复核"的手工作坊阶段,这波少幻觉的红利你基本吃不到。省下的只是几次纠错时间,没省下任何结构性成本。
模型在往前走。你的流程要是没跟上,差距不会表现为"偶尔出错",而是"一直很慢"。
Gemini把Computer Use塞进API这天,小团队的“最后一公里”被谁
上节聊的是“少幻觉”——那是让模型敢把结果直接交出去。这一节换个问题:谁来动手。
Gemini 的 API 文档里,“工具和代理模型”那一栏现在躺着两行东西。一行是「電腦使用」,模型名 gemini-2.5-computer-use-preview-10-2025,说明写得很直白:这个专用模型可以“看見”數位螢幕,执行點選、輸入、瀏覽等 UI 動作,自动跑完复杂的浏览器工作。再往下一行是 Deep Research 和 Deep Research Max,自主规划、翻几百个来源、产出带引用的报告。
这两行凑在一起,意思很清楚:模型开始长手了。
真正有分量的不是能力,是形态。 过去“操作电脑”是一类产品——浏览器插件也好、RPA 也好、某个 Agent 应用也好——形态是别人替你定好的,你只能在人家划的框里做配置。现在它是 API 里的一行模型名,框没了,剩下的是你自己的想象力和那套工程。
所以回到标题那半句:小团队的“最后一公里”被谁吃掉了。
我的判断是,被那些能把 API 接进真实业务流的小团队吃掉了。百度沈抖的说法是,产业智能体正在打通大模型变现的“最后一公里”。这话放在我们身上尤其准。壁垒不在模型会不会点按钮,在于你知不知道该点哪个按钮、在第几步点、点错了谁来兜。
无人配送车是最好的注脚。中通已经投了超过 3500 台,覆盖全国 260 多个城市,每天送 870 万件包裹。技术层面这不是最难的事,难的是每个小区门口的道闸、每栋楼的电梯、每个收件人临时改约的那通电话。最后一公里从来不是技术问题,是最碎的现场问题。
小团队的机会恰在这堆碎片里。
反过来看,卡住的人在干什么?在等一个开箱即用的完整方案。等的时候,别人早把一个点击、一次录入、一份对账做成了能交付的东西。Agent 的价值不在于它会多少动作,在于它替你关掉了多少个页面。
舍予AI智能体那句定位我一直觉得有意思——“老板的第一支AI战队”。落点不是工具,是编制。Computer Use 进了 API 之后,你要想的不是采购一个软件,而是给这支战队补一个不睡觉、不抱怨、会自己开浏览器干活的成员。
网易有道周枫昨天讲的「Model + Agent + Workflow」,说的是同一件事。模型是弹药,Agent 是枪,Workflow 才是扳机。前两样现在都买得到,第三样得自己造。
这就是最不该忽略的关键变量:当操作电脑变成一次 API 调用,你的护城河只可能来自别人复制不了的那段流程。
Qwen3.8登顶HF、豆包2.1 Pro降幻觉:国产模型这波不是追赶,是换赛道
上一节聊Gemini把Computer Use塞进API,问的是小团队"最后一公里"被谁接走。这周国产模型给了另一个答案:不接那一公里,直接换条路走。

千问Qwen3.8-27B登顶Hugging Face,成了这个平台史上最受欢迎的开源模型。重点是"开源模型"这个定语——权重可下载、可私有部署、可微调,意味着一个创业团队不必再为"用得起"付溢价。榜单本身会变,但这个姿态是实的。
同一天,豆包2.1 Pro的更新里写着:幻觉大幅降低,Agent复杂任务交付更稳。
把这两件事叠在一起,赛道就换了。过去两年的国产叙事是追赶——发布、对标、跑分、宣布接近。现在题目变了:开源权重解决"拿得到",降幻觉解决"信得过",Agent交付解决"跑得完"。
为什么幻觉和Agent非捆在一起说?因为幻觉不降,Agent就只是个演示玩具。多步任务里每一步的置信度打九折,十步之后成功率掉到三成。老板不会为三成买单。所以豆包把"少胡说"和"复杂任务更稳"并列写进更新点,说明厂商清楚真正的卡点在交付链条上——模型能不能用,不看它答对一道题,看它能不能连着答对十道还不出格。
再说件不好听但值得关注的事。Anthropic那份报告点名国内多家公司做"工业规模"蒸馏,Meta那边还有研究说字节模型被蒸馏后成绩
别只盯着榜单看:把模型当水电用,才是OPC该算的那笔账
榜单每周都在变。Qwen3.8-27B登顶Hugging Face,豆包2.1 Pro把幻觉压下去,GPT-5.3和Claude 4.6都在往"少胡说"走——这些信号当然重要,但如果你今天还在纠结用哪个模型,那大概率说明你的产品还没跑起来。
真正该算的账,是把模型当水电看。
水电的特点是什么?你从不关心今天电厂烧的是煤还是气,你只关心打开水龙头有水、插上插座有电,而且水费电费便宜到可以忽略。模型正在快速变成这样一层基础设施。当单位成本一年掉一个数量级,当同一个任务三家模型都能做到八成水准,选型本身就不再是护城河。你的护城河只剩下:你怎么用它、用在哪里、用完交付成什么。
这就是OPC(一人公司/极小团队)最该算的一笔账。
第一笔,边际成本账。别算"每千token多少钱"这种虚的,算"完成一次真实交付要烧多少钱"。一次客服工单、一份尽调摘要、一条投放素材——把这些拆成模型调用次数,乘以当前单价,得出单笔交付成本。当这个数字低到你愿意拿它去做免费引流,商业模式就成立了。榜单第一名和第二名差那点分数,在这笔账里根本看不出来。
第二笔,切换成本账。榜单会变,模型会淘汰,你的业务逻辑不该绑死在某一家上。把模型调用抽成一层薄薄的适配层,今天用豆包跑中文合规,明天切千问跑长文档,后天挂Gemini的Computer Use去点那个没有API的老系统。能做到随时切换的团队,才有资格对涨价、限流、政策风险说"无所谓"。
第三笔,也是最多人漏掉的——交付流程账。模型变稳了、幻觉变少了,但你有没有跟着升级自己的质检和交付环节?以前要人工复核三遍的输出,现在能不能改成抽样复核?以前靠人盯着跑的流程,能不能交给Agent自己跑完、人只在末尾签字?这才是模型进步真正给你的红利。继续用旧流程配新模型,等于开着电车加92号油。
我自己的做法很土:把一个季度里跑得最多的五类任务列出来,每类都配一个主模型加一个备用模型,再定一条明确的切换触发线——错误率超过多少、响应慢过多少秒、价格涨过多少,立刻换。不争论、不预测、不追新。榜单你继续看,但只看一件事:有没有哪家的价格或能力突变,能让你重新算一遍上面那三笔账。没有,就关掉页面干活。
说到底,模型是电,产品是插座,用户要的是插上就能亮的灯。别把精力花在争论哪家发电厂更先进,花在确保你的灯永远不会灭。这是OPC能守住、也是唯一值得守的阵地。