Claude主导26%的AI研发工作,OPC创业者别急着造模型,先卡住这五个监督位
Anthropic的R&D Automation Index里藏着一个被忽略的数
26% 这个数字被反复引用,但 Anthropic 那份 R&D Automation Index 里真正藏着的信息不是它。
是那句附注:超过 90% 的受测 AI R&D 工作,AI 至少已经达到「协作」程度。以及紧跟着的另一句——目前没有任何一项受测工作,达到完全无人监督的自主层级。
把这两句话放在一起读,画面就出来了。Claude 在一部分研发工作里当 lead,在几乎全部工作里当同事,可它从来没有真正单独值过一次班。
这才是关键变量。26% 是能力的天花板,90% 是渗透率的真相,0% 是责任的现状。大多数人盯着第一个数字兴奋或者焦虑,其实第三个才是决定未来两年谁吃到红利的那一个。
我自己的体感也是这样。用 Claude Code 跑一个中型重构,它能一口气吃掉七八个文件,中间还会自己开子代理去搜调用链,效率高到让人恍惚。可到了要合并的那一刻,你还是会停下来,自己把 diff 从头滚一遍。不是因为不信它,是因为没有一条明确的线在说这活干完了。它说完成了,那叫它认为完成了。
Anthropic 自己在报告里承认的那句「没有完全无人监督」,翻译成工程语言就是:链路里始终插着一个人。这个人不写代码,他做的事是判定、切分、兜底、签字。听起来像杂活,其实是全部的控制权。
所以这份 index 最该被圈出来的不是 26%,是那个 0%。它精确地标出了当前 AI 研发协作的断点位置——不在模型够不够聪明,而在两段工作之间的交接处没有可信的验收机制。能力已经溢出了,容器还没造好。
对 OPC 创业者来说,这是个好消息。模型层的仗你打不起,但「谁来判断这活干完了」这件事,现在全球都还是空白。
从“写代码”到“管代码”,OPC创业者的机会不在模型层,在模型之间的交接单上
模型层已经不是OPC能下手的战场了。GPT-6 Astra开放给机构、Sol和Luna把推理成本往下压,Claude Opus 5.5比Opus 5便宜40%还在保留思考链,Gemini 3.5 Flash把输出速度拉到每秒280 token——每一家都在用价格和速度把模型变成水电煤。你再去训一个基座,除了烧钱,就是给下一轮降价当分母。
真正的空白在模型之间。
一个真实的工作流现在长这样:Claude Code接到需求,拆成子任务,一部分自己写,一部分扔给Codex跑测试,测出来的失败用例再回到Claude手里改。中间还夹着豆包读文档、千问翻合同、DeepSeek补一段算法。每换一次手,就丢一次上下文。谁写的这段、依据是什么、验收标准是什么、上一个agent为什么判定它没过——这些信息没人管,全靠人肉在几个窗口之间搬运。
这就是“交接单”的位置。研发从“写代码”变成“管代码”之后,瓶颈不再是生成能力,而是生成与生成之间的传递质量。Anthropic自己的R&D Automation Index里说得很清楚:截至2026年8月,Claude已经能在26%的AI研发工作里扮演lead角色,超过90%的受测工作AI至少达到协作程度。但没有任何一项工作达到完全无人监督。那10%到26%之间的落差,填的就是交接。
交接单上需要什么?至少这么几样:
- 任务契约:这段活是谁派的、边界在哪、什么算完成、什么算跑偏
- 上下文快照:上一个agent用了哪些文件、哪些假设、哪些被否决的方案
- 验收凭据:测试结果、diff、引用来源,能让人和下一个agent都复核
- 回滚路径:这一步错了,退回哪个检查点,代价是多少
这四样东西,模型厂商不会替你定义。它们只管把单个agent做得更强,不管两个agent之间的翻译。而这恰恰是OPC创业者最擅长的活——你不需要算力,不需要预训练,你要的是把散落在Claude Code、Codex、各家API之间的状态管道焊起来。
值得关注的是,这个位置有天然的粘性。模型越强、越便宜,企业越会同时用好几家的产品,交接的需求只会涨。今天一个团队用两个模型,明年就是五六个。谁来当中间那层?现在还没有标准答案。
舍予AI智能体这类“老板的第一支AI战队”的思路,切的就是这个口子——不是自己造一个更强的agent,而是让一支由不同模型组成的队伍能协同干活、有人管调度、有人管验收。OPC创业者如果还在纠结用哪个模型,方向就偏了;该纠结的是,你的交接单长什么样。
当Claude开始给Claude派活,谁来定义“这活干完了”?三个正在浮出的协作
26%这个数字之所以让人坐不住,不是因为Claude能干活,而是它开始给别人派活。
Anthropic那份R&D Automation Index里还藏着一个更扎眼的细节:超过90%的受测AI研发工作,AI至少已经达到协作程度;但没有任何一项,做到完全无人监督的自主。翻译一下——活派得出去,账结不了。模型之间有任务流了,缺的是验收线。
第一个正在浮出来的协作,是上下文接力。Claude for Excel和Claude for PowerPoint这两个加载项现在共享完整对话上下文,Claude在一个应用里做的每个动作,都被另一个应用里发生的事影响。听着像普通的体验更新,其实是交接单的雏形。以前我们给模型一段prompt,跑完就断片;现在它带着上半场的信息进下半场。谁把上下文丢了,谁的活就等于没干。
第二个,是母代理和子代理的分层。Claude Code里的技能与子代理机制,本质就是把一件大活切成若干可派发的单元,主代理负责拆和收,子代理负责干。Opus 5.5带出来的preserved thinking,价值也在这——思考状态被保留下来,"我为什么这么干"不再是一次性的,而是能传给下一个接手的节点。所以这一步的关键变量不是谁的模型跑分高,是任务能不能被无损转手。GPT-6 Sol和Luna把上一代的强能力压到更快更便宜这一侧,等于把派活的边际成本继续往下推。成本越低,瓶颈越往后移。
第三个最要命,也最少人谈:谁来定义"这活干完了"。
现在的通行做法还是人肉验收。26%的lead占比意味着,四分之一的研发工作流里模型已经在发指令、定方向,但每一步的收敛点仍然是人。这撑不了太久。规模一上去,验收就成了瓶颈——你不能让一个人去审四条并行链路,每条链路底下还各自带了子代理。
所以下一步真正会被抢的位置,是验收规则的写法。什么算完成、什么算边界情况、失败了往哪回滚、什么状态必须停下来找人,这些得被写成模型能读的结构,而不是留在老板脑子里当默契。
还有个细节挺有意思。2026年9月那批传闻,说Claude Code把部分Opus 5请求路由到一个叫"Opus 5.2"的新构建,真假不重要,它说明外界已经默认了一件事:模型会在背后自己调度模型,而且不告诉你。你连它此刻跑的是哪个版本都没底的时候,谈验收就有点像玄学。
舍予AI智能体那句"老板的第一支AI战队",我现在是这么理解的:重点不在战队,在于有人管交接单。一屋子能干的模型,如果没有统一的派活、交接、验收口径,那它不是战队,是噪音。
让Claude给Claude派活不难。难的是它回头问你"这算干完了吗"的时候,你得答得出来,还得答得让它能照着执行。
别做AI的监工,做AI协作的调度台:舍予AI智能体这类“老板的第一支AI战队”正

模型层的事,交给模型公司去卷。
九月这一个月,Opus 5.5 把运行成本压到比 Opus 5 低 40%,GPT-6 Sol 和 Luna 把 Astra 的能力下放到更快更便宜的档位,Gemini 3.5 Flash 每秒吐 280 个 token。价格往下走、速度往上走,这两条曲线一交叉,任何"我模型选得好"的护城河,寿命大概就是两个版本号。
真正稀缺的在另一头:谁决定这件事该不该做、做到什么程度算完、做完交给谁。
Anthropic 那个 R&D Automation Index 里还有一句被引用得多、被当真得少的话——超过 90% 的受测 AI 研发工作,AI 至少达到协作程度,但没有一项达到完全无人监督的自主层级。26% 由 Claude 当 lead,剩下那些不是 AI 干不了,是没人敢放手。这个差值,就是 OPC 创业者真正的地盘。
监工和调度台,是两种完全不同的活。
监工盯着每一次输出,逐行看、逐句改,本质是把自己塞进流水线最窄的那一环。只有一个 agent 时还行,三五个并行的时候,你就是那个必然的瓶颈。
调度台不盯过程,只定四件事:
- 任务边界——这个 agent 能碰哪些文件、系统、数据,不能碰什么
- 交接格式——上游给下游留什么上下文。Claude 在 Excel 和 PowerPoint 之间共享完整会话上下文,已经说明交接质量直接决定返工率
- 验收标准——"干完了"必须可验证,不是模型自称干完了
- 成本与权限——哪个活值得上 Opus 5.5,哪个丢给便宜档位,谁的 key 能动生产环境
这四件事,没有一家模型公司会替你写。他们优化 token 效率、推理缓存、preserved thinking,不优化你的验收单。
舍予AI智能体走的就是这条线——"老板的第一支 AI 战队"。它卖的不是一个更聪明的模型,是把调度台这件事变成一套能上手的东西:你定义目标和边界,战队去跑,你只在验收位出现。这可能是当下最被低估的一个落地场景。
带得走的三条。
把"我在干什么"重新数一遍。 拿张纸,写下上周最耗时间的十件事,凡是"检查 AI 输出对不对"这一类,全标出来。那就是你现在的监工工时,也是你最先该交出去的部分。
给每个 AI 岗位写一份 JD。 职责、权限、交付物、验收人。写不出来的位置,说明它还不该被自动化。
先建交接单,再谈多智能体。 一个 agent 跑得再好,如果不知道怎么把上下文干净地交给下一个,你拥有的只是一堆更快的孤岛。
模型会继续变便宜、变快、变多,这事不会停,也不用你操心。
你要操心的是另一件事:当十个 agent 同时在线,你的调度台上,有没有一份说人话的验收标准。这份标准写得越清楚,你能放手的半径就越大。