Anthropic自曝26%研发已由AI主导,OPC创业者该把"人机分工"这四个字重新写一遍
AI已经坐到研发驾驶座上,只是还没拿到完全自动驾驶的牌照
你团队里最懂CI/CD的那个人如果这周请假,进度会停吗?Anthropic给出的答案有点扎心:它自己26%的AI研发工作,Claude已经在当lead。
不是辅助,是lead。Anthropic最新公布的R&D Automation Index里,截至2026年8月,Claude在超过四分之一的自有AI研发任务中扮演主导角色;超过90%的受测AI R&D工作,AI至少达到了协作程度。但同一个指数也写得很清楚:没有任何一项受测工作达到完全无人监督的自主层级。翻译一下——AI已经坐到研发驾驶座上,手扶着方向盘,但完全自动驾驶的牌照还没发。
这就是当前最真实的分工状态。不是“AI能不能写代码”这种过期问题,而是“哪一段研发链路可以交给它、交给它之后谁来兜底”。Anthropic自己先否了完全自主,这个信号比26%本身更关键。连做模型的人都还在副驾留人,OPC创业者更没必要一上来就幻想把整个技术栈扔给Agent。
但另一边的速度确实在推着人往前走。9月22日Claude Opus 5.5发布,多数工作达到Claude Fable 5.1的水平,运行成本比Opus 5低40%。Gemini 3.5在5月20日I/O亮相,Flash先上,输出速度每秒超过280个token,是GPT-5.5和Claude Opus 4.7的四倍以上。GPT-5年初也已经落地。模型能力在涨,成本在降,延迟在缩。关键变量已经不是“模型够不够强”,而是你的研发流程有没有被拆成可交接的模块。
拆不开,26%就只是别人家的数字。拆得开,它就是你的排期表。
哪些可以先交?我的判断是:单元测试和回归用例生成、代码审查的第一遍扫描、接口文档和变更日志、迁移脚本、边界清晰的小模块实现。这些活的共同点是输入输出明确、验收标准可写、出错能回滚。把它们从工程师手里摘出来,不是省人力,是让工程师的时间密度变高。
舍予AI智能体定位是“老板的第一支AI战队”,这个说法放在研发场景里特别贴切。它不要求你裁掉谁,也不承诺无人研发,而是让现有团队多出一支能接活、能并行、能按模块交付的AI小队。26%不是裁员信号,是倒计时——倒计时到你不得不回答:你的研发链路里,哪四分之一可以先交出去。
牌照还没发,但车已经在路上。等完全自动驾驶的人,会先被旁边那辆有人盯着、AI开着的车超过去。
%不是裁员信号,是OPC把研发流程拆成"可交接模块"的倒计时
有人看到 26% 的第一反应是"Anthropic 要裁研发了"。这个读法错了,而且错得挺危险。
Anthropic 的 R&D Automation Index 测的不是"AI 会不会写代码",测的是有多少工作项可以让 Claude 以 lead 的身份推进。lead 这个词是有门槛的——它意味着这件事有明确的输入、明确的产出、明确的验收标准,做完了有人能一眼判断对不对。26% 不是 AI 抢走了 26% 的岗位,是 Anthropic 的研发流程里,已经有 26% 的工作被切成了这种形状。
剩下的 74% 没被切出来,不代表 AI 干不了。超过 90% 的受测工作,AI 至少已经达到协作程度。卡住的不是模型能力,是任务边界。
这才是 OPC 创业者该盯的关键变量。
一人公司最缺的从来不是人手,是把活儿说清楚的能力。大厂靠流程、靠周会、靠层层 review,把模糊的工作磨成可交付件;OPC 没有这层缓冲,一个人脑子里同时装着需求、架构、排期和客户发来的语音,交接给谁?过去的答案是"招人",现在变成了"先拆"。
拆的动作比想象的土。一份 PRD 拆成竞品调研、接口定义、数据模型、脚手架、单测、迁移脚本、上线清单——每一块写清楚三件事:输入是什么、输出长什么样、怎么算合格。这三件事写不出来的模块,AI 也接不住,因为它连"做完了"都判断不了。
反过来,只要这三件事写得出来,交接成本就低得离谱。Claude Opus 5.5 在 9 月 22 日发布,多数工作上的表现对齐 Fable 5.1,运行成本比 Opus 5 低 40%。这个价格曲线的意思很直白:一个可交接模块被交出去,经济账已经算得过来了。模型侧还在补上下文这一环——Claude 现在能跨 Excel 和 PowerPoint 共享完整对话上下文,能在响应里直接生成图表和可视化,能通过 MCP 接进你自己的工具和数据,开发者也早就习惯在终端里把整段编码任务丢给 Claude Code。这些不是炫技,是把"交接"所需的上下文管道铺好。
Gemini 3.5 那条线更激进,Flash 主打 Agent 任务,输出速度每秒 280 个 token 以上,是同期几款旗舰的四倍还多。速度本身不解决边界问题,但它把"试一次"的成本压到几乎可以忽略——你今天就可以先把一个模块切出来,丢给 AI 跑一遍,不合格就重切,损失的是几分钟。
所以这份倒计时的真正指向,不是"你什么时候被替代",是"你的研发链路什么时候拆完"。
拆不完的那部分,才是创始人真正该亲自做的事:判断做什么、判断什么不做、跟客户建立信任、决定技术路线往哪拐。这些事没有验收标准,也交接不出去,短期内 AI 也接不住。
反过来说,能拆出去的部分越多,你一个人能撑起的盘子就越大。这也是舍予AI智能体把自己定义成"老板的第一支 AI 战队"的底层逻辑——OPC 的扩编方式不再是加人头,而是加模块、加可交接的工作项。
先别问 AI 能不能替代你。回去把自己的研发链路摊开,数一数里面有多少个模块,是能写清楚输入、输出和验收标准的。
那个数字,大概率比 26% 高。
反方说"AI主导研发等于人类被架空",但Anthropic自己先否了完全自主这一
反方的担忧我理解,但有个事实得先摆出来:Anthropic 那份 R&D Automation Index 里,26% 是 Claude 能"lead"的比例,而完全无人监督的自主层级是零。Anthropic 自己把话讲得很清楚——目前没有任何一项受测工作达到那个层级。
这个零不是技术做不到,是边界刻意留的。
"主导"和"替代"是两码事。你让一个资深工程师 lead 一个模块,不等于这个模块从此不需要人。Anthropic 的测量口径其实分了层:能 lead 的 26%,能协作的 90% 以上,能完全自主的 0%。反方把三个层级混成一个词叫"架空",这就是讨论跑偏的地方。
值得关注的是 90% 这个数字。它说明 AI 已经深度嵌入研发流程,但 Anthropic 用的词是 collaborate——协作。协作的意思是,有一个人的判断还在回路里。你看它 9 月 22 日刚发的 Claude Opus 5.5,成本比 Opus 5 低 40%,带 preserved thinking,这些工程优化全指向一件事:让 AI 更可靠地待在这个回路里,而不是被踢出这个回路。
- 完全自主 = 0,这是当下的红线
- lead = 26%,这是正在发生的事
- collaborate = 90%+,这是已经发生的事
三条线上,人在哪?人在那条零线上。责任、后果、最终判断的归属,还压在人身上。这不是 AI 的短板,是组织的分工选择。
对 OPC 创业者来说,这个结构反而是好消息。

你不需要纠结"AI 会不会把我架空"——Anthropic 自己都没敢把最后一层交出去,一个几十人的团队慌什么。真正该问的是:我的研发链路里,哪一段已经能被 AI lead,哪一段还卡在"必须我亲自过一遍"。这个差距就是你的效率缺口,也是你的成本缺口。
舍予 AI 智能体那句定位说得很准,"老板的第一支 AI 战队"——关键词是战队,不是替身。老板是下判断、担结果的那个人;战队负责把 90% 的协作量吃下来,再把 26% 的 lead 位顶上去。人被架空的前提,是人本来就站在执行位上。一旦你转到指挥位,"架空"这个词就用不上了。
反方真正该担心的,不是 AI 主导研发,而是有人还没把自己的位置往上挪一层。等 26% 涨到 50%,还在原地做执行的人,才会发现自己手上没牌可打。
技术乐观不等于盲目。Anthropic 那条零线提醒的其实是这件事:加速没问题,但最终判断权别让出去。这不是保守,这是把边界设计对。
别问AI能不能替代你,问你的研发链路里哪26%可以先交出去
别问AI能不能替代你,这个问题从提出来那一刻就偏了。
替代是一个二值判断,而真实世界的研发链路根本不是二值的。它是一条从需求、方案、写码、评审、测试、上线到观测的流水线,每一段的输入输出清晰度、错误可发现性、返工成本都不一样。二值问题套在一条非二值的链路上,结论必然是"看情况"——那等于没问。
Anthropic 那份 R&D Automation Index 给了个更锋利的问法:截至 2026 年 8 月,Claude 已经在 26% 的 Anthropic 自家 AI 研发工作里扮演 lead;超过 90% 的受测工作,AI 至少到了协作程度;但没有任何一项达到完全无人监督的自主层级。这三个数字连起来读,意思很清楚——26% 不是概率,是坐标。它告诉你边界在哪,而不是命运在哪。
所以你要做的动作只有一个:把链路摊开,逐段过三道筛子。
- 这段的输入输出,能不能用一段话写清楚?
- 它错了,能不能被自动发现,而不是等用户来发现?
- 返工一次的代价,是十分钟还是三天?
三个都打勾的,就是你自己的 26%。顺序也基本确定:输入输出最容易写清的先走——单测、脚本、数据清洗、样板代码、CI 配置、变更说明;然后是能自动验证的——回归、覆盖率、静态检查;最后才轮到需要判断力的架构选型和方案取舍。倒过来做,一定翻车。
交出去不等于放任。9 月 22 日发布的 Claude Opus 5.5,官方说性能对标 Fable 5.1、运行成本比 Opus 5 低 40%,便宜是真的,但便宜不是"可以不管"的同义词。Anthropic 自己都承认没有工作到完全自主,这时候正确的姿势是人在环上,不是人在环里。
工具层的进展也在把"交接"这件事的成本往下压。Claude 的 Excel 和 PowerPoint 加载项现在共享完整对话上下文,一边的操作会受另一边所有动作影响;Gemini 3.5 是第一个主打 Agent 任务的模型,输出速度每秒超 280 token,官方口径是 GPT-5.5 和 Claude Opus 4.7 的 4 倍以上。这些不是炫技,是把"我把这段交给你、你做完再交回来"的摩擦成本降到足够低——低到一次交接比你自己动手更划算。
这也是舍予AI智能体把自己定义成"老板的第一支 AI 战队"的原因。关键词是战队,不是外包,也不是替代。编入建制,给番号、给验收标准、给复盘节奏,它才打得动仗。
今天就干一件事:拿一张纸,把你们从需求到上线的链路切成不超过十段,每段写上输入、输出、验收标准。写不出来的那几段,先别急着交。写得出的一段,这周就交出去,用两周看结果。下个月再加一段。
26% 不是一个统计数字,是你的第一份分工表。