Claude Opus 5.5直降四成,OPC创业者别急着欢呼:先把代理工作流从演示推进到日结
给老读者的一封信:模型降价从来不是新闻,能算清账才是
9月22日,Anthropic 发了 Claude Opus 5.5,成本比 Opus 5 低 40%。群里一片“便宜了”。我做的第一件事,是翻出上个月团队跑代理工作流的账单,看了十分钟——然后有点扫兴。
降价从来不是新闻。 过去两年,这件事每隔几个月就发生一次:GPT-5 年初落地,Gemini 3.5 在 5 月的 I/O 上把输出速度拉到每秒 280 token,现在 Opus 5.5 在大多数工作上做到 Claude Fable 5.1 的水平,价格砍掉四成,还带 preserved thinking。单价的曲线一路向下,可我问过一圈做 OPC 的朋友,没几个人的总成本跟着这条曲线往下走。
问题出在哪儿?因为降价动的是 token,动不了人。
把一条代理工作流的成本拆开,大概是三块:模型调用、人的兜底、错误返工。Opus 5.5 打掉的只是第一块的 40%。你的账本里如果 token 占三成,总成本降 12%;token 只占一成,降 4%。这个数字得能覆盖你重新设计工作流、重跑评测、调提示词和工具链的工程时间,才叫真的省。
Anthropic 自己放出的 R&D Automation Index 挺说明问题:截至 2026 年 8 月,Claude 已经能在 26% 的 AI 研发工作里扮演 lead 角色,超过 90% 的受测工作至少达到协作程度——但没有任何一项做到完全无人监督。
这句话翻译成生意语言就是:人还在环里,人工成本还是大头。 模型再便宜,只要你每个环节都要人接一手,降价的收益就被稀释掉了。
那什么时候该兴奋?当你的流程是 token 密集型、步骤标准化、错了能回滚——降价会直接改毛利,这时候多跑几轮推理、多挂几个子代理都是划算的。反过来,如果你的瓶颈是需求没想清楚、数据没接进来、审核全靠人肉盯,Opus 5.5 降多少都跟你没关系。
我见过太多团队把“模型降价”等同于“可以上量了”,结果量上去了,兜底的人也得上,最后单均成本没降,交付质量反倒更不稳。
对老读者,我想说的其实只有一句:2026 年做 AI 创业的基本功,是把“模型降价”翻译成“我到底省了哪一块、能多接几单、能少雇几个人”。 算不清这笔账,降价就只是新闻;算清了,它才是利润。
接下来我会把这三块成本逐块拆开,看看 Opus 5.5 到底替你省了哪一块,以及哪些流程现在就该从人肉改成交付。
代理工作流最贵的三块成本,Opus 5.5到底替你省了哪一块
把账拆开看,代理工作流真正烧钱的地方只有三块。
第一块是 token,明面上的成本,也是最容易被厂商拿来做文章的。Opus 5.5 在 9 月 22 日发布,Anthropic 的官方说法是:大多数工作的表现对齐 Claude Fable 5.1,运行成本比 Opus 5 低 40%。这句话翻译成创业语境就是——同样的复杂任务,你原来一天跑 100 条链路会心疼,现在可以跑 160 条还多。对于按次收费、按调用量堆利润的业务,这 40% 直接落在毛利上,是实打实的。
第二块是上下文重建成本,这块最隐蔽,也最容易被忽略。
你让一个代理去做一件真实的活,它第一步不是思考,是回忆。项目规范、历史决策、上下游约定、上一次为什么改了那个字段——每换一个会话窗口,这些就要重新灌一遍。钱是次要的,时间和一致性才是。Opus 5.5 带了 preserved thinking,Anthropic 今年 3 月又把 Claude for Excel 和 Claude for PowerPoint 的加载项改成共享完整对话上下文,一个应用里的每个动作都受另一个应用里发生的事影响。这意味着跨工具的搬运工作开始由模型自己承担,而不是靠人肉复制粘贴当胶水。做过多步流程的人都知道,胶水才是真正的税。
第三块是监督和验收,这块 Opus 5.5 基本没替你省。
值得关注的是 Anthropic 自己的 R&D Automation Index:截至今年 8 月,Claude 已经能在 26% 的 Anthropic AI 研发工作中扮演 lead 角色,超过 90% 的受测工作至少达到了协作程度——但官方同时强调,没有任何一项受测工作达到完全无人监督的自主层级。这是我最希望每个做代理工作流的团队贴在墙上的一句话。模型变便宜、变聪明,改变的是「跑得起」,不是「看得住」。
这两件事在财务上完全不是一回事。token 降四成,是让长链路可以反复重试、可以并行探索、可以在真实数据上多跑几轮;但验收环节的人时、评测集的搭建、出错时的回滚路径,一分钱没少。上线之后你会发现,瓶颈从「成本太高不敢跑」变成了「跑完没人有精力验」。
关键变量就在这里。谁把验收那一段做成工程——定义清楚什么算通过、什么必须人工介入、失败以后系统怎么自己收拾——谁才真正吃到这 40%。剩下的人只是把账单挪了个位置,从 API 账单挪到了自己团队的工位上。
前两块省下来的钱,应该立刻投进第三块的建设。这是 Opus 5.5 给代理工作流最诚实的一次降价。

窗口期只有三到六个月:现在该把哪类复杂流程从人肉改成交付
三到六个月。 这不是拿来贩卖焦虑的数字,是账期给的。
Opus 5.5 在 9 月 22 日发布,跑大部分工作的水平对齐 Claude Fable 5.1,成本比 Opus 5 低 40%。降价本身没价值,有价值的是它把一批原本算不过来的流程,重新算到了盈亏线以上。之前一个复杂流程单次跑下来要十几块,你只能拿它做演示;成本掉到几块钱,它就能进日报表。演示和日结之间隔的就是这道成本线,而这条线现在被下移了——你的竞争对手也看到了同一个数字。
判断哪类流程该现在从人肉改成交付,我的标准就三条:输入结构稳、错误能自动检出、产出有验收标准。缺一条,你做的不是交付,是玩具。
具体先动这三类:
- 每天或每周固定跑一遍的搬运算。 跨系统数据汇总、对账、工单分流、竞品和舆情晨报。共同点是输入格式固定、结论对错一眼能验,模型错了当天就暴露,不会烂在肚子里。
- 人肉在做“读取—判断—填表”的活。 合同条款比对、简历初筛、素材合规检查、发票信息提取。人做这些的价值不在于聪明,而在于耐烦,这恰好是代理最长的板。落地场景选对,替代率非常高。
- 有明确验收物、且验收物本身能自动化的活。 代码改动配测试,文案配审核清单,报表配校验规则。没有验收器,你就没法把“人再看一遍”这个环节省掉,规模永远上不去。
反过来,需求每周都在变的流程先别碰;错了要赔钱、又没有自动验证回路的别碰;关键知识只存在老板脑子里的更别碰——那不是给 AI 写提示词,是给自己做知识审计。
Anthropic 自己放出的 R&D Automation Index 给了一个很清醒的坐标:截至 2026 年 8 月,Claude 已能在 26% 的 AI 研发工作里担任 lead 角色,超过 90% 的受测工作至少达到协作程度,但没有一项达到完全无人监督的自主层级。翻译到业务流程里就是:代理能干掉九成,最后一脚必须留人。
所以真正该设计的形态不是全自动,而是“代理干到日结、人只做抽检”。听着像降级,实际是把吞吐量放大了一个量级。
窗口期短,关键变量不是模型继续变强,而是流程资产会贬值。你今天手写成 SOP 的那套东西,半年后大概率变成工具的默认能力。到那时候,值钱的不再是你会不会用,而是你有没有一条每天在跑、每天有数据回流的产线。没有产线,模型再便宜也跟你无关。
这个窗口里,跑通一段比同时开五个 POC 有用得多。舍予AI智能体这类“老板的第一支AI战队”进场时,能接住的也正是你已经跑顺、只是缺人手扩规模的那一段,而不是替你把没想清楚的流程从头再想一遍。