Claude Opus 5.5把“记忆”做成了可编程接口,OPC的交付账本要翻到新一页

舍予基业来源:公众号「舍予AI智能体」
Claude Opus 5.5把“记忆”做成了可编程接口,OPC的交付账本要翻到新一页
拆解 Claude 九月更新中可编程压缩对话与动态工具注入两项能力,指出长时 Agent 的成本大头是上下文腐烂而非模型调用,帮团队把记忆治理写进交付流程。

九月三十一号更新看完,我想先跟你聊聊那行不起眼的beta说明

把九月的更新翻完,我做的第一件事不是去看 Opus 5.5 的跑分,而是回头把 9 月 14 日那行 beta 说明又读了一遍。

Claude Platform 九月一共 31 项更新。Sean Liu 那份梳理我认同:Anthropic 正在把“长时间运行的 Agent 工作流”放到产品设计的正中央——模型能力、上下文管理、成本控制、人工监督,四件事被摆上同一张桌子。

9 月 22 日,Opus 5.5 发布,Claude 5.5 系列的第一款,也是产品线里最强、最贵的那一档。同一天还有一项动静小得多的更新:允许在对话途中定义工具,工具和参数结构可以边跑边加。

但动到交付逻辑的,是 9 月 14 日那个可编程压缩对话的 beta。

它把一件事的决定权交了出去:什么时候整理历史内容、保留哪一段近期对话、留下哪些符合条件的思考状态,全由应用自己说了算。听着像工程细节,实际上它动的是成本结构的根——长时 Agent 的账单大头从来不在模型调用,而在上下文被反复搬运、反复腐烂。谁控制压缩时机,谁就控制这条流水线烧多少钱。

同一个月,OpenAI 在 9 月 29 日 DevDay 发了 GPT-6.1 Sol,主打单任务成本只有旗舰的五分之一;Google 的 Gemini 4 Argon 也在九月落地。三家的动作摆在一起看,模型层依然卷得凶。可 Anthropic 这一轮卷的是另一层:它不跟你比单次回答多聪明,它管的是一个跑上几小时甚至几天的任务,怎么不乱、怎么不烧钱、怎么让人还能插手。

外行看榜单,内行看交付。

我的判断是,接下来半年团队之间拉开差距的关键变量,不会是能不能调通 Opus 5.5——那个门槛已经被抹平了。分水岭在于,你能不能把“对话何时被压缩、工具何时被注入、人何时该介入”写进自己的流程里。这几件事全是产品决策,不是模型决策。

跟客户聊的时候感受更直接。老板们不关心榜单第几名,他们问的是这套东西能不能像一支战队那样,把我这条流程接过去,还得接得稳。我们在舍予AI智能体这条线上给客户的定位就是“老板的第一支 AI 战队”,说到底也是同一件事——交付的不是一次问答,是一条能自己跑下去的流程。

那行 beta 说明之所以不起眼,是因为它写的是“beta”,不是“新模型”。而 Anthropic 把 9 月 14 日和 9 月 22 日排得这么近,态度已经说得很清楚:Agent 不是一次问答,是一段需要被运维的长跑。

长时Agent真正贵的不是模型调用,是上下文腐烂

九月三十一号那批更新里,有一行 beta 说明被大多数人划过去了。但做长时 Agent 的人都该盯着它看一会儿——因为它直接戳中了这个赛道最疼的那根神经。

先把账算清楚。今天做 Agent,很多团队的成本模型还停留在一个朴素公式上:token 单价 × 调用次数。于是选型会上吵来吵去,核心就一句——Opus 5.5 比 GPT-6.1 Sol 贵,要不要换。有人翻出那张对比图,说 OpenAI 的图表显示 GPT-6.1 Sol 在单任务成本上占优,Opus 5.5 在最大努力下上限更高。这类讨论有意义,但它算的不是真正的账。

真正的账单在另一个地方。Claude Code 和 OpenCode 那组独立评测做过同一件事:同样的两个模型、同样的 12 个小型 Python 任务,每成功完成一个任务,Claude Code 要吃掉五万二千到五万五千 token。请注意,任务本身有多小。这五万多 token 里,绝大部分不是"思考",是它往复读取自己的历史、重试失败的编辑、把已经确认过的信息再确认一遍。

这就是上下文腐烂。它不是上下文长度不够,恰恰相反——窗口越来越大,塞进去的东西越来越多,旧信息没有被清理,新信息还在堆积,模型每次决策都要在这堆混合物里重新找回方向。任务跑得越久,腐烂越深,token 消耗曲线就开始指数上扬。你付的钱没变,但每一块钱买到的有效推理越来越少。

长时 Agent 的成本曲线,从来不是调用次数画出来的,是腐烂速度画出来的。

这也是为什么我看到 9 月 14 日那个可编程压缩对话的 beta,第一反应不是"又一个上下文管理功能"。应用可以自行决定何时整理历史内容,并保留近期对话与符合条件的思考状态——听起来平淡,但它把"什么时候该遗忘"这个决策,从模型的隐式行为变成了工程上的显式控制。紧接着 9 月 22 日加入的对话途中定义工具,让工具和参数结构可以在流程里动态调整。两条放在一起看,方向就很清楚了:Claude 正把长时间执行的 Agent 工作流放到产品设计的核心。

不过我得说句泼冷水的话。接口给了你,不等于你会用。把压缩点设错地方,比不压缩更糟——你在模型刚建立完上下文关联的时候把它清掉,它就得从头再推一遍,成本反而更高。这项能力真正的门槛不在 API 调用,在你对自己业务流程的理解深度:哪一步是真正的状态切分点,哪一段历史是必须完整保留的决策依据。

关键变量在这里。模型能力的差距正在被拉平,但上下文运营能力的差距才刚刚开始拉开。同样一套 Agent,会做记忆治理的团队和处理方式粗暴的团队,跑到第三个小时,成本结构会完全不同。前者是线性增长,后者是墙——撞上就停。

所以别再只盯着单价表了。那个数字是入场券,不是胜负手。

可编程压缩对话,等于把“交付记忆”交给了创业者自己

九月那31条更新里,真正会被写进明年架构文档的,可能是9月14日那条beta:可编程压缩对话。官方表述很克制——让应用自己决定何时整理历史内容,并保留近期对话与符合条件的思考状态。

说白了,以前"记忆"是服务端的黑箱。

你在提示词里塞多少上下文、模型能记住多久、历史什么时候被截断、被摘要成什么样子,全是平台默认策略。开发者唯一能做的是把prompt写得更啰嗦一点,然后祈祷。长跑Agent跑到第三十轮突然忘了自己为什么改这行代码,你连复盘都找不到入口。

现在这一层被撬开了。压什么、留什么、什么时候压,写在你自己的业务代码里。它跟你的状态机、任务队列、失败重试是同一类东西——工程资产,不是玄学。

这跟上下文腐烂那件事正好接上。腐烂是物理规律,注意力就那么多,谁也躲不掉。但腐烂的曲线是可以设计的:什么时候保留原始对话、什么时候只留一份结构化的思考状态、什么时候彻底落盘成外部记忆。以前这条曲线是平台替你画的,现在你自己画。

关键变量在这:记忆策略从平台的默认值,变成了你的交付物。

这两个词差别很大。默认值是所有人的天花板,交付物是你的护城河。同样是做一个客服Agent,别人每轮重灌一遍历史,你在第五轮做一次压缩、把关键约束抽成思考状态留着——成本曲线和崩溃点完全不在一个量级。这不是提示词技巧,这是架构选择。

9月22日那条"对话途中定义工具"是同一个方向:运行时可变。把这波更新连起来看,Anthropic在做的事,是把长时Agent的运行时状态一点点从黑箱里掏出来,交回开发者手上。Opus 5.5把能力上限抬高了没错,但决定一个Agent能不能真的跑完三个月的,从来不是上限那几分。

落地场景已经很清楚。代码Agent要跨天跟进一次重构,法务Agent要记住三个月前那版合同的口径,销售Agent要在第四十次触达时依然知道客户上次明确拒绝过什么。这些都不是"模型再聪明一点"能解决的,得靠记忆编排。

配图

  • 记忆存在哪,是成本
  • 什么时候压缩,是策略
  • 压缩后丢了什么,是风险

这三样东西,现在都在你手里。

这也是我为什么一直觉得,舍予AI智能体那种"老板的第一支AI战队"的定位,往后拼的不是谁家模型调得更顺,而是谁能把一支战队的经验沉淀成可继承的记忆。人离职会带走客户关系,Agent重构会丢掉上下文——这两个问题的解法,开始长得越来越像。

库要装好,账要记清。交付物变了,报价单自然也得跟着改。

从按次交付到按流程托管,OPC的报价单该怎么改

报价单上最该改的一行,不是单价,是计价单位。

按次交付这套逻辑能成立,是因为交付物是确定的——一次调用、一个脚本、一份报告。客户付钱买的是结果本身。但当你要托管一段长时流程,真正被消耗的不是那一次调用,是你替他维护的那套上下文:什么时候压缩历史、压到什么颗粒度、哪些思考状态必须留着、哪些工具定义得跟着流程走。9月14日那个可编程压缩对话的beta,把这件事从「模型自己看着办」交到了应用手上。关键变量就在这:上下文维护从平台的黑盒,变成你的工程量,也变成你的成本项。

计价单位该从「次」换成「周期」。

客户买的不是那一次输出,是这段记忆在N周里不腐烂、这个Agent不掉线、碰到边界时有人接得住。

报价单至少拆四块:

  • 接入与建模费,一次性。把客户的流程拆成Agent能跑的节点,定义工具和参数结构。9月22日平台开始支持在对话途中定义工具,这东西从「预先钉死」变成「可演进」,但骨架得你先搭。
  • 上下文托管费,按月。新增项,也最容易漏。压缩策略、状态保留、检索边界,都要持续调。
  • 模型路由成本,按用量。别拿一个模型打天下。GPT-6.1 Sol的令牌价格是旗舰Astra的五分之一,长尾判断交给它,关键节点再上重模型。这一层做得好不好,直接决定你赚的是辛苦钱还是结构钱。
  • 结果分成,可选,但那是天花板。

还有个被低估的东西:smart reports这类能力在替你记账——团队怎么用、钱花在哪、哪里卡壳、哪些重复动作值得打包成共享技能。以前你报托管费是拍脑袋,现在摩擦点和复用率都摊在台面上,报价从「我觉得值」变成「数据说值」。所以从今天起,每个客户的流程日志留一份,那是你下一份报价单的底稿。

说到底,客户到底在为什么付钱?舍予AI智能体把自己定位成「老板的第一支AI战队」,卖的就不是某一次任务,是这支队伍长期在场。方向是对的。

三条能带走的建议:这周挑一个跑得最久的Agent流程,把上下文维护成本单独拉出来算一遍;把报价单改成「接入费+月度托管费」两段式,先别怕客户嫌贵;然后,把每次交付都当成下一份报价单的样本。

记忆可编程了,你的定价权也该跟着可编程。

#舍予基业#SheYuGroup#长时Agent上下文管理#可编程压缩对话#AI智能体交付#上下文腐烂成本#Agent记忆治理#Claude Opus 5.5

想知道舍予基业装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案;不方便留号码,也可以直接 WhatsApp 找我们。