GPT-6价格腰斩那天,我让三个Agent替我值了个班:一份大模型周报的幕后复盘
GPT-6把推理成本打下来了,但真正省钱的不是模型本身
9月22日 GPT-6 上线,Luna 和 Sol 两个版本同时放出来,两天后那期 AI 新闻快讯直接用了「价钱再劈半」当标题。我当天就把我们几条 Agent 流水线的账单拉出来重算了一遍。
结论有点扫兴:省下来的钱,跟模型单价的关系没那么大。
先看这次发布本身,OpenAI 拆得挺清楚——Luna 面向高速大量任务,Sol 主打更复杂的工作,两个都挂上了百万级上下文的规格,还带多智能体编排预览、计算机使用、并行工具调用。这意味着你现在能做的事,比半年前多得多。
但真正的成本结构是单价 × Token 用量 × 返工次数。
第一项确实在腰斩,后两项在涨。我见过太多团队把上下文当免费资源,一次任务把整个代码库塞进去,Agent 之间来回传递完整历史,跑一轮下来 Token 消耗比模型降价前还高。GPT-6 的上下文窗口越大,这种浪费越隐蔽——它不会报错,只会安静地把钱烧掉。
更贵的是返工。一个 Agent 跑偏了,后面三步全在错误前提上推理,你要么人工兜底,要么从头再跑一遍。生成一次很便宜,改一次不便宜。这也是为什么 9 月 24 日那条快讯里那句提醒很关键:实际成本要连同 Token 用量和修正错误一起算。
基础设施层已经在补这件事。DigitalOcean 的 Managed Agents 把每个 Agent 放进独立 microVM,支持暂停、恢复、checkpoint 和受管工具连接。翻译成人话就是——跑错了能停下来,不用从头再来。这才是省钱的机制,模型降价只是把入场券变便宜了。
用量配额那一侧同理。ChatGPT Plus 到现在还是滚动 5 小时窗口叠加周上限,今年 7 月 12 日 OpenAI 因为用户抱怨 Sol 消耗过快,临时取消了 Plus、Business、Pro 的 5 小时限制并重置用量。你看,连官方都承认额度是可调的、不可承诺的。你唯一能信的只有产品内的计数器。配额限制从来不是省钱的手段,编排才是。
所以这一轮我们的做法是:把请求按难度分层路由,Luna 跑批量和检索,Sol 只接真正需要深推理的环节;Agent 循环里加显式的中断点,宁可多一次判断,不要多一轮无效推理;上下文按需注入,不做无脑全量灌。
我们自己内部搭的舍予AI智能体,定位就是「老板的第一支 AI 战队」——注意是战队,不是工具。工具你不会去管它的 Token 花销,战队你会。你会关心谁在干什么、哪一步卡住了、这次失败要不要重来。
GPT-6 把推理成本打下来,是好事,而且是大事。但账面省钱的关键变量,从来都在你怎么组织这支队伍。
Claude、Gemini、Grok同周更新,我为什么只给两个开了长期席位
成本打下来之后,问题反而变尖锐了:便宜不等于该用,能用不等于该留。这周 Claude、Gemini、Grok 挤在同一个窗口更新,我最后只发了两个长期席位。
先说我说的“长期席位”是什么意思。不是榜单第一,是每天早上打开终端它就在那儿:能无人值守跑完一段长任务,工具链和上下文不用我重新搬一遍,出了错我能定位到是哪一步。三条少一条,它就只能在试用席上待着。
Claude 拿走了第一席。 这周 Anthropic 放出 Claude Fable 5.1 和 Claude Mythos 5.1,官方引用的一线测试说法是“Fable 级的智能、Opus 级的价格、Sonnet 的速度”——比 Opus 5 快约两倍,token 用量减半。这句话的关键变量不在智能上限,在单位产出的消耗。同一段重构,少一半 token、快一倍,Agent 循环里就能多跑几轮才撞墙,这是能算出来的落地差距。另一个信号更实在:Salesforce in Claude 上了 beta,smart reports 开始统计团队怎么用、卡在哪、哪些重复模式值得打包。模型公司开始管“工作是怎么完成的”,这比多考几分重要。
Gemini 拿了第二席,但坐的位置不一样。 9 月 15 日 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 转 GA,两个 audio-to-audio 的实时语音模型。我给它席位不是因为它写代码最强,是语音这条入口它在跑,而且跑得比同行认真。另外媒体口径说 Gemini 4 可能提前发布,社群疯传的规格是 1000 万 token 上下文、输出翻 4 倍。泄漏就是泄漏,我不拿这个排期,但它至少说明谷歌在追推理成本和上下文长度这两件事——恰好就是上一节那个关键变量。
Grok 这周没进,而且我犹豫过。 不是不看好,是席位有成本。多留一个模型,就多一套 prompt、多一套工具 schema、多一轮评测,线上出问题的时候还要多花时间判断是模型漂了还是我的编排错了。这周它的动作,我没能在自己的场景里验证出不可替代的那一刀。没有那一刀,就先不进。
这条标准听起来苛刻,但给客户搭东西的时候会更苛刻。我做舍予AI智能体,定位写的是“老板的第一支 AI 战队”——战队不是人越多越好,是每个人都得有明确的上场理由,不然就是拿工资看饮水机。模型也一样,席位空着不丢人,养一个每周只调用三次的模型才丢人。
顺带说一句,席位不是终身制。我这边的规矩是按季度考核:这季度在名单里的,下季度可能直接掉到试用席,判断依据只有一条——它有没有替我多干成一件以前干不成的事。国内那桌牌怎么盯,是另一回事。
豆包、Qwen、DeepSeek、Kimi的国内牌桌,coding开发者该盯哪张
国内这桌牌,跟海外是两种打法。海外通常是模型能力推着产品往前走,国内更多是场景和价格在推模型走。所以坐在这儿,你该问的不是哪家更强,而是哪家能进我的工程流程,而且不出事。
豆包的强项不在某个单点指标,是把推理当基础设施来做——并发、配额、控制台、计费口径这些脏活干得比较整齐。它适合放在量大、非核心路径的位置:批量重构、生成测试、代码库的第一遍扫描。真到关键链路上,你多半还会想再压一道保险。
Qwen的价值在权重。
对做coding工具的人来说,能不能拿到权重,比榜单排名重要得多。私有化、微调、蒸馏成小模型塞进边缘设备,Qwen给国内团队留了一条很完整的路。你要是做那种要交付给客户的编码Agent,手里没有可自控的权重,商业模型一涨价,你就只能跟着改报价。这是主权问题,不是性能问题。
DeepSeek是那条鲶鱼。它每把推理单价往下压一轮,整个后端市场的谈判筹码就重排一次。对成本敏感的批处理——大规模代码检索、仓库级静态分析、CI里的自动review——这类活它够用,而且便宜到你可以不把它当成本项看。代价是峰值时段的稳定性得你自己压测,工程上必须预留降级路径。
Kimi从一开始就把长上下文摆在门面上,产品形态也更接近“能干活的东西”,而不是一个问答框。长文档、长代码库、多轮工具调用这些场景,它的完成度值得关注。但长上下文不等于长记性,真上生产,记忆和检索还得你自己搭。
在舍予AI智能体这边做交付,客户坐下问的第一个问题从来不是“哪个模型排第一”。老板们问的是:我这套AI战队里,谁管代码、谁管文档、谁盯数据。模型选型到他们那儿,早就不是技术题,是排班题。
所以coding开发者真正该盯的,只有三张牌。

一是配额和限流的实际口径,能不能稳定撑住你的CI,别今天跑得动明天就跑不动。二是工具调用和结构化输出的可靠性,返回的JSON是不是每次都合法,函数调用会不会幻觉出不存在的参数。三是它能不能自然进你的终端和流水线,而不是逼你为它单独维护一层胶水代码。
前两张牌,任何一家都可能某周翻车。第三张才是长期的关键变量。
榜单每周都在变,接口能不能嵌进你的工作流,才是你真正要押的东西。
把模型当同事而不是工具:OPC创业者下周就能抄的三件事
工具是等你下指令的,同事是会在你睡觉时把活干完、卡住了举手、干完了留个交接条的。这两者的差别不在模型多聪明,在你有没有给它一个"岗位"。
GPT-6 把推理成本再劈一半,Sol 啃复杂活、Luna 跑高频量大的任务,账面上确实省钱。但关键变量从来不是单价,是你敢不敢把一整段流程交出去。过去一年我见过太多团队,模型换到第三代,用法还停在"提问—复制—粘贴",省下的 token 钱还不够补上人来回复制的工时。
第一件事:给每个 Agent 写一份岗位说明书,而不是一堆提示词。
说明书里只有三样东西——负责什么、交付标准是什么、卡住了找谁。我自己那三个 Agent,一个盯竞品和模型更新,一个跑代码审查和回归,一个管内容初稿和分发。真正让它们能替我值班的,不是提示词写得多细,是边界划得多清。同事和工具最大的区别,是前者会越界,后者不会。
第二件事:把 Agent 的成本当工时核算,而不是当账单来看。
Claude 这周上线的 smart reports 值得关注,它直接告诉你团队在哪类会话上烧钱、哪里反复卡壳、哪些重复模式值得打包成固定流程。这跟 Fable 5.1 打出的"Opus 级智能、Sonnet 级速度、一半 token"是同一个方向——不是让你少花,是让同样的钱雇到更多班次。舍予AI智能体那句"老板的第一支 AI 战队",落点就在这儿:战队的成本结构,跟买工具完全是两套算法。工具买回来闲置是沉没成本,同事排好班是要出活的。
第三件事:让 Agent 有状态,别让它每次都从零开始。
DigitalOcean Managed Agents 那套在独立 microVM 里运行、可暂停可恢复可 checkpoint 的设计,才是"值夜班"的前提。你的 Agent 得能在你不在的时候停在某个中间态,早上回来接着往下推,而不是把昨天的上下文全倒进垃圾桶重来一遍。没有状态,就没有交接,也就没有真正的协作。
说到底,把模型当同事,不是一句态度,是三张纸:岗位说明书、成本表、值班表。
下周挑一件你每周至少重复三次的活,写清交付标准和边界,交给一个 Agent 连跑七天,周末只看一件事——它卡在哪。卡住的地方,就是你还欠它的那部分岗位定义。这也是"第一支 AI 战队"的实操版本:先招一个,把岗位磨清楚,再谈扩编。
成本腰斩那天,省下来的钱不该躺在账上。它应该变成你团队里多出来的那几个人。