Claude Haiku 5.5 成本砍掉75%那天,我把公司三个AI功能全下线重写了

舍予基业来源:公众号「舒毅讲AI」
Claude Haiku 5.5 成本砍掉75%那天,我把公司三个AI功能全下线重写了
对比 Claude Haiku 5.5、Gemini 4 Argon 与 GPT-Next 的选型逻辑,拆解客服、内容批处理、代码审查等场景,给出按任务难度分级配引擎的降本方法。

一个信号:小模型正在吃掉大模型的活

上周我把公司三个 AI 功能的计费单拉出来对齐了一遍,发现一个很别扭的事实:跑在最贵旗舰模型上的那些活儿,其实根本不需要旗舰。

这不是省钱省出来的错觉。10 月 8 日 Anthropic 发布 Claude Haiku 5.5,官方给的数字是平均运行成本比上一代 Haiku 4.5 降了约 75%。注意这个量级——不是 7.5%,是四分之三直接抹掉。而这只是 Haiku 系列,一个定位就是「小而快」的产品线。真正值得关注的信号不在 Anthropic 一家身上,是它和另外两件事撞在了同一周:10 月 3 日谷歌发布 Gemini 4 Argon,主打长周期推理和软件工程,输出 Token 上限从上一代 6.4 万拉到 100 万;同期 OpenAI 那边 GPT-Next 曝光,配合所谓「连续 28 天发版」的节奏。

一端在往极限能力上冲,另一端在往单位成本上砸。这个剪刀差,才是行业真正的关键变量。

过去两年我们形成了一个很懒的默认动作:要做 AI 功能,先选最强的模型。逻辑是「能力强 = 效果好 = 用户满意」,成本是后置的、次要的。但这套逻辑建立在一个前提上——强模型的成本高到可以忍受。现在这个前提正在瓦解。当小模型的成本掉到旗舰的一个零头,而它在分类、抽取、改写、意图识别这些任务上的通过率又足够稳,那「先上旗舰」就从稳妥变成了偷懒。

我在舍予AI智能体这边看到的落地场景很典型。老板们要的第一支 AI 战队,干的活大多是客服应答、工单分派、文档摘要、会议纪要这类高频但低智力密度的任务。这类活儿的特征是量大、可拆解、对单次结果容错高。你把它们挂在旗舰模型上,等于雇一个博士去贴快递单——他不是干不了,是贵得没道理。

更微妙的是,很多人担心小模型「不够聪明」。这个担心在 2024 年成立,在 2026 年大概率过时了。得承认,在需要长链推理、复杂代码重构、多步规划的活儿上,旗舰依然是不可替代的。Haiku 5.5 再便宜,也不会有人拿它去做大型代码库迁移。但问题在于,一家公司 80% 的 AI 调用量,到底有多少落在那个「长链推理」的区间里?

我的答案是:远不到 20%。

剩下的,早就该换引擎了。

算一笔账:Haiku 5.5、Gemini 4 Argon、GPT-Next同日

十月第一周,三家把牌摊在了桌上。10月8日 Anthropic 发 Claude Haiku 5.5,官方口径是平均运行成本比 Haiku 4.5 降约 75%;往前五天,10月3日谷歌的 Gemini 4 Argon 亮相,输出 Token 上限从上一代 6.4 万拉到 100 万,主攻长周期任务推理、软件工程和企业知识处理,但暂时不对普通用户开放,先给网络安全领域经过筛选的专业人员用;中间夹着 OpenAI,那个"连续 28 天发版"的军令状已经开跑,首日主力模型提速 50%,GPT-Next 也跟着曝光。

三件事挤在同一周,不是巧合,是三条路线在同一个路口撞上了。

先把账摊开算。旗舰在往上走——Argon 把输出上限抬到 100 万 Token 这个量级,意味着它能一次性啃下几十万 Token 的复杂任务,谷歌内部已经在拿它做大型代码库迁移。这种能力确实贵得有道理,但它解决的是"以前根本做不了"的问题,不是"以前做得好但太贵"的问题。

Haiku 5.5 走的是反方向。成本砍 75%,性能和速度同时往上提,瞄准的是大批量、对成本敏感的场景——这恰恰是绝大多数公司真实在跑的活儿。你以为你在用旗舰,其实你的客服分类、日志摘要、PR 初审,每天都在烧旗舰的钱干小模型的活。

中间还有个变量:GPT-Next 到底落在哪一档。OpenAI 这轮提速 50% 的路数,看起来是想在"够便宜"和"够聪明"之间再切一刀。值得关注的是它最终定价——如果落在 Haiku 5.5 和 Argon 之间,那大多数团队的选型逻辑得推倒重来。

我自己踩过这个坑。前两年做功能,谁强用谁,账单是月底才看的。等到某个功能单月推理成本超过它带来的营收,才反应过来选型一开始就错了。现在舍予AI智能体给客户搭"老板的第一支 AI 战队",第一件事不是挑最强的模型,是先把每个环节的活拆出来,按任务难度分级配引擎——高价值的复杂推理留给旗舰,高频低难度的活儿直接下沉到小模型。

数字上的差距有多狠?同样一百万次调用,旗舰和 Haiku 5.5 之间的成本差,够再养一个中型工程团队。这不是省钱的账,是"同样的预算能做多少事"的账。

关键变量从来不是谁的榜单分高。是单位成本下,你的任务通过率是多少。

落地场景:从客服到代码审查,哪些环节现在就该换引擎

落地场景这件事,判断标准其实很朴素:输出有没有明确的对错边界,调用量大不大,错了谁背锅。三条一对,答案基本就出来了。

客服系统是现在就该换的第一站。意图分类、情绪打标、工单路由、订单号抽取,这些子任务的正确答案几乎唯一,拿几百条人工标注就能建评测集。Haiku 5.5 的官方定位写得很直白——大批量、成本敏感。平均运行成本比上一代降约75%,同样的预算能多跑近四倍的量。以前因为贵只能抽检一小部分对话做质检,现在可以全量过一遍。这不是"省了点钱",这是产品能力边界往外推了一截。

  • 该换:意图识别、FAQ召回后的重排、会话摘要、结构化抽取、多语言改写
  • 不该换:涉及退款、赔付、合规承诺的最终决策,仍然要留大模型兜底,或者干脆留给人

内容批处理同理。DeepSeek-V3.2-Exp、GLM-4.6、MiniMax-M2 这批国产模型在9月到10月密集更新,价格战打得很凶,批量生成、翻译、打标签这种活,没必要再挂在旗舰模型上烧。

代码审查要拆开看,这是最容易被一刀切搞砸的地方。

一层是机械性的:命名规范、明显的空指针、日志漏打的字段、单元测试没覆盖的边界。这类问题模式重复、规则清晰,小模型完全够,而且快。我们给客户搭"老板的第一支AI战队"时,排兵逻辑就是这样——便宜的兵去站岗,贵的兵去攻坚。

另一层是跨模块的:并发竞态、状态机漏掉的转移、改一个接口影响到三个上游。这才是 Opus 5.5、GPT-6 Astra、Gemini 4 Argon 的战场。Argon 的输出上限从6.4万Token提到100万,谷歌内部已经拿它做大型代码库迁移——这种长周期任务,小模型顶不住。Artificial Analysis 的综合评测里,Argon 在 High 推理设定拿到53分,和 GPT-6 Astra 的 Max 设定同分,Opus 5.5 的 Max 是58分。几分差距在单轮问答里看不出来,在几十步的代码重构里会被放大成"能不能交付"。

Agent 场景还有个隐藏变量:小模型不爱调工具。n8n 在 AI Agent 节点里加了"首轮强制工具调用"的开关,官方说明写得客气——帮助"较小或不太听话的模型"。翻译过来就是,你选了便宜引擎,就得在编排层给它上约束。

配图

所以换引擎这事,动作要快,但分层要清。能自动判对错的,果断下放到小模型;需要长链条推理、错了要赔钱的,继续挂旗舰。关键变量只有一个——单位成本下的任务通过率。这条下一节细说。

给coding开发者的作业:别追旗舰,追单位成本下的任务通过率

前面三节我把账算了,把场景摆了。现在说你的活儿。

这是最多人踩的坑——拿着跑分榜从上往下数,谁分数高用谁。可你的业务不会去考那份卷子。代码审查、单测生成、日志归因、接口文档补全、issue 打标,这是五种活儿,对模型的要求差着量级。你需要的是每个任务自己的通过率,不是某个榜的均分。

再往下走一步,把成本除到每一次任务上。

Haiku 5.5 比上一代便宜约 75%,这个数字真正值钱的地方不在单价,在于它把一大批以前算不过来的任务拉进了可做区间。你自己拿账单除一遍:一个功能每天调多少次、平均多少 token、失败重试几轮。分母是钱,分子是通过率,这个比值才是选型依据。单价比谁低没意义,通过率比谁高也没意义,两个放一起看才有意义。

然后是分层,别一把梭。

Gemini 4 Argon 那种一次吞几十万 token、输出上限从 6.4 万提到 100 万的长周期推理,小模型确实接不了,硬顶就是自找麻烦。反过来,一段模板化的 commit message、一次固定的风格检查,上旗舰就是烧钱。合理的结构是路由:高频、结果可验证的活交给 Haiku 这类小模型扛量,复杂、低频、要长链条推理的交给旗舰扛难。

还有个更关键的:给小模型配一条验证回路。

小模型通过率低不要紧,怕的是你不知道它什么时候错了。能跑单测的跑单测,能跑 lint 的跑 lint,能抽检的按时抽检。没有验证手段,通过率就是个玄学数字。我们做舍予AI智能体,定位是老板的第一支 AI 战队,给企业搭的时候第一步从来不是挑模型,是先把测试和评测集补上。模型随时能换,评测集换起来要命。

节奏上也得留个心眼。GPT-Next 已经在路上,Mistral 那个 1.05 兆参数、每次激活约 490 亿的 Le Chonk 月底就要放权重,国产这边 DeepSeek、Qwen、GLM、MiniMax 也没停过。今天的最优解,三个月后大概率不是。所以别把选型做成一次性决策,挑三五个真实任务,建个小评测集,每月跑一次,谁的性价比高用谁。

模型是耗材,评测集才是资产。

你的作业就一句:把最贵的那条调用链拉出来,算清每次任务的成本,再算清它的通过率。这两个数一出来,该换哪个引擎,答案自己会浮上来。

#舍予基业#舍予AI#AI模型选型#小模型替代旗舰#客服AI降本#AI推理成本优化#代码审查AI#企业AI落地

想知道舍予基业装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案;不方便留号码,也可以直接 WhatsApp 找我们。