模型价格打到1/40,OPC该重算的不是选型表,是报价单

2026-09-08舍予基业来源:公众号「舒毅讲AI」
模型价格打到1/40,OPC该重算的不是选型表,是报价单
模型价格断崖式下跌正在改写OPC的成本结构,从GLM到GPT的定价变化意味着报价单必须重算,本文帮助OPC创业者看清哪些成本可以省、哪些场景该用贵模型。

先说一个判断:这周模型圈的消息,真正值得OPC创业者坐下来认真看的,不是谁又拿了SOTA,而是单位智能成本正在断崖式下跌。GLM-5.3-Flash定价打到Opus 4.8的四十分之一,Qwen3.8-Flash-Next开源且训练成本大幅降低,GPT-5.6登陆Kiro主打性价比。这三件事放在一起,信号已经很清楚了:模型不再是你报价单里那个“不可控的成本项”,它正在变成一个可以精确计算的变量。

这意味着什么?意味着还在按人天报价的OPC,随时可能被同行用模型成本优势把毛利吃穿。

别急着反驳,先把这周的材料摆开看。

GLM-5.3-Flash:价格屠夫撕开了口子

GLM-5.3-Flash这次开源,320B总参数,AA指数57分。参数规模不小,智能水平不低,但最关键的是定价:只有Opus 4.8的四十分之一。四十分之一是什么概念?原来一个项目里模型成本占5000块,现在同样的调用量只要125块。省下来的4875块,要么进你利润,要么变成客户砍价的理由。

对coding开发者来说,GLM这条线值得关注。320B的Flash版本开源,意味着你可以在自己的服务器上跑一个足够聪明的模型,不用每次调用都向云厂商交过路费。做私有化部署的OPC项目,这直接改变了成本结构。客户问你为什么比去年便宜了,你可以理直气壮地说:模型侧的成本降了,我们把这部分省出来的钱让给客户。

Qwen3.8-Flash-Next:训练成本降低才是真正的护城河

Qwen这次放出来的不只是模型,还有一个更重要的信号:训练成本大幅降低。模型便宜是一回事,训练便宜是另一回事。前者影响你调用时的边际成本,后者影响你能多快地做出行业专用版本。

我见过太多OPC团队卡在一个尴尬的位置:通用模型对客户业务的理解不够深,想做微调又付不起训练成本。Qwen这条路走通了之后,小团队微调自有模型的回本周期会明显缩短。一个做餐饮行业AI客服的OPC,如果能用可控的成本训练一个懂菜品、懂排班、懂门店话术的专属模型,他对客户的黏性就不是调API的同行能比的。

GPT-5.6登陆Kiro:OpenAI也在低头看价格

GPT-5.6登陆Kiro这事,值得关注的不是Kiro这个平台,而是OpenAI的态度。连最不缺溢价的OpenAI都开始讲性价比了,说明成本效益已经不是二线模型的差异化卖点,而是整个行业的硬约束。

对OPC的启发很直接:别再把“我们用GPT”当成卖点。客户不为模型买单,客户为效果买单。当GPT自己都在走性价比路线,你更该想清楚,你卖给客户的是模型调用,还是解决方案。这个问题想不清楚,报价单怎么写都拧巴。

Gemini 3.5 Transcribe:语音成本要塌方了

Gemini 3.5 Transcribe主打实时语音转文本,高精度。这条新闻单独看像个点状更新,但放到OPC的场景里看,它意味着一大批语音类项目的成本模型要重写。会议纪要、客服通话分析、门店语音质检,这些场景以前卡在转写成本和延迟上。转写模型精度上去、成本下来之后,原来“语音转文字再送大模型分析”的两段式架构,可能直接简化成一段。

做这类项目的OPC,值得认真测一下这个模型。转写环节每省一分钱,都是纯利。

Claude Fable 5.1:贵的模型还有没有活路

这条要单独说。Anthropic这周发布Claude Fable 5.1,智能指数登顶,但成本上升。有意思的地方就在这:一边是GLM往死里压价,一边是Claude往高了走。这不是谁对谁错的问题,这是市场开始分层了。

对OPC的启发是:不是所有场景都该选最便宜的模型。高价值决策场景——合同审查、代码审查、复杂推理——你省那点模型钱,可能换来的是返工和客诉。Claude这条线守住了“贵但可靠”的定位,你在报价时可以明确告诉客户:这部分我们用高精度模型,成本高一点,但出错率降两个点。客户听得懂这笔账。

GPT-6 Astra:安全阈值这件事,会被写进合同

GPT-6 Astra这周发布,主打计算机操作,在多项基准上达到SOTA,并且成为首个达到Critical网络安全阈值的模型。这意味着什么?意味着它的自主行动能力强到需要被限制发布。

这件事很多OPC可能觉得跟自己无关。我提醒一句:模型能力越强,客户对“失控”的担忧就越大。你在给客户部署Agent型应用时,“安全边界怎么设”“哪些操作需要人确认”会成为合同条款的一部分。能主动把安全协议写进方案的OPC,比等客户提出来再补的,成单率高得多。

Meta发布Muse Spark 1.3:开源生态还在加速

Meta这周发了Muse Spark 1.3,这条和NVIDIA宣布129亿美元收购Hugging Face放在一起看更有意思。开源生态的整合在加速,巨头在往基础设施层面重金下注。

对coding开发者的信号是:开源模型和开源工具的供应链会越来越成熟。Hugging Face被收购之后,开源模型的分发、托管、工具链会怎么变,值得持续跟踪。你现在选技术栈时,尽量别把命脉押在单一闭源生态上。

配图

写到这里,回头看一眼品牌覆盖:GPT、Claude、Gemini、Qwen、GLM、Meta/Llama这条线都点到了。至于豆包、DeepSeek、Kimi、MiniMax、文心、星火、百川这些,截至9月8日这周的公开信息里,没有值得写进周报的实质性更新。没新闻不代表没动作,但OPC做决策要基于可验证的信息,不是传闻。

现在来认真驳一个反方说法。

最常见的论调是:“模型降价跟我有什么关系?我卖的是服务和行业经验,模型只是底层工具,谁便宜用谁就行。”

这个说法看似务实,其实有个隐藏的漏洞:你把模型当底层工具,但你的客户正在把模型当成比价工具。 客户不会问“你用的是哪个模型”,客户会拿着一个报价问你:隔壁家做了个AI客服,只要一半价格,看起来效果差不多,你为什么收这么多?

如果你答不上来,或者答案里只有“我们服务好”这种空话,单子就丢了。模型降价不是直接伤害OPC,它改变的是客户的预期。客户对AI项目价格的锚点,正在被成本端的下降快速拉低。你还按2024年的成本结构报价,客户当然觉得你贵。

那怎么破?说句得罪同行的话:还在靠信息差赚钱的OPC,日子会越来越难。客户不知道模型便宜了,你赚了认知差,这个窗口期最多还有半年。半年之后,客户会比你还清楚GLM多少钱一万token。真正能持续的,是你基于低价模型重建的交付能力和行业know-how。

舍予AI智能体在我们自己内部的项目讨论里有个判断:这轮模型降价,最大的受益方不是终端的老板,而是那些能把“模型成本优势”翻译成“客户可感知的降价或增值”的OPC团队。翻译得动,你就吃下这轮红利;翻译不动,你就成了模型厂商的免费渠道商。

我们自己的做法很简单。给客户做选型时,不看单一跑分,而是把同一段代码生成任务或者同一条客服对话丢给三个模型,算单位成本下的可用率。这个实用指标,比任何基准榜都更能预测交付质量。你在报价单上写“价格仅为去年的三分之一”,客户会抬头看你一眼;你再加一句“但关键决策环节我们保留了高精度模型”,客户才会真点头。

结尾再往前推半步。

模型价格打到四十分之一这件事,表面上是OPC的成本喘息,实际上是整个服务链条的价值重估。模型越便宜,真正稀缺的就越不是模型本身,而是深度理解业务场景、设计可靠交付流程、让模型在你的流程里产生确定性价值的能力。这三样东西,恰恰是API调不通、公开课学不到的。

所以,别再把“选哪个模型”当成核心竞争力。选型是今天的仗,报价单背后的价值结构,才是明天的仗。模型厂商已经把成本打下来了,接下来该OPC创业者把自己的价值顶上去。


AI应用OPC经营模型选型成本策略

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。