GPT降了80%,Gemini砍了一半,OPC还拿着旧地图算账
周三晚上十一点,老周给我发了张截图。
他在深圳做跨境独立站,手下七个人,五个运营两个开发。截图是OpenCode的后台,他自己在用AI写一个库存同步的脚本,一轮会话下来,跑了920K token,成本$0.0093。
“不到七分钱人民币,”他语音里带着点夸张,“我请开发喝杯奶茶,他帮我写这段要一下午。”
我回他:你看到的还不是重点。
重点是你跑了920K token。这说明模型在反复读你的代码库、你的上下文、你的指令。以前跑这么长的会话,成本可能是现在的五倍十倍。现在不到七分钱,是因为价格被压下来了。
但价格压下来这件事,是个信号,不是一个结论。
OpenAI这轮降价,藏着OPC最该读懂的三个字:三个月
8月21日,OpenAI把GPT-5.6 Sol的开发者端基准价格下调超过20%。注意一个容易被略过的细节:调整后的优惠价格,三个月有效。
再往前看,7月底OpenAI还有一轮动作:中端模型降20%,低成本模型一口气降80%。
80%是什么概念?
对OPC来说,原来一个项目每个月烧在低端模型上的钱如果是两千块,现在只剩四百块。原来不敢批量跑的翻译任务、分类任务、结构化抽取任务,现在可以放开手跑。原来要精打细算的测试环境,现在可以多铺几路并行。
但“三个月有效”这四个字才是关键变量。
OpenAI没打算让你把便宜当成理所当然。这是促销,不是定价革命。它用降价的窗口期,把你从观望逼进场,把你从对手那里吸过来,然后看三个月后的留存数据。OPC如果把项目预算直接建立在GPT-5.6 Sol这个价格上,三个月后可能发现账算错了。
我们舍予AI智能体内部有个规矩:任何客户项目的AI成本测算,都不允许拿促销价当基准。我们用的是一个区间,下限是当下公开的最低价,上限是常规价的1.5倍。这样才能在交付周期里扛住价格回调。
这条规矩不是拍脑袋定的。是去年一个做东南亚多语言商城的项目,报价时按当时的促销价算的AI成本,三个月后模型调价,利润率直接掉了六个点。
谷歌的动作更狠,直接改写了语音和视频这两条线的成本结构
OpenAI降价的同一天,谷歌这边有两个动向值得关注。
一个是Gemini 3.7 Flash发布,定价约为上一版本的一半。这是谷歌在“快而便宜”这条线上继续加注,Flash这个系列对OPC的意义从来不是极致能力,而是大批量、低延迟、低成本的中间层任务。
另一个是Gemini 3.5 Transcribe,语音转文本模型。流式平均词错率4.0%,非流式2.6%,支持超过85种语言、自定义词汇、最多三人说话人识别。
这个数据放到落地场景里重不重?
重。
一个做海外客服外包的OPC团队,如果接到客户要求“自动转写销售通话并生成跟进邮件”,以前可能要在转写质量上反复调优。现在Gemini 3.5 Transcribe的非流式2.6%词错率,配合85种语言覆盖,很多一线场景可以直接用,不用再从零训一个ASR。
Gemini Omni 1.1 Flash也在同一周发布,视频生成支持最多10秒前文分析,以10秒为增量延长到40秒,支持首尾帧和4K输出。
对OPC来说,视频生成这条线,谷歌的态度很明确:把生成成本打下来,让视频从演示项目变成批量生产力。
但我要泼一句冷水。Flash系列降价,不等于所有视频生成都便宜了。它降的是这一档的价。OPC做客户交付,该算的是“每千条视频的综合成本”,不是“单条生成的钱”。因为视频项目最大的成本从来不在生成那一下,而在镜头筛选、合规审核、客户反复改需求那几步。
中国模型这边,压价的不是一家,是一整个梯队
央视新闻8月23日那条消息说得直接:多家美国AI公司下调大模型使用价格,有美媒分析认为,来自中国的部分人工智能公司的大模型的开源和定价策略,给美国公司带来了压力。
这是一个重要的转向。以前是“美国降价,中国跟随”,现在是“中国开源低价,美国承压”。
截至2026年6月,我国日均词元调用量突破500万亿。这个数背后的东西,比价格本身更值得关注:调用量上来了,说明真有人在生产环境里用,不是只在做demo。
Qwen3.5是这条线里一个值得关注的信号。2026年2月发布,397B-A17B,门控Delta网络加稀疏MoE,在推理、编程、智能体、视觉理解上全面超越Qwen3和Qwen3-VL,支持语言和方言扩展到201种。
201种语言意味着什么?
一个做非洲市场的OPC团队,以前要给斯瓦希里语、豪萨语、阿姆哈拉语分别找处理方案。现在一个模型就能揽下来,而且成本结构是国内的。这是实打实的出海红利。
腾讯混元在端侧那条线上也没闲着。Hy-MT2-1.8B通过2-bit和1.25-bit量化压缩到574MB和440MB,翻译质量在FLORES-200上优于Microsoft Translate的同类方案。上次我们聊过B站弹幕翻译这个落地场景,这次换个角度看:220MB的差距。574MB到440MB,差的这134MB,对一些老旧终端、边缘设备、嵌入式场景来说,就是能不能部署的分水岭。
OPC做政务外呼、工厂质检、景区导览这些项目,终端设备常常不是最新款。模型能精简到440MB,很多事情才能从PPT走进现场。
比价格更关键的,是那400万次分析说的事
有一条研究值得拿出来单独说。一个团队对13个主流大型语言模型做了400万次响应分析,包括GPT-5、Gemini 3这些前沿模型,得出一个让人重新想问题的结论:先进模型里,95%到98%的事实其实已经编码进参数了。
换句话说,模型不是“没学过”,是“想不起来”。
瓶颈不在知识储备,在提取。给了思考机制之后,很多原本检索失败的答案,可以被成功提取出来。
这个发现对OPC的意义,比任何一条降价新闻都更本质。

你花大钱升级模型,可能不如给现有模型留出推理时间。你反复调提示词,可能不如把问题拆得更细,让模型一步一步想。你抱怨模型答不好,可能只是你没给它“找钥匙”的时间。
我们舍予AI智能体在给客户做智能客服项目时,有一个默认动作:所有需要事实判断的任务,都不允许单次直出答案。至少两轮:第一轮提取关键信息,第二轮再给结论。代价是多花两秒钟,收益是准确率上一个台阶。这个做法,和那400万次分析的结论是一致的。
Claude那边,一个不太起眼的更新,藏着OPC交付模式的新选择
8月下旬,Claude Code发布v2.1.248,新增受限模式。移除运行命令、代码执行、WebFetch这些内置工具,同时忽略用户、项目和本地设置文件。
这个改动表面上看是“变弱了”,实际上对OPC做外包交付意义不小。
你给客户的团队部署Claude Code,客户最怕什么?怕一个不熟悉的AI在项目环境里乱跑命令、乱抓网页、乱改配置。
受限模式给了你一个“安全边界”版本。你可以把Claude Code交给客户的初级开发人员用,它不会越权执行,不会从外部抓取未授权的内容。这直接降低了你作为OPC方在交付AI辅助工具时的责任风险。
虽然我们目前给客户交付的智能体方案,更多用的是自定义的沙箱环境,但Claude Code这个思路是对的:AI辅助编程要进入企业项目,权限控制是绕不过去的一道坎。
Grok的这条新闻,是给所有OPC的一个合规预警
本周还有一条负面消息:xAI被诉在训练Grok时使用了CSAM衍生图像,Grok默认将公开X帖子和自身输出作为训练数据。
这个指控本身还在法律程序中,我不做判断。但这个事给OPC提了个醒:你在给客户推荐模型时,如果涉及未成年人相关的内容、教育产品、社交产品,训练数据来源的合规性必须作为选型的前置条件,不是事后补救。
数据合规这块,北美和欧洲客户已经问得很细了。OPC如果只盯模型能力选型,接到第一份合规问卷就抓瞎。
写在后头
回到老周那张截图,920K token,$0.0093。
这个数字让我想起一个更该被OPC盯住的东西:不是每token多少钱,是“每解决一个问题多少钱”。
模型降价,降的是token价格,token单价往下走,你可能不自觉地跑更多轮、塞更长的上下文、试更多的方案。最后问题没少花时间,账单也没省多少。
真正的分水岭不是价格战,是你内化模型成本、推理质量、交付效率这三件事的方式。GPT便宜了,你也得知道你为什么要用它。Gemini砍半了,你也得算清哪个场景非它不可。
价格战打到现在,OPC真正的对手不是模型厂商,是你自己那套旧地图上画的成本线。