一个三线城市的软件外包老板,今早把ChatGPT的账单停了,换了四个国产模型跑业务流。他算完账说,这不是省钱,是换打法
小标题:从一张被停掉的ChatGPT账单说起,中国大模型调用量连续十五周领跑的密
那个三线城市的软件外包老板,我认识他三年了。今天早上他截图给我,ChatGPT的自动续费停了,四张国产模型的API Key一字排开:DeepSeek、智谱、Kimi、Qwen。他算账算得很干脆——“这不是省钱,是换打法。”
这句话里有信号。
上周OpenRouter数据刚出来,中国AI大模型调用量已经连续十五周超过美国,稳居全球首位。8月3日至9日这一周,中国模型周调用量冲到34.25万亿Token,其中刚刚公测的DeepSeek-V4-Flash正式版,单周调用量直接飙涨570%,8.83万亿Token登顶。这个数字不是便宜能解释的——便宜的东西多了,调用量不会连续十五周领跑。
真正的变量藏在调用者的动机里。那位老板说,以前用ChatGPT,是他一个人调好提示词、复制粘贴、再手动分发给员工用。现在换四个国产模型,每个模型跑一段业务流:DeepSeek处理客户邮件意图识别,智谱做合同条款抓取,Kimi负责长文本摘要,Qwen写初版报价方案——他发现,当百万token成本只有GPT-5.5的百分之一时,调用就不再是“省着用”,而是可以嵌入每个环节。
这就是国产模型走出来的普惠化路径。DeepSeek-V4-Flash完成一次测试任务的平均成本0.03美元,只有Claude旗舰的1/100。价格不只决定谁会买,更决定怎么用。当成本低到可以不计较单次调用的ROI时,模型就从“工具”变成“管道”——一个业务流程里的默认组件。
我后来翻了Artificial Analysis的数据:V4-Flash正式版在Agent能力上大幅增强,基准测试远超预览版。这才是调用量暴涨570%的底色——性能上的“能用”,加上价格上的“不用想”,才有了行为上的“随便用”。
这么说吧,那张被停掉的ChatGPT账单,只是账面上的20美元月费。真正停掉的,是过去那种“一个模型干所有事”的打法。而中国大模型调用量连续十五周领跑的秘密,不在模型本身,在于每一个调用者都像那个老板一样——开始把AI用实了。
小标题:当DeepSeek的百万token价格只有GPT-5.5的百分之一,AP
真正的分水岭,就在这里。
上周,DeepSeek-V4-Flash正式版API上线公测,百万token的输出价格只有美国顶尖大模型GPT-5.5的约百分之一。这不是渐进式降价,是直接把价格打到了地板。 Artificial Analysis的测算更直观——完成单项测试任务的平均成本约为0.03美元,只有Anthropic旗舰模型Claude Fable 5的1/100。
这意味着什么?
意味着跑一个完整业务流的成本结构彻底变了。以前用全球最贵的模型跑一遍客户支持、代码审查、文档生成,每次调用的成本你心里都会咯噔一下。现在用DeepSeek-V4-Flash,大规模、高频率地调,成本低到几乎可以忽略。
关键变量不是“便宜”,是可大规模落地。
《每日经济新闻》根据OpenRouter最新数据测算,上周(8月3日至8月9日)中国AI大模型周调用量冲到34.25万亿Token,连续十五周压过美国。 DeepSeek-V4-Flash正式版登顶第一,周调用量8.83万亿Token,环比暴增570%。 这是真实的市场投票,不是实验室跑分。
更值得关注的是趋势。 研究机构ExponentialView的报告《2026 AI经济现状》点出一个关键转向——越来越多用户正在抛弃闭源、转向开源模型。 因为只有开源加极致低成本,才能让开发者把模型嵌入到每一个具体的落地场景里。 比如我们做的“舍予AI智能体”,定位就是老板的第一支AI战队,跑的就是这种逻辑:把多个廉价、高能的国产模型组合起来,7x24小时跑合同审查、客服、自动报表,整套工作流下来,成本极度可控,老板才敢放手去用。
中信建投的研报也注意到,DeepSeek计划近期整体上调API服务定价。 但即使提价,基准价格摆在那里,涨幅体感远达不到动摇竞争力的程度。 成本优势这个护城河,短时间内难以撼动。

所以回到那个三线城市老板的动作。他停掉ChatGPT账单,换上四个国产模型跑业务流,不是在省钱,是在重新定义投入产出比。 当百万token的成本降到这个量级,API调用从“成本中心”变成了“业务放大器”。这才是全球开发者用脚投票、让中国大模型调用量连续霸榜的真正逻辑。
小标题:Claude Code下周默认开启auto模式,但真正让OP
老实说,看到 Claude Code 下周默认开启 auto 模式的消息,我第一反应不是“Agent 时代来了”,而是“账本又要抖三抖了”。
auto 模式意味着什么?它不再等你下指令,而是自己读代码库、自己规划任务、自己写测试、自己修 bug。Anthropic 的 Boris Cherny 也提了,通过模型训练基本解决了提示注入的威胁,安全层面的顾虑正在被打消。可以说,Claude Code 正在从一个“听话的打字员”进化成“能自主干活的程序员”。
这对硅谷的独立开发者绝对是核弹级的生产力提升。但你把这个消息扔给国内三线城市的软件外包老板,他会先问你一句:“跑一天 auto 模式,Token 烧多少钱?”
这才是关键变量。Anthropic 的旗舰模型 Claude Fable 5 跑单项测试的平均成本,是 DeepSeek-V4-Flash 正式版的一百倍。一百倍。DeepSeek 这个模型,百万 token 的输出价格只有 GPT-5.5 的约百分之一,上周在 OpenRouter 上调用量环比暴涨 570%,达到 8.83 万亿 Token,直接把全球第一给占了。它不是靠嘴皮子,是靠记账本记出来的。
所以 Claude Code 默认开启 auto 模式,真正让 OpenAI 和 Anthropic 难受的,不是对手的代码能力追上来了——单纯比代码基准测试,大家互有胜负——而是对手把 Agent 执行链路的推理成本,打到了地板价。一个复杂任务,Claude Code 在 auto 模式下反复规划、试错、重写,跑一轮可能花掉几美金;国产模型同样跑一轮,成本可以忽略不计。
最后这个外包老板干了件什么事呢?他把 ChatGPT 的账单停了,但没把宝押在一家身上。他用一个调度层,把 DeepSeek、智谱、Qwen、MiniMax 四个模型串起来——复杂逻辑拆解用 DeepSeek Flash,长文本理解用 Qwen3.8-Max,特定领域代码生成调智谱 GLM,高并发简单任务走 MiniMax。这不是省钱,这是换了一种精算师式的打法:把 Agent 的思考成本打到无限趋近于零,然后大规模复制。
- 如果你也在跑软件外包或小型技术团队,关注两个点:推理成本和任务调度。不要只盯着单一模型的跑分,开始试着把业务流程拆细,不同环节喂给成本最优的模型。
- 现在就可以做的事:去 OpenRouter 上看一眼最新的调用量榜单和定价,那个榜单不会说谎。它告诉你市场正在用脚投票,把真金白银烧在哪。你跟着调用量走,比看任何评测都管用。