国产大模型赢的不是技术,是token的账本
昨晚十一点多,我把OpenRouter最新一期的周度调用榜翻出来看了三遍。
不是看排名,是看那个名次背后的东西。前五名全是国产大模型,DeepSeek V4 Flash排在第一,往下是小米MiMo V2.5、腾讯Hy3、DeepSeek V4 Pro、智谱GLM 5.2。这个画面放一年前,我自己都不信。
值得关注的不是“国产赢了”,而是赢在哪一栏。不是跑分,不是论文引用,是Token调用量。说白了,全球开发者拿真金白银投票,把活儿派给谁干。
这个信号,比任何技术发布会都实在。
我认识不少OPC创业者,今年普遍有个困惑:模型这么多,到底该把业务押在哪个上面。有人盯着参数量选,有人盯着Benchmark选,还有人干脆哪个火用哪个。但OpenRouter这份榜单给了一个更硬的参照系——看调用量。
调用量背后是成本、稳定性、生态三件事在同时起作用。DeepSeek V4 Flash为什么能冲上去?官方价格每百万Token输入1元、输出2元,这个价格配上智能体场景的Token消耗量,正好卡在了一个很微妙的位置:开发者可以放手去试,不用每调一次接口就心疼一次预算。
我身边做智能体的朋友,最近开始把一些高并发、长上下文的活儿从闭源模型上迁下来。不是闭源不好,是账算不过来。一个客服智能体一天跑几百万Token,单价差两分钱,一个月就差出几万块。对于还在验证PMF的小团队来说,这钱就是命。
MoE架构在这件事上是关键变量。钟新龙讲得挺直白:一个公司有几十个专家,处理任务时只需要激活几个最擅长的,不必动用所有人。这个机制让推理成本被结构性压下来了。DeepSeek V4 Flash把这套玩法和稀疏注意力、长上下文压缩叠在一起,在百万级上下文、推理能力、工具调用和价格之间找到了一个平衡点。
这个平衡点,才是OPC真正该盯着看的东西。
因为OPC的生意本质,不是“用最好的模型”,是“在有限成本里交付最稳定的结果”。客户不会因为你底层接了Claude还是DeepSeek多付钱,客户只会为响应速度、准确率和不出事故买单。
再往深看一层,最近这波国产模型密集开源,MiniMax的H3三天冲到Hugging Face热度榜第一,Kimi K3全量开源,参数量做到全球开源最大。海外那声“新一轮DeepSeek冲击”的惊呼,听着挺提气,但我更在意的是开源之后发生的事。
开源不等于免费,这个账很多人到现在还没算明白。开源开放的是权重和使用权限,落地跑起来要算力、要电力、要网络。就像菜谱公开了,你还是要买菜、开火、动手。新华网那篇稿子里这个比喻挺准,OPC如果以为开源模型就是零成本白嫖,那最后一定会踩坑。
真正的成本在部署、在运维、在出问题的那天凌晨三点。
我自己的团队“舍予AI智能体”有一条内部原则,从去年坚持到现在:所有接给客户的生产环境,底层模型必须做到“可替换、可降级、可监控”。听起来像废话,做起来全是血泪。我们有一次给一个连锁品牌做订单归因的智能体,上游模型突然限流,如果当时把接口写死在一个模型上,整个链路就瘫了。后来我们做了模型路由,高峰期自动切到备用模型,客户那边一点感知都没有。
这件事教我们的不是技术,是站位:OPC的核心资产不是模型本身,是模型之上的那层调度能力和业务封装。模型会一直换,但客户要的结果不会换。
再说编程这条线。智谱GLM-5.3这次发布,编程能力比前代提升50%,在Terminal Bench 3.0拿到开源第一,已经接近Claude Fable 5。这个数据对OPC创业者来说,比任何营销话术都有分量。因为OPC自己的开发效率,直接取决于编程模型的水平。
我们团队现在写内部工具、搭数据管道、做自动化测试,相当一部分代码交给编程模型去出。不是让它替代人写核心逻辑,是让它把那些重复的、格式化的、查文档就能搞定的活儿接走。GLM-5.3这种级别的开源编程模型出来,意味着我们可以在自己服务器上跑,不担心数据出境,也不担心接口费超标。
值得关注的是,GLM-5.3还在白盒代码审查、CyberGym这类安全任务里拿到了不错的分数。这条线索被很多人忽略了。对OPC来说,客户越往深了用,数据安全问题就越绕不开。一个能在本地部署、又具备安全审计能力的开源模型,对服务金融、医疗、政务类客户的团队来说,是实实在在的入场券。
当然,光看编码还不够。Qwen3.5这条线也值得留意。397B-A17B的参数规模,早期融合数T多模态token,推理、编程、智能体、视觉理解全面超过Qwen3。关键是它的定位很清楚:原生多模态智能体。
这个“原生”两个字,对OPC的意义在于,我们不用再自己费劲拼装视觉模块、语音模块、文本推理模块。模型层面已经把这些能力揉在一起了,我们只需要在业务层做适配。少写一层胶水代码,就少一处出问题的可能。
小米MiMo V2.5和腾讯Hy3冲进前五,也是类似的逻辑。多模态、代码生成、长程规划,各家在具体方向上形成互补。对OPC创业者的启发很直接:别再纠结“哪个模型最强”,要问“我的业务场景最吃哪种能力,哪个模型在这个能力上性价比最高”。
这就像修车。你问师傅哪个牌子的扳手最好,老师傅会觉得你外行。关键是你拧的是什么螺丝。
还有一条容易被当热闹看的消息:NVIDIA传要出Nemotron 4,最大版本参数至少1万亿。这个事儿对OPC的直接影响不大,但背后的信号值得关注。做芯片的巨头亲自下场做开源模型,说明模型层和算力层的绑定会越来越紧。未来OPC选模型,可能不止看模型本身,还要看它的底层生态跟谁走。
而AI生成书籍淹没亚马逊那条调研,虽然不在模型发布的赛道上,其实也和OPC有点关系。AI已经把自出版平台的内容供给打到了38.3倍的增长,但收入只涨了8.9倍。单书收入在掉。这对我们的提醒是:当供给端被AI彻底打开后,真正的瓶颈不在“能造多少”,在“能不能让人愿意买单”。内容型OPC如果还在拼产出数量,等于往一个已经过载的系统里继续灌数据。

回到一开始的那份调用榜。
很多OPC创业者会把“接入最新最强模型”当成竞争力,这其实是个误区。你接的模型再强,也只是你的上游。上游的版本一换,你的链路就要跟着抖。真正能让客户留住的,是你对业务的理解深度,是模型调度、提示词工程、数据回流、异常处理这套东西。
模型是水的源头,但客户要的是接到自家水龙头里的那杯水。中间这套管道,才是OPC该下的功夫。
我最近跟一个做本地生活商家服务的OPC团队聊,他们用DeepSeek V4 Flash做商家的评论回复和私信应答,成本压到几乎可以忽略。但让他们开心到想续签的,不是省了模型钱,是回复的口气终于像个真人店长了。这个“像真人”的差异,来自他们对商家话术的拆解、对平台规则的梳理、对失败案例的复盘。
模型负责聪明,OPC负责懂行。
这份榜单前五全是中国企业的另一个含义,是调用量正在把国产推理芯片、服务器、存储的需求一起带起来。对OPC来说,基础层的国产化会慢慢让整套服务的成本结构更可控。但从钟新龙那几句提醒里,我也读出了清醒的一面:高调用不等于高利润,流量峰值考验稳定性,低价可能压缩空间,海外合规门槛在抬高。
说到底,调用量是荣耀,也是压力测试。
OPC创业者现在要做的,不是急着把自己的业务宣传文案里加上“接入DeepSeek”几个字。而是回到自己的业务数据里,看清楚哪些环节真的在吃Token,哪些环节是浪费,哪些环节换一个更轻的模型也不影响交付质量。
今晚睡前再翻一次那个榜单,我不会再数前五有几个国产了。我会去想:这份榜单背后的开发者,他们的智能体在跑什么业务?这些业务里,有哪些是OPC可以接得住、做得更细的?
那才是我们这群人的位置。
本文提及的模型数据、价格及榜单信息均来自公开报道,具体参数与性能请以各官方发布为准。AI技术迭代较快,文中观点仅基于截至发稿时(2026年8月16日)的公开信息,不构成任何选型或投资建议。