52T 用量第一,486K 人却在跑另一个——9月22日榜单该看哪一行
52T 用量第一,486K 人却在跑另一个——9月22日榜单该看哪一行
模型竞争的胜负手,已经从“谁更聪明”换成了“谁被留下来”。 跑分是入场券,留存才是座位。
今天是 9月22日,OpenCode 的数据更新到 UTC 11:47。同一个榜单上,出现了两个“第一名”。
按 token 用量,第一是 deepseek-v4.1-flash,52T,环比 +57%。按每日独立用户,最大的那个是 deepseek-v4-flash,486K——同一个牌子,不同的型号,差一个量级。
这两个数字摆在一起,比任何跑分榜都说明问题:开发者真正在压的,是一类稳定、便宜、够用的模型;而厂商希望你盯着的那个“更强”的,未必是留下最多人的那个。
留下来的那个,留存率会说话
榜单里还有一列 Weekly Retention——本周用了、下周还回来的比例。
deepseek-v4.1-flash 85.0%(23K 独立用户);Meta 的 muse-spark-1.3-contributor 83.3%(13K);muse-spark-1.2-contributor 81.1%;longcat-2.0 77.7%(359);mimo-v2.5 72.7%(28K);hy3 71.1%;qwen3.8-flash 70.9%;glm-5.3-flash 69.3%(53K);omen-alpha 69.3%;deepseek-v4-flash-vision-exp 68.0%;qwen3.5-plus 67.8%;deepseek-v4-flash 67.6%(486K);kimi-k2.5 66.3%;minimax-m2.7 65.8%。
这里面最刺眼的是:用得最多的那个,留存排在中间;用量涨得最猛的那个,留存是 85%。
榜单逐条看
DeepSeek。 三条线同时跑:v4.1-flash 冲量(52T,+57%,留存 85%)、v4-flash 铺面(486K 人)、v4-flash-vision-exp 试视觉(1.0T,68.0%),v4-pro 669B 站高配。
给 OPC 和 coding 开发者的建议很直接:主力锁 v4.1-flash 这类高留存型号,把 vision-exp 这种实验版放去跑副线,别让它进生产路径——1.0T 的用量说明它已经被大量当“玩”在用。玩的东西出问题不影响生意,生产路径出问题要赔钱。
Qwen。 阿里云百炼文档里有两件事得注意。一是 Qwen3.8 Max/Flash 与开源系列、3.7-Flash/Plus、3.6、3.5 系列(含 omni 与千问开源模型)支持图像、视频等多模态输入,必须走 multimodal-generation 端点,不能用面向纯文本的 Generation。二是联网搜索:qwen3.8-max、qwen3.8-flash 等型号在 Chat Completions/DashScope 协议下不支持 searchstrategy: agent,得走 Responses API 的 websearch 工具才能做多轮检索,而且 agent 策略每次调用额外收费、只支持返回搜索来源。
榜单上 qwen3.8-flash 是 299B、-22%,留存 70.9%;qwen3.5-plus 留存 67.8%,独立用户只有 264。
我的建议就一句:OPC 选型的第一页不是介绍页,是协议页。 多模态换端点、联网换 API 形态、按次计费——这三件事全都改代码。你只有一个开发者,他这周的工作量就是被这些接口差异决定的。多读半小时文档,能省三天返工。
GLM(智谱)。 glm-5.3-flash 用量 2.8T、环比 -24%,但独立用户 53K,是这份榜单里用户盘最厚的几家之一,留存 69.3%。用量降、用户还在,通常意味着调用从“堆量测试”转成了“日常按需”。
这类模型最适合当第二供应商。别只签一家,把主力和备用的调用封在一层薄适配里,谁限流、谁涨价,切过去不动业务代码。
我们自己在给老板们搭第一支 AI 战队时,从来不先问“哪个模型最强”,先问“这条流水线上有几个环节,每个环节谁盯得住”。早年最容易犯的错,是把一件事全押给一个模型,它一抽风,整条线停摆。
MiniMax。 minimax-m3 用量 253B、-15%;minimax-m2.7 留存 65.8%。文档里还有一句更关键:MiniMax-M2.1 与 Moonshot-Kimi-K2-Instruct 不支持 agent 联网搜索策略。
这不是强弱问题,是能不能干这个活的问题。你要做多轮检索的 agent,选型第一轮就该把不支持的直接划掉——省下的不是钱,是时间。
Kimi(月之暗面)。 承接上一条,K2-Instruct 在百炼的 agent 搜索策略里同样被排除;kimi-k2.5 留存 66.3%,独立用户 664。读长文档、做材料理解,它仍然顺手。
给 OPC 的用法是模型分工:长文归一家,联网归一家,代码归一家。别指望一个模型把所有事做圆,那是一个团队的思路,不是一个人的思路。
GPT(OpenAI)。 gpt-5.6-luna 用量 536B、-4%,留存榜前 15 里没看到它。海外模型依然值得用,但不宜当唯一主力。
coding 开发者今年最该做的一件事,是把模型调用抽成一层薄适配层——prompt 模板、超时、重试、降级全放这一层,上面换谁,下面不疼。
Gemini(Google)。 官方 API 文档里现在挂着几个工具/代理模型:computer use 预览版能“看见”数字屏幕,执行点击、输入、浏览等 UI 动作;Deep Research 预览版可自主规划并执行多步骤研究,从数百个来源取信息并生成带出处的报告,另有 Deep Research Max。
这是 OPC 最该盯的一类能力——你雇不起一个每天替你在后台点网页的人,但一个能操作浏览器的模型可以。 对账单、比价、备案、投标信息收集,这类碎活的边际成本会被压到接近零。但它是预览版,别放进客户看得见的关键路径。
Llama / Meta。 这次 Meta 系上榜的不是 Llama 这个名字,而是 muse-spark-1.3-contributor(35T,-6%)和 muse-spark-1.2-contributor(2.8T,-26%),留存 83.3% 和 81.1%——不是最大的量,是最扎实的一档留存。
对 OPC,权重可及的意义是数据不外流。给客户做私有化交付,能用可自持的模型就别全托在别人的云上;留存高说明它被稳稳嵌进了流程,而不是被试一下就丢。

小米 MiMo。 mimo-v2.5 用量 6.1T、-32%,独立用户 28K,留存 72.7%;mimo-v2.6-flash 新上榜 428B。手机厂的模型,长期看点在端侧。
产品面向门店、工厂、上门服务这类网络不稳的场景,端侧是唯一能保证“当场能用”的路子。现在预留一个端侧档位,比明年临时改架构便宜得多。
NVIDIA Nemotron。 nemotron-3-ultra 用量 3.1T、环比 +37%;nemotron-3.5-lightning 347B、-24%。硬件厂做模型,角色是基准线。
做私有化交付的开发者,把它当性能标尺,报价前先量一遍,量过再报,比事后扯皮省事。
蚂蚁 Ling 与美团 LongCat。 ling-3.0-flash-fin 648B、环比 +39%,金融垂类在涨;longcat-2.0 留存 77.7%,独立用户只有 359,池子很小。
这两个才是 OPC 该认真看的方向。通用赛道你拼不过大厂,垂类可以。 一个只有几百人用的模型,可能正好对口你那一千个客户;金融这种合规重、术语重、容错低的行业,垂类小模型往往比通用大模型更稳。
那个最常见的反驳,站不住
一定有人说:留存率高,不就是便宜、不就是懒得改配置吗?跟能力有什么关系。
但这事得拆开看。
切换成本本身就是能力的一部分。 一个模型能被留下,意味着输出格式稳定、上下文不飘、工具调用不崩。这些在跑分榜上占不了几行,但在你写代码时是每天的痛。便宜能让人试一次,不能让 85% 的人下周还回来。
留存是接口层面硬差异的结果,不是情绪。 百炼文档里那几条写得很清楚:哪些型号能走多模态端点、哪些在某个协议下不支持 agent 搜索、agent 策略每次调用额外收费。这些是写死在文档里的规则,不是用户偏好。你从 A 换到 B,可能要多写一套调用、多接一种 API 形态、多算一笔账——留存差距有一部分就是这么来的。
科研场景已经把答案摊开了。 中科院自动化所的磐石·科学基础大模型 7月17日发布 2.0,走“通专双轮驱动”;8月28日入选北京市首批 AI 用于科学研究的典型案例;5月,自动化所牵头的队伍在世界模型方向的国际比赛里拿了第一;9月15日,他们主办的期刊 MIR 入选 2025 年度世界一流科技期刊目录。科研不看谁的 demo 漂亮,只看一件事:能不能嵌进真实的实验流程。 商业侧同理,能不能嵌进你的日常工作流,才是留下来的理由。
最后半步
今天这份榜单,最值得抄的不是第一行。