我把 OpenCode 榜单按留存率重排了一遍,第一名只有 4.5K 用户

2026-09-14舍予基业来源:公众号「舒毅讲AI」
我把 OpenCode 榜单按留存率重排了一遍,第一名只有 4.5K 用户
按周留存率重排 OpenCode 榜单,揭示用量榜与留存榜的错位:少数人重度使用与多数人长期依赖是两种赢法,并分析 DeepSeek、智谱、千问、Kimi 等模型的性价比竞争与选型逻辑。

周一早上九点,我做的第一件事不是翻邮件,是把 OpenCode 那份实时榜单刷到最新一版。数据更新到 9 月 14 日 UTC 11:58。

用量榜的第一名我上周就看过了——Meta 的 muse-spark-1.3-contributor,34T token,比上一版涨了 56%。一个挂着 contributor 后缀的版本,吃掉了一个中型云厂商一个月的推理量。

但今天我盯的是右边那一列:Weekly Retention。

事情从这里开始变得有意思。

用量和留存,是两张几乎不相干的表

muse-spark-1.3-contributor 留存 87.4%,全榜第一。它的周活独立用户是 4.5K。

glm-5.3-flash 留存 68.8%,用户数 41K。

deepseek-v4-flash 留存 68.3%,用户数 483K——是 muse-spark-1.3 的一百多倍。

同一个榜,两种赢法。一种是"少数人往死里用",一种是"很多人一直在用"。前者大概率在跑 agent 循环、长上下文代码索引、整库批量重构这种重活,一个人能烧掉几千人的量;后者赢在顺手、便宜、不掉链子。

对 OPC 和独立开发者来说,这是两套完全不同的选型逻辑。你要跑批处理、要压极限吞吐,去看前者;你要给自己配一个天天用的编程搭子,看后者。选错了不致命,但月底的账单会替你说话。

还有一句得说清楚:这份榜单统计的是 coding 工具里的真实调用量,不是跑分。它比任何 benchmark 都更接近"钱从哪儿出"的答案。

DeepSeek 三个版本,在自己家里打起来了

deepseek-v4.1-flash,23T,新上榜。

deepseek-v4-flash,20T,掉了 21%。

deepseek-v4-pro,652B,掉了 30%。

新版本上来就把老版本吃掉,价格更低、速度更快的那一档在收割贵的那一档。这不是 DeepSeek 一家的事,是整个行业今年的主旋律:性能还在涨,但真正被选中用的,是性价比那一档。

同门里还有一条线值得看:deepseek-v4-flash-vision-exp 掉了 36%。多模态实验版在 coding 场景里掉得比谁都快。这说明一件事——写代码这件事,到今天仍然是纯文本的战场。你让模型去看图,成本上去了,收益还不确定。至少现在,视觉能力在代码工作流里还不是关键变量。

智谱那边是同一个剧本。glm-5.3-flash 3.2T,微跌 9%;glm-5.2 121B,掉了 33%。上一代在加速退场。

但智谱有一件事做对了:glm-5.3-flash 拿到了 41K 用户和 68.8% 的留存,是全榜用户规模最大的几个之一。这两年智谱最扎实的一步,可能不是把旗舰模型刷到多强,而是把 flash 这一档的稳定性和价格,做到了开发者懒得换的程度。

留住开发者的从来不是最强的那一个,是最不用操心的那一个。这就是落地场景的真相。

千问这次有点难受。qwen3.8-flash 390B,掉了 37%,是前二十里跌得最狠的。但它的留存还有 72.3%,qwen3.5-plus 也有 69.8%。用的人少了,留下的人还在用——这是很典型的"没跟上这一轮降价节奏"的信号,不一定是能力问题。

Kimi 走的是另一条路。kimi-k2.7-code 148B,跌 11%,幅度不大,而且名字里直接带 code。kimi-k2.5 的留存 69.5%。月之暗面的选择很清楚:不跟通用榜单抢,往 coding 里扎。

MiniMax 也差不多,minimax-m3 269B 跌 16%,m2.7 留存 67%,掉得不快,说明它有一批固定的重度用户。

这四家放一起看,结论其实挺干净:通用能力已经卷不出差异了,谁能在一个具体场景里被反复打开,谁才有留存。

Claude 那条新闻,跟你我都有关

这几天更硬的一条,来自 Anthropic 自己。公司指称有中国 AI 公司在"大规模蒸馏"Claude 的能力,相关账户用虚假身份、住宅网络地址和位于支持地区的中转服务掩盖真实来源。Anthropic 说已经关闭这些账户,并调整了监测和模型保护措施。它也再次说明:Claude 不直接向中国用户提供服务。

两天前,美国 FBI、NSA 和网络安全及基础设施安全局发过一份联合警报,点名 DeepSeek、月之暗面、阿里巴巴、MiniMax、阶跃星辰和智谱 AI,指称这些企业对 Claude、ChatGPT、Gemini、Grok 等美国模型开展"工业规模"的蒸馏。

这条新闻最容易引发的讨论是"谁抄谁"。但对你我来说,真正的信息量在别处。

你的技术栈里有一条看不见的管辖边界。

今天能调通的接口,明天可能因为合规原因断掉;今天顺手的中转服务,明天可能因为风控升级不可用。这不是危言耸听,这是每一位把核心工作流挂在单一海外模型上的开发者,都该提前做的压力测试。

多模型抽象层这件事,从来不是架构洁癖,是保险。

配图

GPT 在忙别的

OpenAI 这两天在官网国际事务栏目里连着挂了几条:扩大 AI 在美国政府各个层级的接入(9 月 10 日)、一篇"AI 政策窗口已经打开,我们需要行动"的表态(9 月 9 日)、以及支持乌克兰独立新闻(9 月 7 日)。

清一色是政策侧动作,不是模型发布。

而在 OpenCode 榜上,gpt-5.6-luna 消耗 509B,跌了 5%,排位并不靠前。

这个对比本身就是个信号:OpenAI 现在押注的战场,一部分在"谁来决定 AI 怎么被用"这一层。对纯做 coding 工具的人来说,短期没影响;对想接政务、公共服务、合规场景的 OPC 来说,政策窗口打开的这段时间,往往是最先有预算流出来的时间。

这是两条完全不同的路。想清楚自己是哪一条,比多会用一个 API 重要得多。

Meta 那边则是另一种玩法。从 Llama 开始,它就一直站在"把模型交出去"的那一侧——权重开放、社区贡献。这次榜上 muse-spark 两个版本,一个涨 56%、一个跌 60%,一进一退之间,社区的力量和社区的无情是同时存在的。

做开源生态的人要习惯这种节奏:你不是在管理用户,你是在接受投票。

翻旧账的时候,翻到了 2023 年

这周我顺手翻了一篇中国大模型简史的文章,写到 2023 年 6 月。6 月 2 日的一场公开活动上,有人第一次把"百模大战"这个词摆到台面上;6 月 13 日 360 智脑发布时,"正式加入百模大战"已经能直接进新闻标题。

6 月 15 日,百川智能发布 Baichuan-7B,模型文件、配置和代码直接放到 GitHub。当天就有外部开发者开始讨论:怎么在 RTX 3090 这样的消费级显卡上继续微调它。

三年过去,今天榜单上排前面的,几乎全是 flash、lightning 这类名字。

"便宜、能跑、能自己动手改"这条线,从 Baichuan-7B 那天起就没断过,现在反倒成了主流。

我们自己给客户搭工作流的时候,有一条不太成文的规矩:一个流程里最多出现两个模型。一个负责判断,一个负责执行。第三个模型只在出错回滚的时候才被叫起来。模型每多一个,出故障时排查的时间就是翻倍往上走,这笔账很少有人算。

另一件事,在给

AI 应用大模型选型开发者工具留存率分析

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。