榜单第一名换了三回,我更关心的其实是——第二周还有谁在打开它
老周今天下午连发三条消息过来:榜单我看了三遍,越看越糊涂,你直接告诉我按哪个数选模型。
他做跨境电商的 SaaS,九个人。上个月刚把三个模型塞进工作流:一个写多语言商品描述,一个做客服的初筛回复,一个给他自己当会议纪要助手。三周过去,只剩第一个还在天天用。
他真正想问的其实不是榜单。是市面上的排名每周都在变,我该信谁。
我说,你先把问题拆开——你要的是一个"跑批的工具",还是一个"每天有人愿意打开的工具"?这两件事,榜单给出的答案不一样。
"榜单三天换一个第一,到底看哪个数?"
据 OpenCode 9月16日更新的公开榜单:deepseek-v4.1-flash 以 33T tokens 排在使用量第一,muse-spark-1.3-contributor 31T 第二,deepseek-v4-flash 17T,后面是 mimo-v2.5 的 7.6T、glm-5.3-flash 的 3.2T。
这串数字说明什么?说明有人正在用它跑量。批量任务、代码生成、数据清洗,这类活儿一晚上就能堆出几个 T。
但它不说明第二天这个人还回来。
同一份数据里还有一列,大多数人扫一眼就过去了:周留存。
同一榜单的留存排行:muse-spark-1.3-contributor 87.4%(样本 4.5K 独立用户)、omen-alpha 81.7%、muse-spark-1.2 81.5%(7.7K)、longcat-2.0 78.1%、mimo-v2.5 72.9%(26K)、qwen3.8-flash 72.3%。使用量最大的 deepseek-v4-flash 是 68.3%,样本 48.3 万独立用户;glm-5.3-flash 68.8%,4.1 万用户。
两个数得一起看。87.4% 很漂亮,样本只有四千多人;68.3% 看着普通,背后是四十八万人。前者可能是小圈子里的一把好刀,后者是大池子里被反复磨过的一台机床。你要哪台,取决于你要切什么。
对 OPC——一个人或者几个人的公司——我的建议是:把自己每天要重复做的活儿拆出来,对着留存那一列挑。跑批的活儿看单价和吞吐;每天用的活儿看留存和手感。别让一个"榜一"替你做决定,它评的是别人的活儿,不是你的。
还有一句得说透:这个榜单的样本偏开发和编程场景,替全行业下不了结论。但编程恰恰是最先被 AI 改造的地方,它的信号比大多数行业早半步。
顺带说一句老周那三个 AI 为什么死了两个。写商品描述的那个活得最好,因为产出直接进链接,错了当场能看见;客服初筛那个被弃用,是因为每次都得让人重新教一遍口径;纪要靠自觉点开,第二周自然就没人点了。
不是模型不行,是岗位没定义。
"英伟达、微软自己都不让用最强模型了,这是什么信号?"
9月15日的行业动态汇总里有两件事挨着:一是英伟达、Palantir 等公司对内部使用 OpenAI 和 Anthropic 最先进模型做了限制;二是微软发布临时行为准则,给 AI 模型的使用划了界。同一天,苹果推出了新一代由 Apple Intelligence 驱动、面向 Siri 的更新。
一边收紧内部,一边把 AI 往更多终端里塞。这不矛盾。
大公司不是不用强模型,是分层用:哪些数据不许出去、哪些模型能碰客户信息、输出由谁签字。先把规矩定下来,再谈效率。这个顺序,很多小团队是反的。
对 OPC 来说,这恰恰是最值得抄的一块。你五个人的团队,第一天就该定三件事:
- 哪些数据永远不许贴进对话框(客户的合同、身份信息、未公开的报价);
- 哪类任务用哪个模型,允许走公有云还是要本地跑;
- 谁为最终输出负责。
我们见过不少小团队,热情很高,第一天就把所有材料往最强模型里灌。真出了问题,没有一个人说得清那份东西是谁发的、哪天发的、用的哪个模型。
规矩不是大公司的负担,是小团队的保险。你人少,兜底的能力更弱,这笔账要先算。
"端侧、智能体、终端融合,这些词离我一个做检测设备的有关系吗?"
这是东莞做检测设备的阿强问的。他总觉得政策文件跟自己隔着一层。
9月15日的两部门文件里写得很具体:加强端侧大模型、计算芯片、存储芯片、操作系统的兼容适配,加快智能体与终端产品的深度融合;同时推进第五代精简指令集(RISC-V)的研发与产业化,支持 RISC-V 芯片在人工智能、嵌入式系统等领域应用。
还有一条在开发者文档里:Google 的 Gemini API 已经分出了专门的"电脑使用"模型——能看见屏幕、会点击和输入,自己走完浏览器流程;以及深度研究代理模型,自己规划多步检索、给出带出处的报告。
把这两条放一起看,方向是一件事:模型正从云端那个聊天框,搬进设备和流程里,去执行动作。
阿强问这跟他有什么关系。关系挺直接。
他的设备每天要拍几千张图,看有没有划痕、缺口、装配错位。过去是老师傅肉眼看,后来上了传统视觉算法,阈值调了半年还总误报。现在端侧模型能跑在设备本地的板子上,弱网、断网都照常干活——这才是他真正的落地场景。

RISC-V 那条看得更远。芯片成本往下走,"每个设备里塞一个能判断的小模型"这件事,就从大厂专供变成中小厂商也够得着。这一层的变量,今明两年会很有意思。
OPC 的机会不在造模型,在于把某一个具体动作做稳。判断标准三条:这个动作每天重复吗?有没有明确的对错?能不能在本地跑完?
三条都中的,值得现在就动手。缺一条,先别急,等你把流程捋清楚。
"我一个人带三个 AI,第一周很热闹,第二周就没人点开了"
问这句的是 Sara,做品牌咨询的,团队三个人。
这个我太熟了。我们自己踩过一模一样的坑。
舍予AI智能体的事,后来慢慢收敛成一句话:老板的第一支 AI 战队。重点在"战队",不在"工具"。我们不按账号发,按岗位发——每个智能体上岗之前,先写一份岗位说明书:它接什么输入、吐什么格式、遇到哪种情况必须停下来交给人。用满一周,看的不是它多聪明,是它这周被叫了多少次、被退回过多少次。
听着笨,但它解决的是同一件事:第二周还有没有人点开你。
模型那边 68.3% 的留存,靠的是回答质量;你这边的留存,靠的是它有没有一个明确的岗位。一个没有岗位的 AI,和一位没有工位的新员工一样,第一周大家围着看,第二周就没人想起他。
所以我们自己的判断是:2026 年剩下的时间里,模型榜还会换很多次第一,这不是你能控制的变量。你能控制的,是给团队里那个"AI 队员"写下第一份岗位说明书,半小时够,今天下午就能写。
别赌单一供应商,留好切换的路;别只追最强,追那条最稳的日常。
下周还会有新名字冲到榜首,还会有大公司收紧权限,还会有新的文件出来。这些你追不完。
真正决定你能不能赚到钱的,是第二周还在被打开的那一个工具、那一个岗位。
提醒:本文中的行业动态、政策表述与榜单数据,均来自公开渠道整理,截至 2026年9月16日。榜单为第三方平台开发场景样本,不代表全行业;模型版本迭代较快,选型请以自己团队的真实试用为准。本文不构成采购或投资建议。