《GPT掉到第11,智谱第7——这张榜上最扎眼的三个字是"不支持"》
《GPT掉到第11,智谱第7——这张榜上最扎眼的三个字是"不支持"》
昨晚十一点半,我在改一个客户的模型配置。
不是改代码,就改一行:把某个活从 A 模型换成 B 模型。改完顺手点开 OpenCode 那份公开的模型使用排名。本来只想扫一眼,结果坐着看了挺久。
不是意外。是太诚实了。
先把榜摊开(截至这两天):
- 智谱 Zhipu,7%
- nemotron-3-ultra 2.7T,NVIDIA,+10%
- deepseek-v4-flash-vision-exp 1.0T,DeepSeek,+5%
- deepseek-v4-pro 711B,-2%
- ling-3.0-flash-fin 611B,+50%
- gpt-5.6-luna 563B,OpenAI,-1%
- union-alpha 470B,新进榜
- nemotron-3.5-lightning 424B,-26%
- qwen3.8-flash 324B,-32%
- minimax-m3 285B,MiniMax,-5%
这不是评测,是账单。每天敲代码的人按回车投出来的票,比跑分硬。
GPT 的 563B 排在第 11 位,微跌 1%。看清楚,不是崩,是“平”。曾经的默认选项,现在退成了选项之一。对做产品的人,这意味着你不能再把“用了 GPT”当卖点。客户默认你该用好,不会为这个多付一分钱。
涨得最猛的是两个:ling-3.0-flash-fin +50%,nemotron-3-ultra +10%。都不是最大的模型,是“够用且不贵”的那一档。跌得最狠的是 qwen3.8-flash,-32%。
真正在动的是另一件事:榜单比的不是“谁更强”,而是“什么活该派给谁更划算”。coding 早就碎成了几十种活——补全、重构、写测试、读日志、翻文档——每一种活的最优解都不一样。
所以建议很直接:OPC 创业者别做“模型忠诚”,做模型值班表。
我们自己就是这么干的。每接一个项目,第一份交付物不是 prompt,是一张表:哪类活派给谁,谁在什么情况下被换掉,换人的时候改哪一行。写死在配置文件里。昨晚改的那一行,就是换班。我们的定位叫“老板的第一支 AI 战队”,这话听着大,落到实处其实就是这两张表。
至于为什么非得这么做,往下看。
一、榜单决定谁上场,文档决定谁不能上场
我把阿里云百炼那份联网搜索的文档翻了两遍。里面有一句话,比整张榜都值钱。
它写得很清楚:agent 策略——也就是多轮调用搜索工具、边搜边整合——Qwen3.8 Max、Flash 与开源系列、Qwen3.7 系列、Qwen3.6 系列、Qwen3.5 系列这些都支持;而 MiniMax-M2.1、Moonshot-Kimi-K2-Instruct 与角色扮演模型,不支持。
还有两个细节:启用 agent 策略时,只支持“返回搜索来源”这一种配置,其他联网功能不可用;而且每次调用额外收费。
三个字,“不支持”。
这不是说 Kimi 和 MiniMax 不行。Kimi 的长文本、MiniMax 的多模态各有主场。但如果你要做的产品是“带引用的多轮检索”——帮客户盯招投标、盯供应商变更、盯竞品调价——那选型的第一步根本不是跑 benchmark,是先查这张支持表。
太多人栽在这儿:拿一个跑了三分钟的 demo,去接一个要跑三个月的活。
给同行的建议:把你的产品需求拆成两栏。左边写“必须的能力”,右边写“可以妥协的能力”。拿左边那栏去对官方文档的功能矩阵,一个对一个。Kimi 和 MiniMax 被标“不支持”的这一项,如果你左边那栏恰好有,它们就不是第一顺位;如果你只做单轮问答,这份钱你根本不用多花。
省下来的,是毛利。
二、智谱排第7,但真正的大事发生在上海
9月17日,华为全联接大会2026。汪涛讲的几个数字,我觉得比榜单更值得琢磨。
大模型参数正快速迈向10万亿,2030年要到100万亿以上;智能体已经能按小时级连续工作,到2030年将以月为单位执行任务;中国每日推理 Token 已经增长到 500 万亿左右,2030 年到百万万亿级;端侧这边,手机模型从 2024 年的 3B 走到今天的 30B,未来要往 100B 去。
还有一个技术细节:传统服务器架构下,10万卡集群里通信时间超过训练时间的40%。华为用 4K 超节点组 10万卡集群,MFU 提升 2.75 倍。昇腾960 芯片进度超预期,960DT 提前三个季度,2027年一季度就绪。
这些数字跟一人公司有什么关系?很大。
“智能体从小时级走到月级”——这件事的关键变量不是模型更聪明,是它能不能被信任地放那么久。一个不间断跑一个月的任务,中间一定出错。一定需要人接管。很可能在某个半夜被人叫醒看一眼。
这就是一人公司的生意。
不是去做模型,模型你追不上。是去做“接管”:出错时告警发给谁、哪一步必须人工确认、确认完怎么回填。这些活大厂不做,因为不性感,但每一个真正跑起来的 Agent 都需要。
端侧 30B 这条也值得关注。原本必须上云才敢想的事,现在能在本地跑。数据不出门——门店、工厂、诊所这类地方,这是它们唯一能接受的方案。落地场景很明确,门槛也明确。
再回到榜单。智谱排在第7,7%。它没有最大的参数,但它在“每天真用”这条线上站住了。这个位置比某个跑分第一更难拿,也更值钱。
三、Claude 这三天的三条消息,该让开发者后背发凉

9月9日,有研究团队利用 AI 开发出零点击微信蠕虫。9月10日,Anthropic 的研究人员公开警告 AI 发展过速。9月11日,Anthropic 发布了 AI 模型被滥用情况的报告。
三天,三条。
我不打算在这儿讨论立场。我关心的是实操:你的 Agent 有多少权限。
我们内部有个笨办法。每个 Agent 上线前必须交一份清单,写清楚三件事——它能读什么,能写什么,能发给谁。三个问题答不上来的,一律不给客户数据。
听着很土。但你如果同时管着十几个自动化流程,这份清单能救你的命。一次误发,一个客户就没了。一人公司没有公关部,也没有第二次机会。
四、这张榜上“没出现”的名字,也是信息
Gemini、Llama、Mistral、豆包,这份榜上没有。
先说清楚:这不代表它们没有用户。OpenCode 是编码工具,榜上以海外开发者为主。但至少说明一件事——在“每天真的敲代码”这条最挑剔的赛道上,票投给了别人。
豆包的主场在 C 端和端侧,Gemini 在多模态和搜索,都不在这儿。Llama 和 Mistral 守着开源,但这一轮开源阵营的注意力,明显被中系模型和英伟达分走了——你看榜上,DeepSeek 占两席,Qwen、MiniMax、ling 都在,nemotron 两个版本也在。
给创业者的建议就一句:别信名气榜,信场景榜。你要做的事落在哪个场景,就看那个场景的使用数据。做编码就盯这张榜,做中文长文看中文场景的量,做端侧看端侧的装机。
最后说件小事。LobeHub 上有个叫 ai-news-zh 的技能,自动从 The Verge AI、Wired AI、TechCrunch、MIT Tech Review、Anthropic 这些源抓新闻,去重、翻译,按“大模型/Agent/融资/安全/应用/开源”打标签,选 Top 10-12 条,定时推到飞书、Telegram、Discord。
一个人开公司,信息差就是响应速度。别人两天后看到的事,你当天看到,你就能先报价。
但别停在“看”上。我认识做得最好的那批一人公司,每天早上固定时间收到那一条流,十分钟扫完,只干一件事:把跟自己客户相关的那一条,变成当天要打的一个电话。
还有一件事是很多人的盲区——同济大学信息化办公室在 2026年8月15日发过一份通知,部分模型下线,请师生转向平台本地化部署的新一代模型。一所大学尚且要定期清退模型快照,你凭什么把生产环境押在一个版本号上。
模型是租来的,客户才是自己的。榜会变,值班表不用变。
还有一句:别把任何一次投票,当成终身契约。