那份 25 个模型的下线名单,我拖到 9 月 15 日才认真看

2026-09-21舍予基业来源:公众号「舒毅讲AI」
那份 25 个模型的下线名单,我拖到 9 月 15 日才认真看
从同济大学25个模型下线通知切入,剖析多版本并行是负债而非能力,给出抽表配置、岗位化抽象、双跑验证三步迁移法,帮一人公司和团队把模型依赖变成可替换的岗位。

9 月 15 日,同济大学信息化办公室那份通知正式生效。通知是 8 月 15 日发的,一行字:25 个模型名,停止服务。

我 8 月就刷到过,扫了一眼,判断是高校内部平台的资源整理,跟我没关系。

9 月 15 日下午,我改了一整天代码。

那份清单,先说我数出来的三件事

第一件:停的不是"差模型",是"多版本"。DeepSeek-R1、DeepSeek-V3.1、Qwen3-235B-Instruct、Qwen3.5-122B-A10B、Qwen3.5-397B 在 9 月 15 日这天一起下线;而 Qwen3.5-27B、Qwen3.6-27B、Qwen3-Coder-480B-A35B、Qwen2.5-72B-Instruct、Qwen2.5-VL-72B、Kimi-K2.5/K2.6/K2.7-Code、GLM5.0/5.1、MiniMax-M2.5/M2.7、Gemma-4-31B-it、Gemma-4-26B-A4B-it 这些,从通知发布那天起就没了。

第二件:留下的名字一共 8 个。Kimi-K3、Qwen3.8-Max、DeepSeek-V4-Pro(0813 正式版)、GLM-5.2、DeepSeek-V4-Flash(0731 正式版)、MiniMax-M3、MiMo-V2.5、Qwen3.8-27B。

第三件,也是最扎心的:被停的那些,理由写得很客气——"使用率偏低""多版本并行所致的维护冗余""老旧、小参数模型"。

翻译一下就是:多版本并行不是能力,是负债。模型不是资产,是耗材。

一个具体的案例:三条链断了两条

我手上有一条给客户做的评论分析流水线,另外两条是内容清洗和自动分类,一共三条链。其中两条,一条压在 Qwen3-Coder-480B-A35B 上,一条压在 DeepSeek-R1 上。

背景:这套东西是我一个人搭的,跑得挺好,成本不高,从去年到现在没动过。

当时怎么做的:8 月看到通知,我的判断是"我不在同济的平台上跑,这事跟我没关系"。模型 ID 就散落在提示词文件、两个 py 脚本、一个环境变量和一份 README 里,大概十几个地方。我没去数。

结果如何:9 月初,上游供应商陆续开始返回错误。我先怀疑是网络,再怀疑是额度,最后才定位到"模型没了"。找问题花了半天,改代码又花半天。

真正贵的不是 API 调用费,是那一天的排查。两条链停摆那两天,客户那边是不知道的——因为没人报错,只是不出结果。

这件事让我意识到一个特别朴素的道理:我一直在给"模型"写代码,但我真正该写的是"岗位"。

后来我怎么改的

一是抽表。模型 ID、备用模型、超时阈值、单次成本上限,全部收进一张配置文件。代码里只允许出现"岗位名",不允许出现"模型名"。现在上游再换一代,改三行。

二是把"战队"这个比喻当真。我们做舍予AI智能体的时候,给它的定位是"老板的第一支 AI 战队"。战队这个词有个前提:队员会换,岗位不能散。 老板要的是"有人把竞品评论看完",不是"必须用某个型号的模型看完"。这两件事分清楚了,迁移就变成一次配置更新,而不是一次重构。

三是换之前先双跑一周。新旧模型并行,跑同一批真实输入,比对输出差异。这比任何榜单都准。

这几天真正值得看的几条动态

GPT。 FrontierMath 上出了件事:一道 2017 年提出的、关于批准式委员会选举中"核是否为空"的开放难题,被 GPT-6 Astra 和三位人类研究员一起做掉了。原题要求找一个"核为空"的反例,Astra 反过来证明了反例不存在——绝对公平的委员会,在任何情况下都必然存在。它还发明了基于"调和熵"的投票规则,给出多项式时间算法,证明局部最优解就满足要求。Epoch AI 为此在榜单上新增了 Human + AI 的分类。

这次人机分工特别清楚:人类给方向和逻辑把控,AI 出知识库、计算演练和那种跳一下的灵感。对一人公司来说,这就是"一个人的研究所"的样板——你不需要招人,你需要重新分配谁负责什么。

另外,OpenCode 9 月 21 日的数据里,gpt-5.6-luna 是 534B 用量、标着 -5%,周留存前 14 里没它。编码这件事上,OpenAI 已经不是默认选项了。

Gemini。 API 文档里现在单列了一类"工具和代理模型":computer use 能"看见"屏幕并执行点选、输入、浏览,把浏览器里的活自己干完;Deep Research 从数百个来源取信息,生成带出处的报告,还有个 Max 版。

OPC 缺的从来不是"生成一段文本",是"有人替我把这四十个页面对完,还告诉我哪句话出自哪"。这两件事现在都是可调用的零件。别再自己写爬虫加调度器了,那是三年前的作业。

Llama(Meta)。 OpenCode 榜上 Meta 占了两席:muse-spark-1.3-contributor 34T 用量,muse-spark-1.2-contributor 2.8T,周留存 83.3% 和 81.1%。

开源系在真实编码场景里是稳得住的。对 OPC 意味着议价权:同样的活,你可以在托管 API 和自托管之间切,谁涨价你换谁。这条退路值钱。

Qwen。 这次是重灾区。9 月 15 日停 Qwen3-235B-Instruct、Qwen3.5-122B-A10B、Qwen3.5-397B;通知当天就停 Qwen3.5-27B、Qwen3.6-27B、Qwen3-Coder-480B-A35B、Qwen2.5-72B-Instruct 等一串。在役只剩 Qwen3.8-Max 和 Qwen3.8-27B。

Qwen3-Coder-480B-A35B 我见过不少人拿它写代码,口碑不错,照样一刀切。专精版不等于长寿版。 别因为一个模型在某类任务上顺手,就把它焊进架构。OpenCode 上 qwen3.8-flash 是 303B、标着 -28%,版本一代一代换,你的代码不该跟着换。

DeepSeek。 OpenCode 9 月 21 日的数据里,第一名是 deepseek-v4.1-flash,51T 用量、涨 99%,周留存 85%,两项都在最前。deepseek-v4-flash 17T,周活用户 486K,是留存榜上用户量最大的一档;v4-pro 664B。

同济在役清单里,DeepSeek 留的是 V4-Pro 和 V4-Flash,R1 和 V3.1 直接退场。R1 退役是个信号:推理模型从"特殊品类"变成了默认配置。 别再为"我用了推理模型"付溢价。

配图

Kimi。 K2.5、K2.6、K2.7-Code 已停,在役 Kimi-K3。但 OpenCode 上 kimi-k2.7-code 还有 165B 用量。

榜单是滞后的。一个模型在榜上还有量的时候,它可能已经在下一代的替换名单里了。判断要往前看半步,尤其是写代码这种吃版本更新的场景。

GLM。 GLM5.0、5.1 停止服务,在役 GLM-5.2。OpenCode 上 glm-5.3-flash 2.9T 用量,周留存 69.3%,53K 周活。

注意"flash"这个词正在吃掉编码场景。轻量版不是低配版,是单位成本下更划算的版本。OPC 的成本结构里,模型调用费应该是一条会往下走的曲线。

MiniMax。 M2.5、M2.7 停服,在役 MiniMax-M3,OpenCode 上 260B 用量。国内几家从 M2 到 M3 的节奏说明版本号开始按季度走了。你的产品节奏如果是一年一版,中间至少撞上两次模型退役。

Gemma。 Gemma-4-31B-it 和 Gemma-4-26B-A4B-it 被归在"老旧、小参数模型"里,通知当天就停。

小参数模型的正确用法从来不是跑生产主线,是本地干脏活——脱敏、日志分类、批量打标。这条线被上游收掉,说明你该早点把"脏活"和"主线"分开,别共用一套账号和配额。

再说一个补充信号。 小米 MiMo-V2.5 在两份清单里都还在,OpenCode 上 6.5T 用量、28K 周活。终端厂商的模型已经开始进编码工作流了,多一条供应商线,就是多一层保险。

能抄的作业,就四行

一,模型 ID 只出现在一张配置表里。这是最低成本的架构保险。

二,选型看留存,不看榜单第一。留存的含义是"下周还用不用",这比一次跑分诚实。

三,切之前双跑一周。别用感觉做迁移。

四,把"迁移能力"本身当资产。这几天我甚至在想,帮中小企业做模型迁移和能力评测,本身就是一门能立刻开的生意——名单会一直更新,而大多数人直到服务挂掉那天才会去看。

上游会一直删名字。你要做的,是让删名字这件事,只值三行代码。

AI应用模型迁移一人公司技术架构

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。