同一个命令,昨天的答案和今天不一样

2026-09-12舍予基业来源:公众号「舍予AI智能体」
同一个命令,昨天的答案和今天不一样
从一次无感模型换代讲起,结合调用量数据与图像、算力、具身智能信号,说明切换成本趋零后创业者该把护城河押在场景深度与真机验证上。

前几天的早上,我在终端里敲下同一行命令,让 coding agent 帮我改一段老代码。

结果跟昨天不一样。

不是变差,是变准了。昨天它还绕个弯,今天直接落到点上,顺手补了一个我压根没提的边界条件。我第一反应是自己手滑改了上下文,翻回去看了一眼——没有。

版本号没变,配置文件没动,终端都没重开。

后来才知道原因:月之暗面把 Kimi K2.8 Preview 全量推给了 Kimi Code CLI,而且说得很清楚——用户不需要切换 Model ID,原来指向的 kimi-for-coding 会直接落到新模型上。

就这么一句话。我认为这是今年最值得创业者琢磨的工程细节之一。

换代这件事,正在从"发布会"挪到"后台"

过去两年我们习惯了这样的节奏:某家发新模型,群里刷屏,大家去切 API、改配置、跑评测,折腾两天,然后各回各家。

现在整个流程被压缩成一次无声的后台更新。

你什么都没做,你的工具变强了,或者变弱了。

这个变化的分量,可以从一组数据里看出来。根据 OpenRouter 的测算,8 月 31 日到 9 月 6 日那一周,全球大模型的调用总量是 115 万亿 Token,环比增长 1.77%。中国模型的周调用量连续十九周超过美国,全球排前五的模型里有四款来自中国。

腾讯混元 Hy4 preview 直接冲到榜首,单周 14.7 万亿 Token,环比暴涨 379%。

注意这个 379%。不是评测分数涨了 379%,是真金白银的调用量涨了 379%。全球总量 115 万亿,它一家占掉接近七分之一。

这意味着什么?意味着有大量的人在一个星期之内,把一个刚上线的模型接进了自己的生产流程。他们没开会讨论要不要试,是直接跑了。

同一张榜单也在洗牌。上一周还排第三的小米 MiMo-V2.5、排第九的 Gemini 3.7 Flash,这一周就不在前列了。

对 OPC 创业者来说,这里有一个非常实在的结论:模型切换的成本,正在快速趋近于零。 你不需要为换一个模型付出任何架构代价,一行配置的事。

反过来也成立——任何把护城河押在"我用的是某个特定模型"上的项目,都在裸奔。

这话不好听,但它是这一周数据里最硬的一条。

同一周,还有三个信号

第一个是图像。

ChatGPT 的图像模型更新到 2.5。官方的说法是:它更能理解复杂的视觉指令,输出连贯性更好,含现实信息的图像更准确,能处理带透明背景的复杂版面,也更贴近你给定的视觉风格。

翻译成做生意的语言:以前生成一批品牌素材得反复抽卡,十张里能用的可能两三张;现在你把视觉方向、构图、层级讲清楚,它更可能一次守住。

对一人公司的落点很具体。

做电商的,主图和详情页的视觉一致性,不再必须外包一层设计。做 SaaS 的,UI 概念稿能在跟客户聊完的那个下午出三版;做咨询的,一份结构化简报的配图不用再去图库翻半小时。

第二个是算力供给侧。

9 月 11 日,燧原科技登陆上交所科创板,发行价 142.18 元/股,首日高开 188.37%,收盘涨 179.22%,总市值 1777 亿。至此"AI 芯片四小龙"齐聚资本市场。

这几家公司营收都在高速增长,但盈利拐点还要观察。对创业者来说,值得看的不是股价,是它背后的趋势:推理算力的供给还在扩,价格长期往下走。

你今天为了省钱把上下文砍到两千字,明年可能就不必了。别为一个会消失的约束做产品设计。

第三个在具身侧。

宇树科技全开源了新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,6B 参数,5M+ 训练样本、约 2500 小时真机数据,单模型可统筹 64 个任务,覆盖桌面和全身移动操作。

底座在免费往外给。如果你做的是机器人周边或者某个垂直场景,这件事的分量,比大多数发布会都重。

真正的风险,是"无声的漂移"

说了这么多好话,得说个不好听的。

配图

静默进化是好事,但它同时带来一个很阴的问题:你的输出质量在变,而你没有任何日志。

模型在后台换了,你的提示词没换,你的评测没跑,你的下游代码没动。如果新模型在某个环节上恰好变差了——完全可能,模型能力是不均匀的,这块强了那块可能弱了——你什么时候会发现?大概率是客户投诉的时候。

我自己在搭"舍予AI智能体"、帮老板组第一支 AI 战队的时候,立的规矩里有一条是反直觉的:不追最新,只认真机验证。

做法很土,也没什么技术含量:给每个客户的业务流固定一组真实样例,二十来条,就是他们日常最常发生的请求,配上一句"什么算好、什么算坏"的判断标准。每次模型层面有更新,或者我们主动换引擎,先跑这组样例,把新旧输出摆在一起看。过了,才换。

这组样例值多少钱?不值钱。但它能让你在"模型换代"这件事上,从感觉切到证据。

一人公司没有测试团队,这套东西就是你的测试团队。

它不是技术活,是纪律活。

机会藏在"切换免费"这四个字里

再往前推一步。

当切换成本趋零,价值会往两头集中。

一头是场景做深。既然模型是随时能换的零件,那你唯一带不走的,是你对某个具体行业的理解、你攒下的领域数据、以及你定义"什么叫做对了"的那套标准。一个只做跨境物流对账的 Agent,比一个什么都能聊的通用助手值钱得多,因为它知道单证上哪个字段最容易错。

另一头,是"中间层"本身。多模型路由、自动评测、A/B 对比、输出回归——这些对每个真在用 AI 的公司都是刚需,但大多数老板没精力自己搞。这本身就是一门生意,而且是那种客户越用越离不开的生意。

混元能一周涨 379%,小米能一周从前三掉出去,说明这个市场没有忠诚度,只有试用的成本。谁把试用的成本再压低一层,谁就有位置。

接下来这两三周值得盯一下。Kimi 这次是无感推送,下一次,可能就有人把"自动切换到更强的模型"做成默认行为——你的 Agent 会在你睡觉的时候自己换引擎。

到那时候,那组样例集,可能就是你唯一能睡着觉的理由。

<small>本文涉及的模型动态、调用量数据与融资信息均来自公开报道(OpenRouter 测算、Kimi 官方推送说明、ChatGPT 图像 2.5 更新说明、燧原科技上市公开信息等),时间截至 2026 年 9 月 12 日。模型迭代极快,具体能力、价格与配额请以各家官方文档为准;文中观点为个人判断,不构成采购或投资建议。另外提一句和钱无关但和命有关的事:微信 WeWorm 漏洞已在 iOS 8.0.76 与安卓 8.0.77 修复,还没升级的设备,今天顺手升一下。</small>

AI 应用创业经营模型评测一人公司

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。