同一个命令,昨天的答案和今天不一样
前几天的早上,我在终端里敲下同一行命令,让 coding agent 帮我改一段老代码。
结果跟昨天不一样。
不是变差,是变准了。昨天它还绕个弯,今天直接落到点上,顺手补了一个我压根没提的边界条件。我第一反应是自己手滑改了上下文,翻回去看了一眼——没有。
版本号没变,配置文件没动,终端都没重开。
后来才知道原因:月之暗面把 Kimi K2.8 Preview 全量推给了 Kimi Code CLI,而且说得很清楚——用户不需要切换 Model ID,原来指向的 kimi-for-coding 会直接落到新模型上。
就这么一句话。我认为这是今年最值得创业者琢磨的工程细节之一。
换代这件事,正在从"发布会"挪到"后台"
过去两年我们习惯了这样的节奏:某家发新模型,群里刷屏,大家去切 API、改配置、跑评测,折腾两天,然后各回各家。
现在整个流程被压缩成一次无声的后台更新。
你什么都没做,你的工具变强了,或者变弱了。
这个变化的分量,可以从一组数据里看出来。根据 OpenRouter 的测算,8 月 31 日到 9 月 6 日那一周,全球大模型的调用总量是 115 万亿 Token,环比增长 1.77%。中国模型的周调用量连续十九周超过美国,全球排前五的模型里有四款来自中国。
腾讯混元 Hy4 preview 直接冲到榜首,单周 14.7 万亿 Token,环比暴涨 379%。
注意这个 379%。不是评测分数涨了 379%,是真金白银的调用量涨了 379%。全球总量 115 万亿,它一家占掉接近七分之一。
这意味着什么?意味着有大量的人在一个星期之内,把一个刚上线的模型接进了自己的生产流程。他们没开会讨论要不要试,是直接跑了。
同一张榜单也在洗牌。上一周还排第三的小米 MiMo-V2.5、排第九的 Gemini 3.7 Flash,这一周就不在前列了。
对 OPC 创业者来说,这里有一个非常实在的结论:模型切换的成本,正在快速趋近于零。 你不需要为换一个模型付出任何架构代价,一行配置的事。
反过来也成立——任何把护城河押在"我用的是某个特定模型"上的项目,都在裸奔。
这话不好听,但它是这一周数据里最硬的一条。
同一周,还有三个信号
第一个是图像。
ChatGPT 的图像模型更新到 2.5。官方的说法是:它更能理解复杂的视觉指令,输出连贯性更好,含现实信息的图像更准确,能处理带透明背景的复杂版面,也更贴近你给定的视觉风格。
翻译成做生意的语言:以前生成一批品牌素材得反复抽卡,十张里能用的可能两三张;现在你把视觉方向、构图、层级讲清楚,它更可能一次守住。
对一人公司的落点很具体。
做电商的,主图和详情页的视觉一致性,不再必须外包一层设计。做 SaaS 的,UI 概念稿能在跟客户聊完的那个下午出三版;做咨询的,一份结构化简报的配图不用再去图库翻半小时。
第二个是算力供给侧。
9 月 11 日,燧原科技登陆上交所科创板,发行价 142.18 元/股,首日高开 188.37%,收盘涨 179.22%,总市值 1777 亿。至此"AI 芯片四小龙"齐聚资本市场。
这几家公司营收都在高速增长,但盈利拐点还要观察。对创业者来说,值得看的不是股价,是它背后的趋势:推理算力的供给还在扩,价格长期往下走。
你今天为了省钱把上下文砍到两千字,明年可能就不必了。别为一个会消失的约束做产品设计。
第三个在具身侧。
宇树科技全开源了新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,6B 参数,5M+ 训练样本、约 2500 小时真机数据,单模型可统筹 64 个任务,覆盖桌面和全身移动操作。
底座在免费往外给。如果你做的是机器人周边或者某个垂直场景,这件事的分量,比大多数发布会都重。
真正的风险,是"无声的漂移"
说了这么多好话,得说个不好听的。

静默进化是好事,但它同时带来一个很阴的问题:你的输出质量在变,而你没有任何日志。
模型在后台换了,你的提示词没换,你的评测没跑,你的下游代码没动。如果新模型在某个环节上恰好变差了——完全可能,模型能力是不均匀的,这块强了那块可能弱了——你什么时候会发现?大概率是客户投诉的时候。
我自己在搭"舍予AI智能体"、帮老板组第一支 AI 战队的时候,立的规矩里有一条是反直觉的:不追最新,只认真机验证。
做法很土,也没什么技术含量:给每个客户的业务流固定一组真实样例,二十来条,就是他们日常最常发生的请求,配上一句"什么算好、什么算坏"的判断标准。每次模型层面有更新,或者我们主动换引擎,先跑这组样例,把新旧输出摆在一起看。过了,才换。
这组样例值多少钱?不值钱。但它能让你在"模型换代"这件事上,从感觉切到证据。
一人公司没有测试团队,这套东西就是你的测试团队。
它不是技术活,是纪律活。
机会藏在"切换免费"这四个字里
再往前推一步。
当切换成本趋零,价值会往两头集中。
一头是场景做深。既然模型是随时能换的零件,那你唯一带不走的,是你对某个具体行业的理解、你攒下的领域数据、以及你定义"什么叫做对了"的那套标准。一个只做跨境物流对账的 Agent,比一个什么都能聊的通用助手值钱得多,因为它知道单证上哪个字段最容易错。
另一头,是"中间层"本身。多模型路由、自动评测、A/B 对比、输出回归——这些对每个真在用 AI 的公司都是刚需,但大多数老板没精力自己搞。这本身就是一门生意,而且是那种客户越用越离不开的生意。
混元能一周涨 379%,小米能一周从前三掉出去,说明这个市场没有忠诚度,只有试用的成本。谁把试用的成本再压低一层,谁就有位置。
接下来这两三周值得盯一下。Kimi 这次是无感推送,下一次,可能就有人把"自动切换到更强的模型"做成默认行为——你的 Agent 会在你睡觉的时候自己换引擎。
到那时候,那组样例集,可能就是你唯一能睡着觉的理由。
<small>本文涉及的模型动态、调用量数据与融资信息均来自公开报道(OpenRouter 测算、Kimi 官方推送说明、ChatGPT 图像 2.5 更新说明、燧原科技上市公开信息等),时间截至 2026 年 9 月 12 日。模型迭代极快,具体能力、价格与配额请以各家官方文档为准;文中观点为个人判断,不构成采购或投资建议。另外提一句和钱无关但和命有关的事:微信 WeWorm 漏洞已在 iOS 8.0.76 与安卓 8.0.77 修复,还没升级的设备,今天顺手升一下。</small>