模型换代比我交稿还快,我为什么反而松了口气
周六早上,这一周的模型动态摊了一屏。本来想做成清单,写了两行就删了——清单谁都会拉,值得回的是问题。
这周被问得最多的,加上我自己心里憋着的,一共四个。我一个个聊。
“模型一个接一个地发,我到底要不要每次都跟?跟了我自己的活就干不完了”
先把这周值得记的摆出来。
Kimi K3(据2026/09/09的模型盘点):月之暗面7月发布的Agent模型,2.8T总参数、激活104B,最高支持1M token上下文,是目前总参数量最大的开源模型;MoE共896个专家、每次激活16个,原生支持视觉;KDA与AttnRes两项架构创新,让扩展效率比前代提升约2.5倍。
GPT 6 Astra:一档海外视频节目里提到它“全面追上”,并可能影响Anthropic原本排在美国劳动节后的IPO节奏。这是节目里的分析,不是官方口径。
Qwen3-Next(据阿里云百炼文档,2025年9月的信息):总参数800亿、每次只激活30亿,性能对标2350亿参数的旗舰版,训练成本比同规模稠密模型降了九成以上,32K以上上下文的速度是Qwen3-32B的10倍以上。
三条放一起,我的回答是:跟。但别跟版本号,跟两条曲线。
一条是单位成本。K3把扩展效率抬了2.5倍,Qwen那代稀疏结构把训练成本砍掉九成——这类变化,下个月就会出现在你的报价单上。另一条是接口形态。上下文从256K到1M,意味着以前必须写代码去拆的活,现在一次喂进去就行,你那套切片逻辑可能直接作废。
至于“谁第一谁第二”,跟你客户的付费意愿,基本没关系。
对一个人干活的OPC来说,这条的意义在这儿:你不需要追每一个模型,你需要一套换模型的机制。我们自己的做法是给每个跑起来的工作流写一张“迁移卡”——入口在哪、提示词放哪、输出格式谁校验、换模型之后拿什么比对。三个字段必须写清:哪一步是模型判断、哪一步是代码判断、哪一步必须由人判断。卡不写,你迟早被某次版本更新在凌晨叫醒。
还有条内部规矩:任何给客户上线的工作流,必须能在半天内整套换到另一个模型上跑通。跑不通,不许上线。听着保守,其实最省心。
“模型都能联网搜了,我攒的那点信息差是不是白攒了”
联网搜索(阿里云百炼文档):训练数据存在知识截止日期,开启联网才能回答实时问题。但它是分层能力——qwen3.8-max等在Chat Completions协议下不支持agent检索策略,得改用Responses API的web_search工具;MiniMax-M2.1、Kimi K2与角色扮演模型不支持agent策略;启用后仅返回搜索来源,每次调用额外收费。
这是今天最容易被低估的一条。
很多人一看“模型能联网了”,第一反应是:完了,我靠查资料吃饭的本事没了。恰恰相反。你去看文档里那些坑——哪个协议支持哪种检索策略、什么时候得绕到另一个接口、哪几个模型干脆不支持、额外怎么计费——这就是新的信息差,而且它比“我知道这个信息”更难被替代。
以前的信息差是“我知道”,现在的是“我知道该在哪一步让机器去查、哪一步必须我自己判断”。
再往生意上看:“仅支持返回搜索来源”,对做交付的人是利好。意味着你能交出一份带出处的报告,客户拿回去对得上、查得着、出了问题能追责。这在给企业做活的时候,比“答得快”值钱得多。
给OPC的建议很具体:把流程里的环节分成两类,必须联网查的和必须离线判断的,别让同一个环节同时干这两件事。检索交给agent多轮跑,判断你自己来。混在一起,出了错你连错在哪都找不到。
“大厂都在讲平台化、体系化,我一个做点状小工具的还有戏吗”
服贸会现场(新华社9月12日记者手记):中国服务案例中,以AI、大模型、智能体为核心技术的占比近四成;美团“智能掌柜”把顾客评价按菜品、服务、环境归类成结构化建议;飞象老师3.0让教师用自然语言生成课堂互动应用;中通已有超3500台无人配送车在260多个城市投用,每天送包裹超870万件。德勤中国孟晓凡在会上说,AI正从点状应用走向平台化、体系化。
那句“从点状走向平台化”,估计让不少做小工具的人心里一沉。
但你把三个案例拆开看:智能掌柜吃的是“评价→结构化反馈”这一段;飞象老师吃的是“备课→课堂互动应用”这一段;无人车吃的是“最后三公里”这一段。没有一个是通用能力,全是一段流程做到极致。
平台化是平台的事。OPC的机会恰恰在那一段里。你不可能在“什么都能干”上赢,你有可能在“这一段里的意外”上赢——因为只有你天天蹲在这一段,知道它第几步会翻车、哪句话会让模型发疯、哪个字段客户一定会改。

所以别焦虑,去做一件很土的事:把你这一段流程里“会出错的十件事”列出来,每件配一个检查动作。这十条,就是你卖的东西,跟模型没关系,换谁家的模型它都值钱。
“高校都能Day 0上线最新模型、一天跑300亿词元,我一个人是不是永远追不上”
中国科大(校方新闻,9月11日):DeepSeek V4.1 Flash于9月10日发布并开源,学校次日完成适配部署,成为国内首个面向师生开放该模型的高校;平台通过统一网关实现DeepSeek、GLM、Kimi、Qwen等主流模型Day 0上线,支持1M上下文;截至9月初已有12000名师生在用,日均处理词元超300亿,累计突破14000亿。
先说一个反直觉的点:这件事的重点不是“学校有钱买卡”,是“学校有一套适配机制”。模型发布当天上线,靠的是统一网关、统一认证、快速适配的流程,不是算力堆出来的。Day 0 是流程能力,不是硬件能力。
第二点更值得琢磨:日均300亿词元、累计14000亿。什么概念?词元已经成了一项跟水电一样的运营科目。还在按“账号订阅”算AI成本的人,账会算歪。
我们给老板配“AI战队”的时候,第一步从来不是选模型。是先把这个岗位这周要干的活拆成任务清单,然后一件一件估:这件事要烧多少词元、错了谁来发现、多久能返工。选模型是最后一步,而且随时可换——因为我们知道下个月它就会变。
你要的“机制”也不复杂,一张词元周报就够:这周花了多少、哪个环节最贵、哪个环节花了钱不办事。连续记一个月,该砍谁、该加谁,一目了然。
最后
把四个问题串起来,其实就是一句话:
模型换代快,不是你的敌人。它压低了“谁用得早”的价值,同时抬高了另一件事的价值——谁能把一个模型,接到一段真实的流程上,还接得住。
排行榜上的位置轮不到你操心。流程里那个位置,眼下还真只有你能坐。
小字提醒:本文所引信息均来自公开来源(厂商文档、新华社报道、高校官网新闻、公开视频节目分析等),时间截至2026年9月19日;其中2025年的旧数据已在文中单独标注,不代表当前版本。模型能力、协议支持与价格迭代极快,任何选型和成本判断请以你自己的实测和最新官方文档为准。本文不构成投资建议。