每秒1107个token的模型都出来了,你的产品还在等用户转圈吗
硅谷那家没人听过的公司,把推理速度做成了产品本身
一个没人听过的名字,把行业最贵的那块成本,直接掀了桌子。
2026年9月8日,硅谷创企Inception发布Mercury 2.5——全球首款生产级扩散大语言模型(dLLM)。推理速度跑到1107 tokens/s。
什么概念?你眨一次眼的工夫,它已经吐出一个完整函数。用户的等待焦虑,本质上是被token逐个往外挤的那个过程喂出来的。
这家公司你大概率没听过。斯坦福系,在硅谷一堆明星团队里几乎没有声量,却挑了条没人走通的路:扩散模型。过去两年,扩散在图像上封神,在语言上却始终没能跨过“质量够用”这条线。几乎所有玩家都默认,自回归逐token解码是唯一正解——慢,是理所当然的代价。
Inception不认这个账。他们把推理速度本身,做成了产品。
对标的数据很说明问题:Mercury 2.5的智能水平对齐GPT-5.6 Luna、Claude Haiku 4.5这类成本优化版前沿模型——也就是说,它不是拿“更快但更笨”来换的。首发输入价格压到$0.04/百万token。
这个价格配上这个速度,落在落地场景里会是什么样?
- 智能体循环不再被单次调用拖住,一次任务里跑几十轮自我校验成为默认动作
- 实时代码补全从“猜你要写什么”变成“跟着你的思路一起写”
- 批量任务的经济账彻底重算,很多以前算不过来所以不做的场景,现在能做了
多数人看到这条新闻的第一反应是“又一个刷榜的”。我关注的是另一件事:Inception没有去卷参数规模,也没有去卷榜单排名,他们卷的是单位任务成本。这是在改一个更底层的东西——AI推理的经济学。
值得关注的地方在于路径选择。当一个行业集体认定某条技术路线是唯一解的时候,通常意味着两件事:这条路上的边际收益已经被榨得差不多了;而旁边那几条没人走的路,成本还低得可怜。dLLM能不能在长上下文、复杂推理上继续扛住,还得看后续,但至少它证明了“速度”不是只能靠堆卡换来的。
关键变量往往不在最热闹的地方。
过去两年,大家习惯了用“聪明多少”来评估一个模型。可真正决定一个产品能不能跑起来的,常常是“多快、多便宜”。一个每秒1107个token的模型已经摆在那儿了,如果你的产品还在让用户转圈,那问题就不是模型不够强,而是你还没把速度当成产品的一部分在算。
GPT-5.6和Claude Opus 5.5同周对垒,选型窗口比你想的短
上一节聊的是速度。这周还有另一件事,比1107 tokens/s更影响你的技术栈决策:GPT-5.6和Claude Opus 5.5,同一周撞车了。
先看OpenAI这边。GPT-5.6 Sol带来了一个新的max推理档位,让模型有更长时间做深度推理;再往上还有一个ultra模式——它已经不是单个agent在干活了,而是调用subagents去并行推进复杂任务。这个变化的分量,比跑分涨几个点重得多。过去我们说"选哪个模型",潜台词是选一个能力天花板;现在同一款模型内部就切开了一整条谱系,从最便宜的Luna档到ultra的多agent编排,都是同一个API面。推理预算变成了一个可以拧的旋钮,而不是一个二选一的答案。
Anthropic那边是另一条路。Claude Opus 5.5继续压旗舰能力的上限,Extended Thinking这条路它走得最早也最稳。两家的分歧其实很清楚:OpenAI在把"算力分配"产品化,Anthropic在把"能力密度"产品化。你要投哪一边,取决于你的任务里到底有多少是"真的需要想很久",有多少只是"量大但要便宜"。
问题来了——为什么我说窗口短。
不是模型会过期。是你的选型债务会滚雪球。max、ultra、subagents这套东西一旦进入你的架构,你围绕它写的prompt、上下文组织、agent编排、评测集,全都长在具体某一版的脾气上。等你两个月后再想换,要动的不是API那一行,是整套调用逻辑和验收标准。GPT-5.6 Luna这种成本优化档位现在就能对标前沿智能水平,意味着"用便宜档做主力、贵档做兜底"这件事,今年就从可选项变成了默认解。你要是还按"先选个最强的,以后再优化"的老思路走,等于是主动把优化空间让掉。
这里有个很现实的落地场景。我们自己在做舍予AI智能体的时候就踩过这个坑——客户要的是"老板的第一支AI战队",不是一堆模型名词。老板不关心你用的是Sol还是Opus,他关心的是明天业务量翻三倍,这套东西还跑不跑得动、账单还撑不撑得住。所以现在选型的第一问不该是"谁最强",而是"这套架构能不能扛住两次换代"。
窗口短,短的还有一层含义:这周两家对垒,下周你看到的评测、榜单、社区实践,大概率会重写一遍。你现在定下来的基线,两周后就成了旧地图。但也别慌——真正的动作不是今天必须选完,而是把选型周期从两个月压到两周。先跑小样本对比,用你自己的真实任务,不用别人的benchmark;先测单位任务的稳定性,再测能力上限。这个顺序反了,后面全是返工。
速度那条曲线已经甩开产品体验了,模型换代这条曲线,正甩开你的决策节奏。
千问登顶编程榜、DeepSeek发V4,国内这波不是跟跑
上一节聊硅谷那两家对垒的时候,有个前提没展开:这轮发布潮里,国内厂商的位置已经变了。
千问Qwen3.8系列前脚发布,Qwen3.8-Max-0902后脚就登顶了CodeArena编程榜。注意,是编程榜——这块招牌过去一年基本是硅谷几家最在意的地方。更关键的是它同步强调的不是跑分本身,而是智能体在复杂任务、长周期场景里的执行能力,前端编程和智能体编程都做了针对性突破。榜单第一是结果,能力指向才是原因。
比单点模型更值得关注的,是生态盘子。 千问开源模型已经超过460个,下载量超30亿次,衍生模型超30万。这三个数字放一起看,意思很清楚:国内这波打的不是单模型对标,是拿开源当基础设施,让别人在你的地基上盖楼。衍生模型30万意味着什么?意味着无数团队已经把微调、蒸馏、场景适配的成本沉在这条线上了。迁移代价这东西一旦形成,就是护城河。
生态之外,落地场景也在往外扩。EDA、芯片设计、游戏研发,这些不是demo级的展示,是工业级的验证。国内厂商这一年在做的事,本质是把"能聊"往"能干活"上推。多模态、实时多语言翻译这些能力补上来之后,真实世界交互那块短板也在收窄。开源组还在加生图模型Z-image,闭源组推Qwen3-Max-Thinking-Preview,多线并行,节奏并不慢。
DeepSeek这边,V4的消息已经在市场上发酵。财联社的关联个股里,昆仑万维、每日互动被摆上台面,说明资本已经开始按"应用站上风口"的逻辑定价。V4的具体参数和发布时间还没落地,但市场预期这件事本身,就是一个信号。
国内厂商没走硅谷那条"把推理速度做成产品"的路,也没在超高参数上硬拼。它们选的是另外两个关键变量:开源生态的渗透速度,和中文场景叠加工业场景的落地深度。这两条路不炫技,但离钱更近。

对做产品的人来说,这个变化很实在。模型能力上来了,价格打下来了,中文场景不用再迁就英文语料的别扭,受益最大的反而是国内做智能体落地的团队。像舍予AI智能体,定位就是"老板的第一支AI战队"——老板要的从来不是榜单第一,是能立刻接活、当天上手的那支队伍。底座够强、够便宜、够懂中文,上面那层才有得做。
这一节想说的就一句:别再用"跟跑"看国内这波了。榜单是表象,生态和场景才是底牌。而这两样,恰恰是最难被一次性追平的东西。
别光看参数了,OPC创业者该算的是单位任务成本和迁移代价
算笔账。Inception 的 Mercury 2.5,输入 $0.04/百万 token,速度 1107 tokens/s。这组数字摆在一起,真正的含义不是“便宜”或者“快”,而是同样一个任务,你消耗的token成本和时间成本,可能被砍掉一个数量级。
OPC创业者最容易犯的错,是盯着榜单看排名。CodeArena 谁第一,LMArena 谁登顶,看完心里踏实了,然后继续用着上个月选的那个模型。榜单衡量的是模型能力上限,不是你的业务成本。你真正该问的是三个问题:
- 完成一次任务,花掉多少 token,折多少钱?
- 换一个模型,要改多少代码、多少 prompt、多少评测用例?
- 迁移完之后,用户体验的改善值不值这笔人力?
第一个问题叫单位任务成本。注意是“任务”,不是“token”。一个智能体跑一次客服工单、生成一份周报、完成一次代码补全,中间要经过多少轮推理、多少次工具调用、多少重试,这才是分母。Mercury 2.5 这类模型的价值在于,它把单次推理的边际成本压到极低,如果场景里重试多、调用密,成本曲线会直接换一条。
第二个问题叫迁移代价。这也是为什么我在前几节反复强调选型窗口。模型迭代越快,你的迁移能力就越值钱。一个连 prompt 都硬编码在业务逻辑里的产品,换模型等于重构;一个把模型调用、评测、降级策略都抽出来的产品,换模型只是改个配置。这两种产品的差距,半年后会变成生死差距。
具体怎么算?给个粗糙但能用的框架:
- 先冻结一个真实任务集,20到50条,覆盖你的核心场景,别用公开 benchmark。
- 跑基线,记录每条任务的成功率、平均 token 消耗、端到端延迟。
- 换新模型重跑,只改模型名,不改 prompt,看基线怎么动。
- 算差值:成功率涨了多少?单任务成本降了多少?延迟改善对留存有没有实际影响?
四步跑完,答案基本自己会浮出来。
舍予AI智能体的逻辑就在这里——老板的第一支 AI 战队,不是让老板去研究哪个模型参数更大,而是把“单位任务成本”和“迁移代价”这两笔账算清楚,让模型迭代的红利真正落到业务上,而不是停在技术团队的收藏夹里。
2026 年剩下的这几个月,模型发布只会更密。你拦不住别人跑得更快,但你可以让自己换得更便宜。
能带走的就一句:别问哪个模型最强,问哪个模型被换掉时你最不心疼。