800亿参数只叫醒3B——一年后回头算,这笔账坏在"轮次"上

2026-09-22舍予基业来源:公众号「舍予AI智能体」
800亿参数只叫醒3B——一年后回头算,这笔账坏在"轮次"上
从Qwen3-Next高稀疏MoE与Gemini、百炼agent多轮检索收费切入,算清AI应用成本已从单价转向轮次,给出一人公司控制检索轮次、分离通用与专用能力的实操建议。

9月22日,两条消息摆在一块看,越看越觉得得给做一人公司的人提个醒。

一条往回看。2025年9月12日,阿里发了 Qwen3-Next:总参数量800亿,每次推理只激活30亿。高稀疏度 MoE,性能对标自家2350亿参数的旗舰,训练成本比同代密集模型(Qwen3-32B)下降超过90%;32K以上长上下文场景,速度是后者的10倍以上。同步开源的 Qwen3-Next-80B-A3B 系列,支持百万 tokens 上下文。

一条往外看,是正在发生的事。Gemini 的开发者文档里,"工具和代理模型"已经单独成类:computer use 那个模型能"看见"屏幕、点、输入、浏览;Deep Research 自己规划多步研究,从数百个来源取信息,产出注明出处的互动报告;上面还架了个 Deep Research Max。阿里云百炼这边,联网搜索多出一档叫 agent 策略——可以多次调用搜索工具和大模型,做多轮检索再整合,代价是每次调用额外收费。

一边把单位成本往下砸,一边把调用次数往上抬。

这两件事叠在一起,就是今年做 OPC 的人最该重算的那笔账。

那次下注:800亿的模型,只叫醒3B

先说 Qwen3-Next 到底干了什么。

它没去卷"我比你大",反着来:总参数堆到800亿,每次推理只激活30亿。相当于家里养了一支80B的队伍,真干活的只有3B。省下来的不是一点点——训练成本比 Qwen3-32B 这种密集模型降了九成以上,长上下文推理速度拉到十倍。Qwen3-Next-80B-A3B 系列同步开源,百万 tokens 上下文直接摊在台面上。

2025年那个时间点,这是逆着榜单走的。所有人都在比参数、比跑分,它比的是"每次叫醒多少人"。

一年后回看,这条路线算站住了。你看现在还在各地平台服役的名字——Qwen3.8-Max、Qwen3.8-27B、GLM-5.2、DeepSeek-V4-Pro、Kimi-K3、MiniMax-M3——稀疏化、小激活、多版本并行,早就是默认动作,不再是新闻。

给OPC的启发在这里:算力预算的第一性问题,已经从"我能用多大的模型"变成了"我每一次要用多少参数"。

这两句话听起来差不多,落到账单上完全不是一回事。前者决定你要不要融资,后者决定你能不能一个人开工。一个三人小团队过去养不起的活,现在一台机器加一条靠谱的工作流,是有机会跑起来的。这就是机遇本身。

另一边:能力开始按"轮次"和"深度"卖

再看今年9月正在铺开的那条线。

Gemini 文档里那几个代理模型,日期就标在模型ID里:gemini-2.5-computer-use-preview-10-2025deep-research-preview-04-2026。能力描述很直白——自主规划、执行多步骤研究、从数百个来源取信息、生成带出处的报告。它卖的不是"一次回答",是一条研究路径。

阿里云百炼的联网搜索文档讲得更露骨。agent 策略的本质是"多次调用联网搜索工具与大模型,实现多轮信息检索与内容整合",适用于 Qwen3-Max 系列和 Qwen3.5/3.6/3.7 系列;启用之后只支持返回搜索来源(enable_source: true),其他联网搜索功能一律不可用;每次调用额外收费

还有个细节值得关注:qwen3.8-max、qwen3.8-flash 这批在 Chat Completions/DashScope 协议下反而不支持 searchstrategy: agent,要走 Responses API 的 websearch 工具才能做出 agent 式多轮检索。MiniMax-M2.1、Moonshot-Kimi-K2-Instruct 和角色扮演类模型,直接被排除在 agent 策略之外。

翻译成人话:同一个模型,走哪条路、跑几轮、开不开检索,价格是分开算的。

那对OPC意味着什么?如果你的产品卖的是调研、尽调、选品分析、行业周报这类交付,从今天起成本公式得改。不再是"单价 × token",而是"单价 × 轮次 × 失败重试"。单价降下来的那部分,很可能被轮次加倍收回去。

配图

机遇也在这里:谁的活能少跑两轮就收敛,谁的毛利就厚。这是产品设计问题,不是模型选型问题。

我们当初算错的地方

说点自己的。

舍予AI智能体给老板搭"第一支AI战队"的时候,我们踩过一个很典型的坑:按岗位挑"最强模型"。写作岗上最贵的,调研岗上参数最大的,代码岗上榜单第一的。配置表看起来很漂亮。

跑起来是另一回事。

最贵那个模型在简单活上纯属浪费;调研岗的活因为要反复检索,账单根本不是按"每篇多少钱"来的,而是按"这篇稿子它自己搜了多少轮"来的。有一类任务,单价一样,跑二十轮才收敛的,账单是跑一轮的二十倍。

后来我们内部定了一条纪律,到现在没改:模型是可替换的零件,不是资产。 每个岗位后面挂的是一行配置——用哪个模型、上下文多长、开不开检索、轮次上限多少。换模型就是改一行,别的都不动。真正沉淀下来的是那行配置背后的东西:字段表、判断规则、什么情况该停。

给读者的启发: 别把精力花在"押注哪个模型赢"上。榜单上没人能替你押中——同一份模型使用排名里,有模型标着 +38%,也有模型标着 -33%,涨的和跌的可能就差一个版本号。你要押的是自己那条路径。

换作是你,能抄走的五件事

  • 选型先看激活量和上下文单价,别只看总参数。 一个800亿只激活30亿的模型,很多时候比一个"小而全"的更好用、更便宜。
  • 给每一次 agent 式检索设硬上限。 轮次、来源数、超时、失败次数,四个都要设。没有上限的多轮检索,等于把钱包交给模型。
  • 把"通"和"专"分开。 通用的那部分,用最便宜够用的;专的那部分——你的行业字段、你的判断标准、你的历史数据——自己攒,别外包给模型。
  • 先算"单价 × 轮次 × 重试",再决定要不要开那个功能。 贵不贵从来不是单价问题,是你要跑几轮的问题
AI应用成本控制一人公司Agent

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。