GPT-6拆成Sol和Luna两条线,OPC创业者别再一口价包圆,按任务复杂度分流选型这笔账怎么算
先别急着把Sol当默认档:一次把GPT-6双线定价的账本摊开
9月22日,OpenAI把GPT-6拆成了两条线:Sol输入$2、输出$10每百万Token,Luna输入$0.10、输出更低——输入价差20倍。这不是版本迭代,是OpenAI第一次公开承认:一个模型通吃所有任务的账,算不下去了。
先把时间线摆清楚。9月3日GPT-6 Astra刚炸完场,Brockman在台上喊"Welcome to the AGI era",ARC-AGI-3从上代7.8%干到99.9%。所有人以为GPT-6就是Astra。结果19天后,OpenAI又补了一刀,把产品线劈成Sol和Luna。同一天Anthropic发布Claude Opus 5.5硬碰,阶跃星辰的Step5 Preview号称单任务成本只有Opus5的1/8,Gemini 3.8 Flash也在月初压着节奏走。整个9月,没有一家在拼谁更聪明,全在拼谁的账本更精细。
很多人第一反应是:Sol是旗舰,贵有贵的道理,默认上Sol准没错。
这个直觉在GPT-5.6时代还算合理,现在就有点危险了。看价格结构:Sol输出$10,Luna输出档位低到"高频任务"这个官方定位里去——按输入价差倒推,输出价差大概率也在同一数量级。你一个客服问答、一次文档摘要、一轮格式转换,跑在Sol上,等于开越野车送外卖。贵的不是那点Token钱,是你根本没意识到自己在为不需要的推理深度付溢价。
更关键的是另一面。Vercel刚公布的8月指数:开源权重模型首次占到平台56%的token用量,却只吃掉14%的花费;平台平均token单价环比又降23.2%,已经是连续第三个月下滑,五个月腰斩过半。单价在崩,任务复杂度却没崩。这意味着"选对档位"带来的成本差,正在变成创业公司生死线上的那个变量——不是省一点,是省几倍。
所以GPT-6双线的真正含义,不是OpenAI多卖了一个便宜模型,而是它把"任务分流"这件事从你的优化技巧,变成了它的产品结构。以前你可以偷懒,用同一个模型跑所有活,无非账面难看点。现在它把两个价格档明晃晃摆出来,等于逼你回答一个问题:你手里每一条请求,到底配不配Sol?
答不出来,你就是在用Sol的单价,买Luna能交付的结果。
舍予AI智能体那边给老板们搭"第一支AI战队",思路其实对得上——战队不是全用特种兵,是侦察、火力、后勤各就各位。模型选型也一样,先别急着把Sol设成默认档,先把账本摊开,看清楚每一笔钱花在哪条线上。
下一节要算的,就是那条分流线该画在哪里:哪些任务配得上Sol,哪些交给Luna就够。画错一格,烧的是真金白银。
哪些任务配得上Sol,哪些交给Luna就够,一条分流线画错就是白烧钱
账本摊开了:Sol 输入 $2、输出 $10 每百万 Token,Luna 输入 $0.10。二十倍价差摆在那,真正难的不是贵不贵,是你怎么判断手上这个活该扔给谁。
分流线不该按"重要程度"画,该按"错了谁来收拾"画。
这是我看过最实用的一条判据。
Sol 的地盘很明确,它从设计之初就是冲着复杂编码与 Agent 工作流去的。多步、长链、中间任何一步偏了后面全废的活,归它。Claude Opus 5.5 那套"长周期任务"能力——推进复杂软件工程时持续自我检查与纠偏,覆盖从需求理解到测试验证的完整生命周期——描述的是同一类需求:过程本身不可信,得靠模型自己盯着自己。这类任务的共同点不是"贵",是错误不可见。一个 Agent 跑了四十步,错了三步,交出来的东西看着还挺像样。等你发现,返工成本早就把那点 Token 钱甩开几条街。
Luna 的地盘同样清楚:高频、短、可枚举。意图分类、字段抽取、格式转换、客服一级问答、判断用户那句话该路由到哪个技能上——这些活的正确答案就摆在眼前,错了当场露馅。0.1 美元一百万个输入 Token,配上高频响应,这才是它被造出来的理由。让它干这些,是你的福气;让它去啃长链推理,是你的灾难。
画错线,两个方向都亏,亏法还不一样。
往上一格,是显性浪费。把意图分类喂给 Sol,账面上每天都在流血,但这种浪费至少你自己看得见。
往下一格,是隐性失血,更要命。把需要多步验证的活压给 Luna,你不会立刻收到报错,你会收到一堆看起来像答案的答案。然后工程师花半天人工复核,把错的挑出来重做。人的单价是这条账里最贵的那个数字,比 Sol 加 Luna 还贵。
所以判据收敛成一句话:这个任务的输出,能不能在无人值守的情况下被自动判定对错?
能,交给 Luna,大胆交。不能,或者验证成本本身就高过重做,上 Sol,别犹豫。
这条线成立还有个前提——你得分得清。Vercel 八月的指数里,开源权重模型吃掉了平台 56% 的 token 用量,却只占总花费的 14%,平台平均 token 单价连续三个月下滑,五个月降幅过半。市场在用脚投票,便宜档的可用性正在快速逼近。定价这件事本身在贬值,判断力在升值。
这也是我们给老板搭"第一支 AI 战队"时的基本动作:不是配一个最强模型,是排班。谁跑一线高频,谁啃硬骨头,谁只负责把请求路由到对的人手上。叫战队不玄——你招人也不会让 CTO 去回客服工单。
- 规则判得了的,用规则,别上模型
- 规则判不了的,拿 Luna 兜一层路由
- 需要多步验证、且验证成本高的,直接进 Sol 队列
最后提一句容易被忽略的:路由本身也有成本。别为了省那点差价,在前面堆一层复杂调度逻辑,最后复杂度把全部收益吃干净。补丁的寿命都能从 70 天缩到一天,你那套手写路由规则,凭什么觉得自己能活三个月。
拿三个真实活儿跑一遍:客服问答、代码Agent、长链推理的成本差能拉到多少
三个活儿摆一块儿看,账其实没那么玄。
客服问答这类活儿,输入短、输出更短,并发高,错一次的代价可控。订单在哪、能不能退、尺码怎么挑,翻来覆去就这些。GPT-6 Luna 输入 $0.10/百万 token,Sol 是 $2/百万,光输入侧就差 20 倍;材料里 Luna 的定价甚至低于上一代 GPT-5.6,定位就是高频响应。这种场景上 Sol,等于给送外卖的配了台重卡——不是重卡不好,是它跑的路根本用不上那个扭矩。
我见过太多团队给「老板的第一支 AI 战队」配了顶配引擎,天天干的却是查订单、改地址、写挽留话术。这不是技术选择,是预算漏水管。
代码 Agent 完全是另一回事。它不是一问一答,是几十轮工具调用:读文件、改文件、跑测试、看报错、再改。上下文越滚越长,每一轮都得把历史重新喂进去。GPT-6 Sol 的定位就是复杂编码与 Agent 工作流,$2 输入 / $10 输出。Claude Opus 5.5 那边也在强调「长周期任务」里的自我检查与纠偏,从需求理解一路覆盖到测试验证。这种活儿省不了——省下来的 token 钱,会在返工、review、重跑 CI 里加倍还回去。
说得更直白点:代码 Agent 上换便宜档,你省的是成本,赔的是补丁的寿命。而补丁的寿命,已经从 70 天缩到一天了。
长链推理最容易算错。它的特点不是输入长,是输出长——中间步骤、验证、回溯,全是 token。Sol 输出 $10/百万,输出一旦成为大头,账立刻上去。可反过来,你拿 Luna 硬跑一个本来就要深推理的活儿,第一次没跑对,重试三次,再叠人工兜底,总成本大概率超过一开始就上 Sol。

关键变量不在模型,在链路长度。
不过这里有个可以拆的地方:很多所谓「长链推理」,拆开看只是「一串短判断」。意图识别、字段抽取、规则匹配,每一段都不需要顶级模型。真正非 Sol 不可的,是中间那两三个必须做全局权衡的节点。路由做细一点,整条链的成本能砍掉一大半。Vercel 八月的指数已经很说明问题:开源权重模型吃掉了平台 56% 的 token 用量,却只占总花费的 14%。这中间四十多个点的差距,就是路由的价值。
所以这三个活儿的成本差能拉到多少?客服问答,20 倍起步;代码 Agent,差的是倍数,更是一个数量级的返工风险;长链推理,不拆是几十倍,拆完能回到个位数。
材料里那些数字也在印证同一件事:阶跃 Step5 Preview 把单任务成本压到 Claude Opus5 的 1/8,Anthropic 拿 Opus 5.5 把「更低成本处理企业任务」当成卖点。厂商在拼命给你分档,你却在按一口价包圆——这笔账,亏的永远是自己。
选型不是选模型,是选任务路由:OPC创业者该先建哪张分流表
聊到这儿,定价账本、分界线、三个真实活儿都摆完了。剩下最后一件,也是最容易偷懒的一件事——把判断变成流程。
很多团队不是不懂分流,是分流停留在脑子里。谁接需求、谁拍板用哪个模型,全靠当天状态。OPC创业者没这个余量,你的带宽就是公司的带宽。
分流表别从模型名开始,从任务特征开始。三栏就够:任务类型、复杂度锚点、降级开关。
任务类型是你们业务里真实重复发生的事——客服首响、代码补全、PR审查、长链规划、文档摘要。别写“简单/复杂”这种形容词,写可验证的锚点:这一步要不要跨三个以上文件做推理?要不要多轮自我纠错?输出能不能被规则校验?三个问题里有俩是“要”,就是Sol的活。
降级开关才是省钱阀门。Luna先跑,置信度低于阈值自动升Sol。这叫级联,不是二选一。Vercel八月的指数里,开源权重模型已经吃掉平台56%的token用量、却只占14%的花费——行业早就在做这事,只不过大多数人做得粗,一刀切,没切到任务粒度。
还有件事值得关注。9月18日Claude Code开始读AGENTS.md,路由规则正在从人脑迁移到配置文件。你的分流表如果还躺在某个人的备忘录里,迟早失真。写成文件,跟代码放一起,谁改了都能diff。
我自己每周看一次路由日志。不看花了多少钱,看有多少任务被错误降级——该上Sol的喂了Luna,返工成本比token贵十倍。
最贵的是你养了一个只会用Sol的团队。
舍予AI智能体那句话说得准:老板的第一支AI战队。战队不是全明星堆一起,是有人攻坚有人火力覆盖。Sol是攻坚组,Luna是覆盖面,路由表是你的排兵布阵。阵型错了,再强的兵也是烧钱。
所以行动的起点很小。今天列出你们Top 5任务,各写一句复杂度判定标准,先跑一周日志。别等完美方案。
路由表是迭代出来的,不是设计出来的。