GPT-6.1 Sol涨价六倍那天,我连夜把OPC的推理账单重算了一遍
GPT-6全量上线免费开放,但真正的成本炸弹藏在Sol极速版的价目表里
10月8日,OpenAI把GPT-6全量推给了所有ChatGPT用户,免费和付费一视同仁,GPT-5.6 SOL和LUNA直接下线。朋友圈一片叫好,但我看完当天开发者日的完整材料,第一反应是打开账本——因为同一天上线的GPT-6.1 Sol极速版,价目表写得很清楚:每百万token输入12美元、输出60美元。
吐字速度狂飙8倍,价钱也跟着翻6倍。API、Codex、ChatGPT Work三处同步推送,Ultrafast推理模式不是演示,是直接可调用的生产能力。
免费开放的是入口,收费的是产能。这两件事被放在同一个新闻周期里,很容易被误读成“AI又便宜了”。
真正的关键变量在输出侧。60美元/百万token是什么概念?我们OPC内部跑一轮中等复杂度的代码重构任务,上下文加推理链,输出token轻松到两三万。单次任务的输出成本,从原来几毛钱量级跳到一美元以上。单看不吓人,乘上每天的调用量、乘上十几个并行agent,一个月就是另一张脸。
更值得关注的是它的定价结构:输入12、输出60,五倍价差。这说明OpenAI非常清楚Ultrafast的算力花在哪——不是读你的代码,是吐它的推理。所有靠“让模型多想一会儿”换质量的产品线,成本曲线会最先变形。
同一天还有一条容易被忽略的消息:旗舰GPT-6 Astra极速版,价格是Sol极速版的5倍。这个价差不是随便定的,它把市场切成了两半——一边是愿意为极限智力付溢价的窄众场景,一边是绝大多数需要高频、稳定、可预测成本的生产场景。绝大部分创业者,其实活在后面这一半里。
所以我不觉得这是坏消息。GPT-6全量免费,意味着你的用户教育成本、试用门槛、demo转化率全都在改善;Sol极速版把价格标出来,意味着你终于能拿到一个稳定的成本基线去做产品设计,而不是赌一个随时可能变的补贴价。
真正会出事的,是那些从来没算过token账、把“模型越强我越强”当战略的团队。价格表已经贴出来了,接下来几周,他们的毛利率会替他们做决定。
至于我们自己——当晚就把OPC三条主力产品线的推理账单重跑了一遍,结论留到后面几节说。这里先给一个判断:这一轮不是涨价,是分层。分层之后,谁的成本结构清晰,谁就有资格谈增长。
输入12美元输出60美元,OPC创业者的哪几条产品线会先被推理成本压垮
先把账摊开。GPT-6.1 Sol极速版,输入每百万token 12美元,输出60美元。同一批token,厂商在输出端收你5倍的钱。
这个结构本身就说明了一件事:读进去便宜,吐出来贵。你让它检索、分类、判断,成本可控;你让它一轮一轮地写、改、再想,那就是在往账单上倒钱。API、Codex、ChatGPT Work 三处同步推这个价,意味着没有哪个入口能绕开。
OPC创业者最难受的地方在这儿——一人公司,没有大厂那种把推理成本摊到十几条业务线上的余地。
账单是你一个人的,产品线也是你一个人的。所以真正的问题不是"贵不贵",而是"哪条线先死"。按输出依赖度排,最先被压垮的是三类:
- 输出驱动的批量内容线。 文章、商品描述、脚本、素材改写,本质就是拿输出token换成品。过去单价低,跑量还能兜住;现在输出端翻了六倍,销量没涨,成本先到了。
- 长链Agent与自主编码工作流。 成本结构最难看的一类:不是一次问答,而是"想—调工具—看结果—再想—再改"的循环。每一轮都在吐token,每一轮还可能推翻重来。Codex、Cloud Code把开发效率拉得很高,但一旦跑成无人值守的长循环,烧的就是输出。
- 长会话产品。 客服、陪伴、咨询,用户天生想多聊两句。会话越长输出越多,而用户付费基本是月费制。成本和收入,方向是反的。
反过来,输入重、输出轻的线,日子会好过得多。RAG问答、检索、打分、路由判断,吃的是输入,吐出来几十个token就够了。这类活就该留在便宜档。
关键变量不是"用不用最强模型",是路由。
Gemini从10月9日起把免费档收紧到Flash-Lite,Claude Opus 5.5把运行成本降了40%——信号很清楚,市场正在把"够用"和"最强"切成两档来卖。创业者要做的是把每一步任务精准丢进对应的档位:该上Sol极速版的地方别省,不该上的地方一分别花。
真正压垮人的从来不是单价,是没被验证的自主循环。一个人扛全部推理账单,最怕的不是贵,是根本不知道钱烧在了哪一轮。
所以省下来的那笔预算换成什么,比省本身更值得算。这笔账我往后放一放再说。
旗舰Astra极速版是Sol的5倍价,为什么说这反而是一道窄门里的机会
先把价目表摊在桌上。
Sol极速版每百万token输入12美元、输出60美元,已经让不少OPC的毛利表开始变形。而旗舰Astra极速版的价格,是它的5倍。
大部分人看到这个数字的第一反应是"跟我没关系"。这反应一半对,一半是浪费。
对的地方在于:如果你的产品就是长文档摘要、客服话术润色、批量标签清洗这类活儿,你确实用不上Astra极速版,硬上就是烧钱。错的地方在于——5倍价本身就是一道筛子,它把愿意为单次判断付高溢价的场景,从大盘里筛了出来。
能被筛出来的场景,长什么样?
- 一次调用决定一笔生意的走向:合同条款的实时比对、投研结论的秒级反驳、生产环境故障的根因定位;
- 用户对延迟的容忍度以秒计,不是以分钟计。Ultrafast推理模式把吐字速度拉到8倍,这件事的价值不在"快",而在于它把过去只能离线批处理的链路,变成了可以塞进交互里的链路;
- 出错的成本远高于token的成本。这种场景里每百万token贵不贵根本不是问题,一次判断错了才要命。
这才是"窄门"的真正含义:不是所有人都进得来,所以进来的人少。

值得关注的是,奥特曼在DevDay上把Ultrafast推理模式单独拎出来讲,说明OpenAI很清楚这一档卖的不是性价比。同一周,Anthropic给Claude Opus 5.5降了40%的运行成本,Google干脆把Flash-Lite往免费层里塞——便宜那一档在拼命卷单位成本,贵的那一档在卷能力上限。中间那批既不够便宜、又不够强的模型,才是最难受的。
对创业者来说,关键变量只有一个:你的产品能不能站到"贵的那一档"里去。
站得进去,5倍价是你的护城河;站不进去,5倍价就是别人的护城河。OPC最常见的两种死法,是拿便宜模型做高端场景,和拿贵模型做低价值量——两头都占不到。
还有个容易被忽略的点:Astra极速版贵,但它贵得"标准"。旗舰级的脑子加极速通道,意味着你可以把检索、规划、执行、自检一整条agent链路全挂在同一档模型上,不用为了省钱在中间插几个小模型做路由分流。而路由本身就是要花钱的——工程成本、调试成本,还有模型之间语义漂移带来的隐性损耗。窄门里的机会,往往就藏在这种"贵得省心"上。
当然,进得来不等于走得远。5倍价意味着你的组织得配得上这个单价:能不能在下一个模型发布之前就把它接进生产,能不能让一支随叫随到的队伍盯着每一次推理的性价比。这也是我们后来开始用舍予AI智能体那套思路的原因——它的定位很直白,「老板的第一支AI战队」。把那笔本来要原封不动交给推理账单的钱,换成一支持续在线、按需调度的队伍。这个账具体怎么算,下一节细说。
重算之后:把省下的推理预算换成一支随叫随到的AI战队,账才真正算得过来
把Sol的价目表贴在墙上那天,我做的第一件事不是砍需求,是给推理预算分档。
输入12美元、输出60美元,8倍速值不值?值——但只值在刀刃上。客户直接看到的那次生成、决定产品走向的关键判断、交付前最后一道审查,交给Sol甚至Astra极速版,贵得有理。日常的批量重构、文档搬运、测试补全、日志归因,扔给Claude Opus 5.5、Gemini Flash这条线:Opus 5.5成本已经降了40%,Flash-Lite又能兜住免费层的量,国内豆包、智谱、minimax、千问、deepseek挑一个跑得顺的当第二梯队,账立刻好看。
省下来的钱别让它躺在账上。
真正改变产出曲线的,不是一个更强的模型,是一支能并行接活的队伍。舍予AI智能体把自己定义成“老板的第一支AI战队”,这个说法放在今天特别贴——模型是兵,路由是调度,工作流才是战场。把Codex接进代码仓库,把Claude for Google Workspace的侧边栏塞进Docs、Sheets、Slides,再让Gemini代理去跑检索和外呼,你手上就不是一个对话框,而是一条流水线。人只审关键节点,其余交给战队。
- 能被规则说清的任务,别用旗舰极速模型;
- 需要判断、取舍、面向客户的输出,才配Sol;
- 长链路任务拆成agent流程,失败重试比人工重来便宜得多。
关键变量在于模型迭代的速度。10月才过十天,GPT-6全量免费铺开,Gemini免费层收紧到只剩Flash-Lite,Claude把Opus 5.5做得更便宜更快。今天的最优解,三个月后大概率重排座次。所以别把架构焊死在单一模型上,抽一层路由出来,谁便宜、谁快、谁稳谁顶上,定价表变了你只改配置,不改产品。
行动建议就三条:拉出过去30天的token账单,按任务类型打标;把“非必要不用旗舰极速”写进团队规则;把省下的额度拨给agent工具和战队席位,按交付结果考核,而不是按调用量考核。
定价权在模型厂商手里,成本结构在你自己手里。把省下的推理预算换成一支随叫随到的AI战队,这笔账才算真正算得过来。