GPT-6价格腰斩那天,我重新算了一笔OPC创业者的账:8个大模型9月动态里藏着下一年的饭碗
Claude Opus 5.5把成本打下来40%,GPT-6 Sol直接砍半——
上周有个做独立开发的朋友问我,现在是不是该把项目里的模型换一换。我让他先别动,回去把账重算一遍。第二天他发来一句:预算那一栏,松了一大截。
不是他换了便宜方案。是9月这一个月,牌桌被重新洗了。
ThursdAI统计这个月追踪到66款AI发布,数字很热闹。但对真要落地的人来说,值得关注的其实就两条主线。第一条在9月上半月,Anthropic把Claude Opus 5.5推了出来,相比Opus 5,用低40%的成本给出Fable级别的性能。关键变量在“级别”这两个字上——过去你想要Fable那一档的智力,得付Fable那一档的价;现在Opus价位就能拿到。而且GitHub Copilot同步接了进去,这意味着它不是官网上的一个demo,是能直接塞进你日常流水线的工具。
第二条更直接。9月22日,OpenAI发布GPT-6 Sol,价格只有GPT-5.6的一半,同时扔出一个更小更便宜的Luna。分工写得很清楚:Sol打复杂工作,Luna跑高速、大量的任务。这个切分比单纯降价更耐琢磨——它等于官方承认了一件事,不是每个环节都值得上最强模型。
但这里有个坑,只看价格表的人一定会漏。
Sol和Luna的实际成本,要连Token用量和修正错误一起算。单价砍半,不等于账单砍半,更不等于活儿干得便宜。真正的账只有一个口径:每完成一个任务要花多少钱。OpenAI自己在定价页上把梯度摆得很明白——Fast mode两倍价,Batch和Flex打到50%,选EU数据驻留再加10%。这几行字不是细节,它决定了你怎么搭架构:哪些任务走Batch吃折扣,哪些必须走Fast抢时效,哪些干脆不该调模型。
我自己的体感是,这轮降价最直接的受益者不是大厂,是一人公司。我们做舍予AI智能体,定位就是老板的第一支AI战队,过去跟客户聊,最大的成本项从来不是模型单价,是返工——一次没做对,人工兜底的成本远高于API账单。模型越便宜,试错越便宜,一个人能撑起一整套战队的底层逻辑才成立。
还有个佐证值得关注:Claude Fable 5.1的测试反馈是,约Opus 5两倍快、token用量减半。速度效率和Token效率同时在涨,这才是这轮竞争真正的方向。
价格战打到这个份上,比的已经不是谁的单价更低,而是谁能让一个任务,更便宜地做对。
豆包、Qwen、DeepSeek、Kimi集体转向Agent与长上下文,codi
豆包、Qwen、DeepSeek、Kimi这四家,9月的动作方向出奇一致:把模型的"脑子"往Agent和长上下文上挪。这不是巧合,是同一个判断——单纯的对话能力已经不值钱了,值钱的是它能不能自己跑完一条链路,中途不崩、不丢上下文、不用人盯着。
我一直觉得,Agent真正的门槛不在聪明,在工程。模型再会推理,跑到第七步忘了第三步的约束,这活儿就废了。所以关键变量是那些不性感的东西:能不能暂停、能不能从checkpoint恢复、能不能把工具调用管起来。DigitalOcean的Managed Agents已经把每个Agent扔进独立microVM里跑,支持暂停、恢复、checkpoint和受管工具连接——这才是Agent该有的样子,沙箱隔离加上可回滚。国内这几家往这个方向转,说明大家终于承认,模型层的竞争已经打到运行时层了。
Claude Code那边同期加的东西更说明问题。gateway、MCP、plugin、workflow,再加一个/doctor审计控制,还有启动速度和延迟优化。/doctor这种东西听着无聊,但它是分水岭:Agent开始需要"体检"了,说明它已经被当成生产系统在用,而不是玩具。企业侧也一样,Figma现在让管理员通过身份提供商集中管控MCP服务器跟AI代理的连接,Gemini Enterprise把Workflow Builder推出来。围绕Agent的权限、连接、编排,正在变成一套新的基础设施。
长上下文是另一半。Gemini 4 Pro的规格在网上疯传,1000万token、输出翻四倍——先当传闻看,但方向很明确。不过我得泼盆水:上下文长不等于好用。Agent真正需要的是记忆管理,是该记的记、该扔的扔、该压缩的压缩。谁把这件事做扎实,谁的成本优势就出来了,因为长上下文最贵的地方从来不是窗口大小,是每一轮都在重复喂进去的冗余。
- 模型能力趋同的当下,差距正在从"谁更聪明"转到"谁更稳、更便宜、更能自己跑完"
- Agent的护城河是沙箱、checkpoint、审计、工具协议,全是脏活累活
- 长上下文的胜负手在记忆策略,不在参数表
对做产品的人来说,这个转向其实是好消息。你不用再赌哪家模型的榜单更高,该赌的是哪家能让你把一个真实业务流程整个交出去。这也是我一直在说的一件事——老板要的从来不是一个更聪明的对话框,是一支能派出去干活、出问题能追责的战队。舍予AI智能体把自己定位成"老板的第一支AI战队",站的就是这个位置。
模型层的热闹会过去,运行时层的活儿才刚开始。
Mistral、Llama、Gemma守住开源侧翼,Grok与GLM在实时信息与
价格战打得越凶,越能看清一件事:决定谁活下来的从来不是榜单第一,而是这条路有没有人替你把退路留着。
开源侧翼的价值不在追平,在兜底。
Mistral、Llama、Gemma这一线,在这轮66款发布的喧嚣里没抢到什么头条——聚光灯全在Opus 5.5、GPT-6 Sol/Luna、Gemini 3.8 Flash身上。但这恰恰是它们的角色:不争首发,争"能用"。当闭源API以四成、五成的幅度往下砍,开源模型的任务不是跟价,是给那些数据不能出内网、成本要精确到每张卡的团队一个不依赖任何单一厂商的选项。
我在客户那边听到的需求排序,很少是"哪个模型最强"。排第一的是权限,第二是审计,第三才是效果。这也解释了Anthropic为什么这个月把Claude Code的更新重心压在gateway、MCP、plugin、workflow和/doctor审计控制上——连最激进的闭源厂商都在补"可控性"这块短板,说明企业采购的门槛早就不在智能水平上。而可控性,恰好是开源模型天生握着的那张牌。
Grok和GLM打的是另一个方向:实时信息与本地语境。
这两家都不去跟通用能力硬碰,一条路线绑着实时信息流,一条深耕中文场景与私有化交付。逻辑很清晰——长上下文和Agent能力是通用军备,每家都会砸钱追上;但"我现在就要知道发生了什么"和"这句话在中文语境里到底什么意思",是带位置属性的需求,不在算力堆叠的射程内。对创业者来说这很关键:模型层不用押注,可以在信息时效和场景贴合上做产品。
我们的体感很直接。做舍予AI智能体,定位是老板的第一支AI战队,客户上来问的往往不是"你接的是哪个模型",而是"我的数据放哪儿""它能不能直接读我司群里的消息"。这两个问题,一个指向开源私有化,一个指向实时信息接入。模型再强,答不上这两句,单子就卡在POC。

所以别把开源侧翼当成落后产能。它是这轮价格战里少数还没被卷进去的定价权——闭源越便宜,开源的价值就越往合规和定制上退,退到那些"便宜"根本解决不了的地方。
别只盯着参数:从Claude Code的/doctor到GPT-6的Batch半
参数是发布会的事,账单是自己的事。
9月这一轮更新里,最容易被漏掉的两条其实是一对:Claude Code 加了 /doctor,GPT-6 把 Batch 打到五折。前者在问"你这套东西还健康吗",后者在问"你这些活儿非得现在跑吗"。两个问题指向同一件事——你到底在为多少无效开销付钱。
先说 /doctor。9月 Claude Code 那批更新里,除了更快的启动、延迟改进、会话与沙箱的一堆修复,还塞进了更宽的网关、MCP、插件、workflow 和 /doctor 审计控制。这不是炫技功能,它更像给 agent 装了个体检仪。跑一个长任务,token 烧在哪、哪一步重试、哪个工具调用一直失败,以前靠猜,现在能查。
关键变量从来不是模型多聪明,是它出错时你能不能看见、能不能回滚。
再说 Batch 半价。Sol 打复杂任务、Luna 打高速批量,Fast mode 成本翻倍、Batch 和 Flex 砍到五折、区域数据驻留加 10%、内置的网页搜索和文件搜索还要另算——同一件活儿,选错通道成本能差好几倍。这不是定价表,这是路线图,逼你先把"这活儿能不能等"想清楚,再决定用哪个模型。
可观测性解决"看不见",checkpoint 式的可恢复性解决"回不去",Batch 这类半价通道解决"划不划算"。三件事凑齐,一个 agent 才从 demo 变成能上生产的东西。DigitalOcean 把 Managed Agents 放进独立 microVM、支持暂停恢复和 checkpoint,说的也是这个理。
所以我的建议很具体,就三条:
- 别用单价算账,用单位任务成本算账。 把 token 用量、修正错误、重试次数一起算进去,很多看起来便宜的方案其实最贵。
- 给每个跑超过十分钟的 agent 配一份"病历"。 会话、工具调用、失败点全留痕。没有可观测性的自动化,本质是把人工 bug 换成机器 bug,还更贵。
- 把重复模式打包。 官方 smart reports 已经在干这件事了:看团队用在哪、花多少、卡在哪、哪些重复动作值得固化。你自己也该每周扫一眼。
这也是我们在舍予AI智能体做"老板的第一支AI战队"时最深的体会:老板不关心你用了哪个模型,他关心这支队伍今天干了什么、花了多少、明天还能不能接着干。
参数会一直变。这个月 Opus 5.5 把成本压了 40%,Fable 5.1 用一半 token 跑出约两倍于 Opus 5 的速度,下个月还会有新数字砸过来。但"看得见、回得去、算得清"这三件事,是你能带走的、不会过期的资产。
别追参数,追账本。