GPT-6 Sol登陆Bedrock那天,一个OPC创业者把选型表撕了

舍予基业来源:公众号「舍予AI智能体」
GPT-6 Sol登陆Bedrock那天,一个OPC创业者把选型表撕了
GPT-6 Sol等新模型密集上架Bedrock,模型选型从追最强转向按成本延迟匹配任务。讲清一人公司如何用编排替代选型表,把模型当耗材而非资产。

凌晨三点的模型清单,突然多了一行

凌晨三点,我刷新了一下AWS的博客页面,Bedrock的模型列表里多了两行:GPT-6 Sol,还有Luna。

我盯着那两行看了大概十秒,第一反应不是兴奋,是烦躁——因为我知道,我那张维护了两年的选型表,从这一刻起基本报废了。

那张表是我的老习惯。每一列一个模型,每一行一个维度:推理能力、首token延迟、上下文长度、每百万token的输入输出价格、国内可用性、有没有靠谱的API中转。2024年的时候,这张表还能撑三个月不更新;到了2025年,一个月一改;今年九月,我一个星期改了四遍。

就说说刚刚过去的这一周,密集到什么程度:

  • 9月1日,Anthropic发了Claude Fable 5.1和Mythos 5.1,说是"世界上最先进的编码和知识工作模型";
  • 9月28日,Claude Sonnet 5.5上线,比Sonnet 5快30%以上,多数任务成本低最多30%;
  • 同一天,AWS宣布GPT-6 Sol和Luna登陆Bedrock,一起上的还有Claude Opus 5.5和Strands框架;
  • 9月29日,OpenAI开了DevDay 2026;
  • 然后谷歌那边动手调额度,10月9日起,Gemini免费版只剩Flash-Lite,Plus也只能用Flash和Flash-Lite,Pro得Pro和Ultra用户才有。明眼人都看得出来,这是在给下一代模型腾位置。

一周之内,你前一天刚调好的prompt、刚压平的token成本、刚跟客户承诺的响应速度,全部要重算。

我说烦躁,倒不是嫌模型太多。正好相反。真正的变化在于——Bedrock那份周报自己写了一句大实话:"有趣的问题不再只是'它有多智能?'而是'在当前这一步,哪个模型能在这种成本、这种延迟下最匹配需求?'"

这句话放在2023年,是没人敢说的。那会儿我们选模型,选的是"最强"。谁跑分高用谁,谁先发布谁上,贵就贵点,反正能用最强模型的团队本身就在秀肌肉。

现在呢?Sol在创意写作上可能更对味,Luna便宜得可以拿去做批处理;Opus 5.5啃复杂代码库稳,Sonnet 5.5拿来跑日常任务性价比更高;国内那几个——豆包、千问、DeepSeek、智谱、MiniMax——在中文语境和成本上各自占着一块地盘,谁也不服谁。

最强模型已经不存在了,存在的是一排货架。

我们做舍予AI智能体,给老板攒"第一支AI战队",说白了每天都在这个货架上挑挑拣拣。以前我挑的是"最好的那个",现在我挑的是"这一单活最合适的那个组合"。这中间隔着的,是一整套完全不同的思维方式。

我把表格关掉,新建了一个空白文档。

旧的选型逻辑,确实该撕了。

当“最强模型”变成货架商品,选型的逻辑变了

凌晨那份清单上多出来的那一行,不是孤例。

把时间轴摊开看:9月1日,Anthropic 放出 Claude Fable 5.1 和 Mythos 5.1,官方说法是"最先进的编码和知识工作模型";9月28日,Claude Sonnet 5.5 上线,比 Sonnet 5 快了三成以上,多数场景成本还低了最多三成;同一天,AWS 的周综述里,Amazon Bedrock 上架了来自 OpenAI 的 GPT-6 Sol 和 Luna,外加 Claude Opus 5.5。9月29日,OpenAI 的 DevDay 又刷了一轮屏。再往前几天,OpenAI Dot 登场。

一周之内,货架上换了两排货。

这就是这一节真正想说的变化:"最强模型"这个说法,正在失去它作为选型依据的意义。 因为最强不再是稀缺品,而是货架商品——今天你是最强,两周后 Sonnet 5.5 用更快的速度和更低的账单把你的场景切走一半,再下个月 Gemini 4 系列又在门外敲门。Gemini 那边已经在10月9日调整免费额度,把 Pro 和 Flash 从免费版收走,只留 Flash-Lite——这个动作本身就说明,下一轮模型的排兵布阵已经开始了。

AWS 那篇综述里有句话,我认为是这段时间最值得圈出来的一句:

"有趣的问题不再只是'它有多智能?'而是'在当前这一步,哪个模型能在这种成本、这种延迟下最匹配需求?'"

注意那个词,"当前这一步"。不是一个模型统治全流程,是每一步都有各自的解。模型已经变成了坐标系里的点:横轴成本,纵轴延迟,颜色是任务类型。你要做的不是找那个最高的点,是找那条穿过你工作流的线。

做OPC的人最容易在这里栽跟头:把选型当成一次性的技术决策,而不是一个持续运行的调度问题。

我自己做舍予AI智能体,定位是老板的第一支 AI 战队。这个词不是修辞。战队的意思是,你不会因为某个球员是MVP就让他守门——GPT-6 Sol 干长链条推理,Sonnet 5.5 跑高频低成本的编码和改写,Flash-Lite 顶那些不心疼的批处理活,谁在第几步上场,是编排问题,不是信仰问题。

所以那张选型表被撕了不是情绪,是必然。按"能力排行榜"排序的表已经失效了,因为能力榜单每周都在重排,而你的业务流没变。

真正该钉在墙上的是另一张表:哪一步任务、什么输入、能容忍多少钱、能忍受多少延迟、错了谁兜底。

模型是耗材,不是资产。

护城河也不在模型里。

一人公司的护城河,不在模型在编排

“最强”这个词的保质期,短到有点荒诞。9月1日,Claude Fable 5.1 和 Mythos 5.1 发布,官方称其为世界上最先进的编码和知识工作模型。9月28日,Sonnet 5.5 就来了——快 30% 以上,成本最多降 30%。同一个星期,Bedrock 上架了 GPT-6 Sol 和 Luna,还有 Claude Opus 5.5。

一个月前你花大价钱买的“领先”,一个月后变成了货架上的一个选项。

AWS 自己那篇一周综述里有句话很直接:真正有趣的问题不再是“它有多智能”,而是“在当前这一步,哪个模型能在这种成本、这种延迟下最匹配需求”。

这句话就是编排的定义。

编排听起来玄,其实特别具体。它就是你决定把哪件事交给哪个模型,用什么上下文喂它,拿到结果怎么校验,错了怎么退回去重来,以及最要命的——怎么让这一整套在你睡觉的时候自己跑。

拆开看,一人公司的编排至少三层:

  • 路由层。同一个任务,Sol 出初稿,Opus 5.5 做审查,Sonnet 5.5 批量处理长尾。不是挑谁最强,是挑在这个成本、这个延迟下谁最合适。
  • 上下文层。你的业务知识、历史决策、客户偏好,怎么组织成模型能直接吃的形式。这层是外包不出去的。
  • 记忆层。Claude Cowork 现在把记忆跨聊天和 Cowork 打通,所有条目都列在“设置 > 记忆 > 主题”里。工具给你装记忆的容器,往里面放什么,是你的事。

模型是租的,编排是长出来的。

配图

这就是关键变量。模型降价对所有人都是利好,平权效应拉满;但编排有复利——多跑一轮,它就更准一点,别人抄走的成本比抄模型高得多。

我见过几个真正跑起来的一人公司,一个人加一套编排好的智能体流程,产出顶得上过去五个人。舍予AI智能体给这类创业者的定位很准——“老板的第一支 AI 战队”。战队这东西的价值从来不在单兵有多强,而在谁指挥、怎么配合、什么时候果断换人。你手下最能打的那个今天可能还是 Sol,下个月可能就换成 Gemini 4——Gemini 那边已经在调整额度,明显在给 4 系列铺路。

换人是常态。换完人系统还能不能跑,才是护城河。

所以别再把精力花在追榜单上了。挑一个落地场景,把你最耗时的闭环先编排出来,让它在你不盯着的时候也能完成任务。这件事今天做和三个月后做,差别不在模型,在你手上攒下的那条流水线。

留给OPC创业者的窗口,只有下一轮降价前

Claude Sonnet 5.5 出来那天,我先翻到定价页。快30%以上,多数工作便宜至多30%——这两行才是重点,前面那些榜单排名不是。

降价才是OPC创业者真正的发令枪。

上一次是Sonnet 5,这一次是5.5,下一次轮到谁,你我心里都有数。Gemini那边把话说明白了:10月9日起免费版只剩Flash-Lite,Plus档保留Flash和Flash-Lite,Pro直接拿掉。表面是收额度,实质是腾货架。Gemini 4要来,上一代往下沉。沉下来的那一层,才是我们真正能大规模铺开用的那一层。

值得关注的是,这次前沿模型不是一个个来,是一批批上。9月28日同一天,Amazon Bedrock上架了GPT-6 Sol、Luna,还有Claude Opus 5.5。AWS那篇周综述自己写得很直白:现在有意思的问题不再是"它有多智能",而是"在这一步、这个成本、这个延迟下,哪个模型最匹配"。这句话我建议每个OPC都抄在本子上。

它在告诉你,选型不是资产。

选型是消耗品。你今天押的最强模型,三个月后大概率变成中档货,价格掉一半。把身家押在它上面,等于把公司盖在一块还会继续融化的冰面上。

那护城河在哪?在你把一个具体落地场景吃透的那点深度里。"老板的第一支AI战队"这种定位,听着像一句口号,真做起来是一整套编排:谁接需求、谁拆任务、谁调工具、失败了谁兜底。这套东西跟模型是解耦的。模型换了,换的是零件;编排是你的图纸。

所以窗口期的算法很简单:

  • 成本掉30%,你可以降价30%抢量,也可以原价卖、把多出来的30%换成更多交付。选哪个,取决于你手里的需求是不是还没喂饱。
  • 你的报价里,多少是模型溢价,多少是场景理解?前者会随下一轮降价蒸发,后者不会。
  • 明天必须换模型,你的系统多久能跑通?一天以内,你有资格谈窗口;一周以上,你就是在赌。

这个窗口不会关,但它会一轮一轮收窄。第一轮降价时,市场上知道怎么用便宜模型做出好东西的人还很少;到第三轮,这会是常识。

留给你我的时间,就是从今天到下一轮降价公告之间。

这周就做一件事:把核心链路里的模型调用全部抽出来,做成可替换的一层。然后算一笔账——如果推理成本明天再掉30%,你是降价还是加量。想清楚这个问题的OPC,下一轮发令枪响时,才会站在枪口那一侧。

那张选型表撕了不心疼。该心疼的是那些把选型当成护城河的人。

#舍予基业#SheYu#AI模型选型#多模型编排#Bedrock模型接入#AI智能体搭建#大模型成本优化#一人公司AI

想知道舍予基业装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案;不方便留号码,也可以直接 WhatsApp 找我们。