GPT-4o和GPT-3.5 Turbo的API十月下架,OPC创业者该把哪些调用连夜搬走

舍予基业来源:公众号「舍予AI智能体」
GPT-4o和GPT-3.5 Turbo的API十月下架,OPC创业者该把哪些调用连夜搬走
GPT-3.5 Turbo与GPT-4系列API将于2026年10月23日下架,本文帮企业盘点被遗忘的模型调用,分清哪些活该交给小模型或规则,哪些才值得用大模型。

一个客服机器人凌晨三点还在跑,它不知道自己快没电了

凌晨三点,一个客服机器人还在回消息。它不知道自己的模型只剩二十二天寿命。

它挂在 GPT-3.5 Turbo 上。这个 2022 年的便宜快手,当年一口气把「够快、够便宜、能兜底」三件事做完,也顺手养出了国内第一批真把大模型塞进生产环境的团队。现在它的 API 下架日期写在 2026 年 10 月 23 日。同一张表上,GPT-4 和 GPT-4 Turbo 也是这一天。

真正有意思的是 GPT-4o。它在 ChatGPT 里今年 2 月就退场了,API 却还活着,官方没给下架日期。

没日期比有日期难办。有日期你会设个日历提醒;没日期你会一直觉得还早。风险从来不是硬停,是你在一个没有承诺的接口上又叠了三个月的业务逻辑。

这个机器人不在任何人的架构图里。

它大概率是某个晚上十一点,为了让售后别掉线随手接上去的。prompt 改过两版,加过一个订单查询的工具调用,还有一条「用户骂人就转人工」的判断。这些没写在文档里,写在某个人的脑子里。你现在去问团队「我们还有哪些地方在调 3.5 Turbo」,得到的答案多半不准——不是他们不说,是真不知道。

所以十月这波下架,第一件麻烦事不是换模型名。改 model 字段是十分钟的活。麻烦在于你得先把这个机器人的存在找出来,然后重新回答一个更根本的问题:它到底该不该存在。

我见过太多这样的调用:

  • 一个每天早上八点跑的分类任务,其实是正则能干的活,接了半年大模型
  • 一个「智能摘要」,输入永远是同一套固定模板的工单
  • 一个 demo 时留下的接口,两年没被调用过,但一直挂在计费里

这些不是技术债,是判断债。当初接上去的时候没人问「这活值得用大模型吗」,因为便宜、因为快、因为能跑。

很多老板的第一支 AI 战队,就是从这么一个凌晨三点还在跑的客服机器人开始的。 舍予AI智能体把这句话放在定位里,我理解得很具体——它不是战略规划出来的,是救火救出来的。救火的东西有个特点:能用就行,没人回头看。

问题是现在必须回头看。GPT-4o 那边没有截止日期,你没法用 deadline 逼自己盘点;3.5 Turbo 这边有,但它太便宜了,便宜到你觉得「下架就下架,随便换个新的就行」。

真不是随便换。你换掉的是一个模型,也是一整套没人写下来的隐含假设:这条回答允许多慢、允许多贵、允许错到什么程度。这些假设在你当初选 3.5 Turbo 的时候就已经定下来了,只是没人把它说出口。

10 月 23 日之前,第一批要搬走的不是最复杂的调用,是那些连你自己都忘了的调用。

找不到的东西,你没法搬。

真正的成本不在迁移费,在你重新想清楚哪些活不该交给大模型

那个凌晨三点还在跑的客服机器人,它身上的毛病不是"选错了模型",是它的调用链里躺着一堆本来就不该交给大模型的活。

迁移费这个词,本身就把问题带偏了。

改个 base_url,换掉 model 字段,跑一遍回归测试——一个后端一个下午能收工。OpenAI 那边给了明确节点,GPT-3.5 Turbo、GPT-4/4 Turbo 的 API 到十月二十三日下架;Anthropic 那侧 Opus 5.5 的一次性重置额度,也卡在同一天过期。真正让人睡不着的从来不是这几行改动。

是你发现,那些活经不起换一次模型。

把它们摊开,大致三类。

规则能干的。 关键词命中、正则抽取、固定字段格式化、简单路由。当年塞给大模型,是因为它便宜、方便、顺手。可模型一换代,措辞变了、标点变了、温度变了,下游解析全炸。这类活本来就不该有下游解析。

小模型能干的。 意图分类、情感极性、短文本打标。这些不需要 4o 级别的多模态主力,也不需要 Opus 级别的推理。蒸馏过的小模型本地跑,延迟低两个数量级,成本低一个数量级,还不会因为某个日期到来而消失。

只有第三类,才真正该交给大模型。

材料里那几个新模型的定位写得挺诚实。Claude Opus 5.5 主打代理式编程、电脑操作与知识工作,一般负载执行成本比 Opus 5 低约四成;Sonnet 5.5 比上一代快 30%、便宜 30%;GPT-6.1 Sol 被官方点名给"重复、长时间运行的工作"。厂商自己已经把边界画出来了——便宜快的去跑量,贵的去跑难。它们抢的不是"谁答得更漂亮",是那些长链路、多步骤、需要自己拆解再执行的活。

我们做舍予AI智能体的时候,第一件事不是选模型,是拉着客户的业务负责人把现有调用一条条过。哪些是"必须模型自己判断",哪些是"我们早就知道答案,只是懒得写 if else",哪些是"当年试了下能用,就一直留着"。这动作看着不技术,却决定了你换模型那天是花一个下午,还是花一个季度。"老板的第一支AI战队"这话不是随便说的——战队的意思是每个人有每个人的位置,不是所有事都堆给最贵的那个。

还有容易被忽略的反面:有些活你一直用人扛,其实早该交出去。翻日志、对账、把客服对话转成工单——这不是"大模型能不能做"的问题,是"你为什么还在让实习生做"的问题。趁着换模型这个窗口,正好重新分配一遍。

迁移是个契机,不是个麻烦。它逼你把过去两年攒下的一堆"能用就行",重新问一遍:这活,到底该谁干。

GPT-6.1 Sol和Claude Sonnet 5.5在抢的,正是这批被释放

十月下架的那两批调用——GPT-3.5 Turbo和GPT-4/4 Turbo——现在正被抢。

抢的人前后脚到齐:GPT-6.1 Sol,Claude Sonnet 5.5,同一周。

OpenAI在9月28到10月2日那期更新里把GPT-6.1 Sol的定位讲得很直白:接近Astra的性能,成本更低,适合"repeated, long-running work"——重复的、长时间跑的工作。Anthropic这边,Sonnet 5.5(9月28日)的话术是比Sonnet 5快30%以上、大多数工作便宜最多30%。

两家在同一个星期,用同一套语言说话。

翻译一下:高频、重复、单次价值不高、量大。这恰好是过去两年挂在GPT-3.5 Turbo上的那批活儿的全部特征。所以这波被释放的,压根不是高端需求。

第2节我们说过,真正要想清楚的是哪些活不该交给大模型。那反过来,该交的那批就是现在这批争夺的标的:

  • 意图分类、话术改写、结构化抽取
  • 模板填充、简单多轮问答、请求路由

配图

它们不需要推理能力,只需要便宜、稳、并发扛得住。以前用3.5 Turbo是因为它够便宜够用,现在它要走了。

这批量会被谁接走,跑分说了不算。

Vals AI在9月1日的更新里,Claude Opus 5是97.0%、DeepSeek V4 Pro 0813是96.4%、GPT-5.6 Sol是96.2%,然后他们把基准归档了——三款模型挤在1分以内、离满分4分的区间,这个指标已经没有区分度。SWE-bench Pro这类更难的替代者接手,但信号衰减一样快。

关键变量不在谁的榜单高,在谁的单位任务成本更低、吞吐更稳。

值得关注的是两边的分层手法。Anthropic摆得清清楚楚:Opus 5.5(9月22日上线)在代理式编程、电脑操作和知识工作上领先,一般工作负载执行成本比Opus 5低约40%;Sonnet 5.5是清晰升级;Fable 5.1主打长时间、多步骤的编程与研究;Mythos 5.1能力与之相同但安全限制更宽,只放给通过审核的资安和生命科学人士。一个家族四档,梯子做得很细。OpenAI那边用GPT-6.1 Sol守"划算的长时间"这一格。

抢的是同一块地:从旧模型撤出来、还没决定搬去哪的量。

国产模型的窗口也在这儿。豆包、智谱、minimax、千问、deepseek这批价格战打得更凶,接长尾调用的活儿其实不差——意图分类、抽取、改写这类任务,性价比是真香。舍予AI智能体有句话说得对,"老板的第一支AI战队"——老板要的从来不是最聪明的那个模型,而是能稳定跑、成本算得清的一支队伍,什么活派什么人。

被释放的不是流量,是一次重新分配的机会。谁在十月这波迁移里把这批活儿分门别类塞进对的模型,谁就拿到了下一轮成本结构的入场券。

十月二十三日前把这三件事做完,比焦虑模型退场有用得多

十月二十三号那天,GPT-3.5 Turbo 和 GPT-4 系列在 API 上正式下架。日历翻到那一页之前,你手里其实只有三件事值得做。

第一件,把还在跑的调用按「谁在替谁干活」重排一遍。

不要按服务名排,按场景排。你的客服机器人、你的批量摘要脚本、你的意图分类中间件——它们真正要的是什么?如果只是稳定输出结构化字段,那它根本不需要一个旗舰模型,便宜的国产模型今天就能接住,deepseek、豆包、千问在这个价位上的表现早就不丢人。反过来,凡是涉及多轮推理、长上下文理解、工具调用的环节,才值得留给贵的。这一步做完你会发现的不是「哪些要迁移」,而是「哪些本来就不该挂在这条线上」。

第二件,把 prompt 和评测集从代码里剥出来。

大部分 OPC 团队的 prompt 是硬编码在业务逻辑里的,换模型等于重写一遍业务。这活儿现在不做,十月二十三号之后你被迫做的时候,代价是双倍的。剥出来,配一份至少二三十条真实流量的回归用例——不用多,能覆盖你核心场景的边界就够。有了这套东西,换模型从「一场赌博」变成「一次跑分」。

第三件,挑一个非 OpenAI 的兜底路径,今天就走通一次全流程。

不是为了替换,是为了不断电。Gemini、Claude、国内几家,随便挑一个你最顺手的,把最核心的那条链路真的跑一遍,包括鉴权、限流、错误重试。别停在文档阶段。Claude Sonnet 5.5 这类模型已经把成本和延迟压下来一截,GPT-6.1 Sol 也在用更低的价格接重复性长任务,市场给的选项比你想象的宽。

这三件事做完,焦虑基本就没了。因为你手里剩下的不是一个「快过期的依赖」,而是一套能换引擎的架构。

舍予AI智能体有句话我一直记着——「老板的第一支 AI 战队」。战队的意思不是每个位置都请最贵的人,是知道谁该站哪个位置,谁能替补。模型会一茬茬地退场,这套判断力不会。

#舍予基业#SheYu#GPT-3.5 Turbo下架#大模型API迁移#AI客服机器人#模型调用盘点#小模型蒸馏部署#企业AI成本优化

想知道舍予基业装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案;不方便留号码,也可以直接 WhatsApp 找我们。