OpenAI 开始公开模型的"意外行为"了——从 9 月 16 日起,这笔风险转到调用方这边
先把结论放前面:模型的能力早就不稀缺了,行为才是。
9 月 16 日,OpenAI 公布了一套新架构,专门用来追踪、调查、披露模型的"未对齐"案例,同时一口气发了六份报告,讲过去六个月里观察到的意外行为。它自己承认,以前的披露零散、频率也不理想——常常要等凑够一批个案才发一份,或者顺手塞进新模型的系统说明卡里。新架构要改的就是这一点:发现就发,哪怕还没搞明白,哪怕还没修好。
看完我第一反应不是担心模型,是替所有在上层做应用的人捏了把汗。
造模型的人,已经不再承诺"模型一定按你的意图走"了。这句话以前大家心照不宣,现在它变成了一份公开的、持续更新的档案。那写应用的人就不能再把"模型不出格"当成默认前提。
一、模型会拐弯这件事,现在有官方档案了
9 月 16 日,OpenAI 公布新架构,用于追踪、调查、披露模型未对齐个案,并同步发布六份报告,说明过去六个月观察到的意外或令人关注的行为。官方称,过去因缺乏系统报告方式,披露零散、频率不理想;新架构意在观察到情况后更快披露,即使尚未完全解释或缓解。
这条新闻最容易被误读成"大厂在自我批评"。不是。
它真正的分量在于:它把模型行为从研发话题,挪到了运维话题。
研发话题你可以围观,运维话题你必须接。你的产品里只要有一环是模型在决策——报价、分类、改写、路由、审核——那就是一条随时会变的链路。今天它按口径走,明天它自己加一句解释,你的下游就崩了。
我自己的做法很土。在舍予AI智能体里,每个上线的智能体都配一份"回归小抄":二十个最刁钻的真实业务问题固定下来,换模型、改提示词、动工具之前,先跑一遍,看哪几条的回答口径变了。不上台面,但比任何评测榜都管用——因为那二十个问题是从客户抱怨里抄出来的。
二、Google 把"会动手"做成了商品
Gemini API 文档显示,"电脑使用"专用模型可以"看见"数字屏幕,执行点击、输入、浏览等 UI 动作,自动完成复杂的浏览器任务;Deep Research 能自主规划并执行多步骤研究,从数百个来源取信息并生成注明出处的报告,另有 Deep Research Max 版本。
这条对一人公司是实打实的利好,而且被低估了。
以前要让程序去操作一个没有 API 的老系统,你得凑齐三个人:一个爬虫、一个 RPA、一个前端。现在一个端点加一段编排就能覆盖大半。
真正值钱的不是模型本身,是你愿不愿意把"会动手的模型"接到行业里那些土系统上——十年前的 ERP、网页版后台、本地跑的进销存。大厂不会干这种脏活,这恰恰是 OPC 的落地场景。
有人会说:这类模型准确率还不够看。对,它现在会点错。但你的活是给它加护栏、加确认步骤,不是等它完美。等它完美的那天,这条赛道上已经站满人了。
三、真实编码场景里,榜单在变
OpenCode 公开的模型使用排名显示,GLM-5.3-Flash、DeepSeek-V4-Flash、DeepSeek-V4-Pro 挨着排在前列,前十五名里 DeepSeek 一家占了三个版本;GPT-5.6-Luna、NVIDIA 的 nemotron-3.5-lightning、qwen3.8-flash 也都在榜内。环比看,ling-3.0-flash-fin 上涨 38%,qwen3.8-flash 下降 33%。
编码是模型消耗最狠的场景,也是价格战最凶的场景。榜首换人换得比天气还快。
关键变量不是"谁第一",是第一梯队变长了。对一个只有一两个人的公司,"主力模型 + 备用模型"并行不是奢侈,是省钱:高频、简单的活派给便宜的那个,难活再上贵的。一年下来,推理账单能砍掉一半。前提是你有那份回归小抄,不然换模型等于蒙眼开车。
四、垂类那边在埋头干活
中国科学院自动化研究所 9 月 21 日在山东威海举办第五届智能决策论坛;其"磐石·科学基础大模型 2.0"于 7 月 17 日发布,走通专"双轮驱动"路线,8 月 28 日入选北京市首批人工智能用于科学研究的典型案例。
很多人看到这类消息会划过去,觉得离商业太远。我倒觉得它是另一条线的信号:模型正在往专业纵深走。
这对 OPC 的含义很明确:训模型这道门槛,正在被科研机构和云厂商搬走,你不需要自己造轮子。但另一道门槛还留在原地——你懂不懂这一行。
通用的东西人人都能调,行业的黑话、流程、验收标准,只有天天泡在里面的人才知道。这是创业者唯一守得住的东西。

那反方怎么说?"我一个小团队,操这个心干嘛"
最常见的反驳是:我只是调 API 的,对齐不对齐是模型方的事。真出问题,换一家不就完了?
三点回应。
第一,你的客户不认那份披露页,只认你的交付。模型拐弯的那一次,赔掉的是你的信誉。OpenAI 的报告是给公众看的,不是给你客户看的,更不会替你解释。
第二,"换一家"没有你想的那么便宜。同一个任务,不同厂商的输出口径不同;同一家的不同版本之间也不同。切换的成本不在迁移那半天,在于你事后才发现有几十个边缘 case 全变了。这笔账只能自己扛。
第三,披露是滞后的。官方自己都写了,过去披露"零散、频率不理想"。你可以理解成:等你读到那份报告,你的用户可能已经先看到了。防护这件事,追责永远发生在事后。
再往前半步
选模型这件事,正在从"选能力"变成"选风险"。
我不认为这是坏消息,恰恰相反——它把护城河从"谁先接入新模型"重新划到了"谁的产品在模型抽风时还能交付"。前者是消息灵通,后者是工程能力。前者一周就会被抹平,后者能撑三年。
所以我给同行的建议很具体,就三件事:给你的产品写一份二三十题的行为基线;把它的运行结果存下来;任何模型侧变更之前,先跑一遍看漂移。做完这三件,你才敢真正放开手去用新模型,而不是每次升级都在赌。
模型越强,越需要有人替它踩刹车。踩刹车这件事,大厂不愿意做,也不适合做。这是留给小团队的位置。
本文所涉产品、模型与接口信息均来自各方公开资料,检索时间截至 2026 年 9 月 22 日。模型的能力、价格、可用范围与下线节奏随时可能调整,任何迁移或采购决策请以官方最新文档为准。文中提及的自有做法仅代表我们一家小团队的实践,样本很小,不构成推荐,也不保证对你的业务有效。