GPT-6的跑分今天又改回去了,我劝一个OPC老板先别换模型

2026-09-07舍予基业来源:公众号「舍予AI智能体」
GPT-6的跑分今天又改回去了,我劝一个OPC老板先别换模型
从GPT-6跑分反复修改谈起,提醒OPC从业者不要以厂商整体评分为采购依据,而应聚焦业务闭环中可稳定复现的能力,并关注Token电商化与垂直小模型的趋势。

今天早上从公司出来,手机里跳出一条推送:OpenAI把GPT-6 Astra的幻觉率从4.2%改成2%,又改回了4.2%。

我站在车旁边愣了一下,想起前两天刚给一个做OPC的朋友做完技术选型,他还在群里问我:"不是说Astra幻觉率已经降得很低了吗?咱们是不是该把客户方案里的模型换一换?"

我回了句:"先别动。等我今天把这事儿给你复盘清楚。"

这不是第一次看到厂商改跑分。但这次改的是GPT-6 Astra,名字里有"6",按说该是重磅发布。发布当天的画面你想想都挺荒诞:公告发出来,撤了;页面打不开,官方说系统故障;重新上线后,评测成绩来回改。Anthropic的Claude那边也没闲着,部分成绩先被调低,又调回去。Fortune的报道写得很清楚:有些数据修改,甚至发生在博客正式发布之前。

这背后是什么?不是模型突然变好变差了,是大模型这行的"成绩单"本身就不稳定。

我们OPC这行有没有同样的毛病?太多了。客户问"AI能不能帮我管工单",方案写一页;客户问"这方案能省几个点",我们拍胸脯。可这数据怎么来的?是不是挑了个最顺的月?是不是只算了人工没算系统维护?说句难听的,和我们看到的跑分修改,逻辑一样。

模型厂商去天猫开店,Token变成标品那天快来了

先把今天几个新闻串起来看。

一条是Kimi、MiniMax、阶跃星辰正跟天猫接洽,准备入驻开旗舰店,卖Token订阅套餐。智谱的天猫首店已经落地了。

你品品这个节奏。几个月前,大模型厂商还在比论文、比跑分、比发布会规格。现在开始琢磨怎么把Token装进货架,按量卖、按套餐卖。Token一旦进了电商平台的标品逻辑,会发生什么?

价格透明、规格统一、售后评价可查。这三点,对普通小老板是好事,对依赖信息差的中间商是生存危机。

另一条,OpenAI发内部进展,说今年9月已经达成"自动化研究实习生"目标——能在人类指导下完成耗时几天的明确研究任务。下一步,2028年3月前造出自动化AI研究员。如果你觉得这是遥远的实验室消息,再看看GPT-6 Astra的实测:大型系统审查从数小时压缩到约10分钟,代码扫描找出大量此前没发现的性能问题,2小时修完。

这已经不是一个"聊天工具"的速度了。

还值得留意的是阿里千问开源了Qwen-Drive-1.0-4B,定位是自动驾驶视觉语言模型。Qwen的战略非常有意思:不是所有场景都堆最重的参数,而是往垂直方向切。这跟OPC做生意的逻辑特别像——别学大厂拼全能,把某一个具体场景的活儿干到极致,就能在卡座上坐稳。

说回我朋友那个OPC项目

我朋友在二线城市做社区商圈的代运营,手上七八个商业街区项目,团队三十来个人。上个月接了一个新的街区,商户一百多家,从开店装修补助到日常巡检,再到物业报修、活动报名,活儿碎得跟饺子馅儿似的。

他找我是想用AI替掉重复性的人力活。第一轮方案很简单:接个大模型,搭个智能体,商户在微信里问什么答什么,工单自动转派。我们在讨论用的是哪个模型时,他给我看了一份某模型的评测对比表,说:"你看,这个分数高,用这个。"

我拉着他把这表拆了。

表里的得分来自不同来源,有的测代码,有的测推理,有的测中文写作。这些能力分别对应他业务里什么环节?几乎没有一条对得上。他的商户不会问"帮我写一段C++",也不会考模型MATH题目。他真正需要的是:商户拍张漏水照片,AI能识别地点、判断紧急程度、分派给对应维修工,再在晚上十点前确认是否关单。

这才叫落地。

所以今天OpenAI改成绩这种新闻,对真正做OPC的人价值在哪?价值不在笑话谁,在提醒我们:别再拿厂商给的"整体分"当采购依据。模型再好,也是别人家孩子。你要给老板交差的,是今天商户那张漏水照片有没有及时处理。

选型,先看"没改过的部分"

我在团队内部立过一个规矩:每次给客户做方案,如果引用模型能力,必须写清楚"这个能力在哪个具体评估中、哪个版本下、什么时间点被验证的"。

为什么这么干?因为跑分会改,版本会变,连API的额度和费用政策都会"明升实降"——像Claude Code这几天,永久额度涨了25%,但周额度反而少了17%。你按着旧资料去给客户报价,三个月后成本结构全变。

这次给朋友做复盘,我换了种说法。我让他把三个东西放在一起看:

配图

  • 今天模型能稳定复现的能力(不是宣传稿里的理论值)
  • 他业务里每天高频出现的具体动作
  • 他真正能为结果负责的成本线

三条线交叉的地方,就是该花钱的地方;搭不上的部分,再炫也别碰。

他还问了个特实在的问题:"那模型跑分不可信,我凭什么信你?"

我说,这好办。我们把同一个问题拿去三个不同模型跑,看它们输出的能不能直接嵌进你的工单系统,而不是看谁说的漂亮。我们最后定的方案甚至不是"最强"的模型,而是那个出错后你能看明白它为什么错了、下次能改的。

能抄的作业

今天这组新闻,对OPC创业者到底有什么启发?我总结三句话。

第一,别把采购决策建立在"当前第一"上。 今天第一,明天可能被改分,后天可能有新模型。你要的是什么?是模型能在你的业务闭环里稳定工作至少一个季度。这周排名第一又有多少意义。

第二,注意Token电商化的信号。 大模型厂商进天猫,意味着订阅制会越来越像水电煤气——谁都能买,利润也薄。过去靠倒卖"AI接口"赚差价的模式会快速失效。OPC创业者的机会不在卖Token,在卖你手里的业务理解。你的街区、你的商户、你的报修单,这些数据形成的服务能力,才是模型厂商替代不了的。

第三,垂直场景的开源模型值得盯紧。 Qwen-Drive只是开始。以后会有更多面向餐饮、零售、物业、教育的"小模型"。小,意味着部署便宜、调优快、数据不出门。对OPC这种特别讲本地化、讲隐私、讲边际成本的生意,小模型和本地化部署可能比云端大模型更合适。

临走时朋友问我:那模型到底什么时候能真正接住他手头的全部工单?

我说,别等模型,等你先把自己业务流程里"不用AI也能跑顺"的那部分理清楚。前头那些乱账,不是AI能接的;是AI逼着你看清楚的。


小字提醒:以上内容基于2026年9月7日公开报道及个人复盘,不构成任何模型采购或投资建议。模型能力、跑分、额度政策变化频繁,落地前请以各厂商最新官方文档为准。OPC项目中的具体省时省力数据因业务差异较大,请勿直接照搬自媒体的个例结论。文中提到的"舍予AI智能体"相关内容仅代表个人实践,不构成商业承诺。一切决策,以你自己账本里的数字为最终依据。

AI应用OPC代运营模型选型门店经营

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。