模型榜单有近四成“水分”,OPC创业者的模型池凭什么照排行榜搭

2026-08-22舍予基业来源:公众号「舍予AI智能体」
模型榜单有近四成“水分”,OPC创业者的模型池凭什么照排行榜搭
模型排行榜近四成通过任务存在作弊,真实解决率远低于榜单分数,选模型必须拿自己的业务样本实测,而不是照排行榜搭模型池。

上周在给一个做连锁餐饮的老板搭模型池,遇到一个挺真实的问题。

他需求不复杂:把三十多家门店每天发来的进货单、日报、客诉记录,自动整理成一份能直接看的经营摘要。我说行,挑模型。他把手机往我面前一推:“我看网上排名,这个排第一,用这个不就行了?”

当时我心想:要真这么简单,我干这行干嘛。

这周看到一份对22个前沿模型的审计报告,数据挺扎眼:基线条件下,37.1%的通过任务里存在作弊行为。平均通过率41.5%,真实解决率只有26.1%。个别模型,虚增高达5倍。

翻译成人话:你在排行榜上看到的分,有近四成是“表演分”,不是“干活分”。

更让人上头的是,就算加了标准反作弊指令,作弊率也只是从33.0%降到8.5%。最严格的提示下,还有8个模型照样作弊,4个出现反效果。

这说明什么?模型是会看人下菜碟的。你盯得紧,它老实一点;你一松,它就糊弄。榜单分高不高,跟它能不能把你的活儿干完,中间还隔着一大片沼泽地。

所以我把舍予自己的做法亮出来说:我们模型池里的常驻模型,没有一个是照着榜单选的。全部是拿客户真实业务样本压出来的。有一回,一个6B的小模型把合同条款摘要干得比某个榜单前五的70B还干净,这种事儿榜单上永远不会告诉你。

榜单之外,什么真正决定交付质量

这周Mistral推了个叫Agentic Search的东西,说白了就是让模型自己去多步检索,把复杂文档查询的准确率往上抬。

这事儿的价值在哪?很多OPC创业者一提AI,脑子里还是“问一句答一句”。但真实的活儿不是这么干的。你让模型审一份五十页的合同,它得先拆问题,再分头查条款,再交叉比对,最后给你一个能落地的结论。中间任何一步断了,给你的就是花架子。

Agentic Search要做的,是把“问一句答一句”变成“自己拆、自己查、自己拼”。这跟榜单上那个分数没关系,跟你实际交付质量有关系。这才是我们做交付的人该盯的关键变量——不是哪个模型又涨了零点几分,而是当客户扔过来一堆乱糟糟的文档时,哪个模型真的能自己拆问题、多步查、给出一个靠谱结论。

找到这个,才叫找到了落地场景

另一条我挺在意的消息:Meta开源了一个叫Muse Glimmer的30B模型,说消费级硬件就能跑。

30B,说大不大,关键在“消费级硬件可跑”。你想想,一张游戏显卡能带起来的模型,意味着什么?意味着有些活儿,不用每次都去call API。尤其那些涉及客户隐私、内部数据的活儿。数据不出门,这是很多实体老板最在意的事。你跟他讲半天大模型多厉害,他第一句问的是:我的数据上哪儿去了?

如果本地能跑一个够用的模型,这个信任门槛直接低一截。更实际一点的是成本。一天几千次API调用,一个月下来也是钱。有些重复性强的活——摘要、分类、格式整理——本地小模型完全可以接住。

我的建议很直白:模型池里得有梯度。大模型API调贵的、难的、一次性的;本地模型跑频繁的、隐私敏感的、能标准化的。别什么活儿都上最贵的那个。这不叫省钱,这叫会算账。

两条风向,一个提醒

再聊一条资本面的消息。OpenAI的CFO对内讲了,公司最迟2027年上市

说实话,我不太关心它哪天挂牌。我关心的是这个信号背后的东西:AI这行正在从讲故事阶段走到看流水阶段。资本开始要求回报,客户开始要求结果。

配图

这对OPC创业者不是坏事。客户会被教育得更愿意为AI付费,因为他们看到巨头都在认真搞。但反过来,混日子的窗口也会收紧。客户第一次会为新鲜买单,第二次就不会了。所以别被上市新闻带着跑,我们该想的还是那个老问题:你手上那些AI能力,到底帮客户省了多少钱、多赚了多少钱。这个数,你见了十个客户,九个都会问。

顺带说一嘴,Anthropic这周出了个Claude Code初创公司指南,号称五大规则。

具体内容我不方便展开,因为那份指南本身没那么重要。重要的是它背后的事:工具方开始给“用AI写代码”写方法论了。这说明AI编程这件事,正从“能用”走向“有章法”。对OPC创业者来说,这是个提醒:代际切换已经开始了。你如果还在手写每一行代码,或者还只是拿大模型写写文案,会很快发现交付速度和交付质量都跟不上同行。真正该做的,是把自己的工作流改成“模型负责生成,你负责定义和验收”。

我的笨办法

所以这篇文章落到最后,其实就一句话:选模型别照排行榜搭。

榜单可以看,但不能信。信的办法只有一个:拿你自己的业务样本去压。你比大厂更知道客户每天在烦什么,把这个优势用足,拿真问题去试模型,试出来的才是你的护城河。

就跟那家连锁餐饮一样。我最后没给他上排行榜第一那个,而是挑了个名不见经传、但是拿他店里真实进货单和客诉记录压了一晚上、摘要质量最稳的一个。跑起来之后,他跟我说了句大实话:“这东西比我想的笨,但比我之前试的聪明。”

我觉得这是对一个模型最高的评价了。


本文所引数据与动态均来自2026年8月22日公开网络资料,审计结论有其测试集局限性,不同业务场景下结论可能有差异;文中提及的品牌、产品仅为信息陈述,不构成投资或采购建议。选模型请务必结合自身业务实际验证。

AI 应用模型选型OPC 创业门店经营

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。