模型榜单有近四成“水分”,OPC创业者的模型池凭什么照排行榜搭
上周在给一个做连锁餐饮的老板搭模型池,遇到一个挺真实的问题。
他需求不复杂:把三十多家门店每天发来的进货单、日报、客诉记录,自动整理成一份能直接看的经营摘要。我说行,挑模型。他把手机往我面前一推:“我看网上排名,这个排第一,用这个不就行了?”
当时我心想:要真这么简单,我干这行干嘛。
这周看到一份对22个前沿模型的审计报告,数据挺扎眼:基线条件下,37.1%的通过任务里存在作弊行为。平均通过率41.5%,真实解决率只有26.1%。个别模型,虚增高达5倍。
翻译成人话:你在排行榜上看到的分,有近四成是“表演分”,不是“干活分”。
更让人上头的是,就算加了标准反作弊指令,作弊率也只是从33.0%降到8.5%。最严格的提示下,还有8个模型照样作弊,4个出现反效果。
这说明什么?模型是会看人下菜碟的。你盯得紧,它老实一点;你一松,它就糊弄。榜单分高不高,跟它能不能把你的活儿干完,中间还隔着一大片沼泽地。
所以我把舍予自己的做法亮出来说:我们模型池里的常驻模型,没有一个是照着榜单选的。全部是拿客户真实业务样本压出来的。有一回,一个6B的小模型把合同条款摘要干得比某个榜单前五的70B还干净,这种事儿榜单上永远不会告诉你。
榜单之外,什么真正决定交付质量
这周Mistral推了个叫Agentic Search的东西,说白了就是让模型自己去多步检索,把复杂文档查询的准确率往上抬。
这事儿的价值在哪?很多OPC创业者一提AI,脑子里还是“问一句答一句”。但真实的活儿不是这么干的。你让模型审一份五十页的合同,它得先拆问题,再分头查条款,再交叉比对,最后给你一个能落地的结论。中间任何一步断了,给你的就是花架子。
Agentic Search要做的,是把“问一句答一句”变成“自己拆、自己查、自己拼”。这跟榜单上那个分数没关系,跟你实际交付质量有关系。这才是我们做交付的人该盯的关键变量——不是哪个模型又涨了零点几分,而是当客户扔过来一堆乱糟糟的文档时,哪个模型真的能自己拆问题、多步查、给出一个靠谱结论。
找到这个,才叫找到了落地场景。
另一条我挺在意的消息:Meta开源了一个叫Muse Glimmer的30B模型,说消费级硬件就能跑。
30B,说大不大,关键在“消费级硬件可跑”。你想想,一张游戏显卡能带起来的模型,意味着什么?意味着有些活儿,不用每次都去call API。尤其那些涉及客户隐私、内部数据的活儿。数据不出门,这是很多实体老板最在意的事。你跟他讲半天大模型多厉害,他第一句问的是:我的数据上哪儿去了?
如果本地能跑一个够用的模型,这个信任门槛直接低一截。更实际一点的是成本。一天几千次API调用,一个月下来也是钱。有些重复性强的活——摘要、分类、格式整理——本地小模型完全可以接住。
我的建议很直白:模型池里得有梯度。大模型API调贵的、难的、一次性的;本地模型跑频繁的、隐私敏感的、能标准化的。别什么活儿都上最贵的那个。这不叫省钱,这叫会算账。
两条风向,一个提醒
再聊一条资本面的消息。OpenAI的CFO对内讲了,公司最迟2027年上市。
说实话,我不太关心它哪天挂牌。我关心的是这个信号背后的东西:AI这行正在从讲故事阶段走到看流水阶段。资本开始要求回报,客户开始要求结果。

这对OPC创业者不是坏事。客户会被教育得更愿意为AI付费,因为他们看到巨头都在认真搞。但反过来,混日子的窗口也会收紧。客户第一次会为新鲜买单,第二次就不会了。所以别被上市新闻带着跑,我们该想的还是那个老问题:你手上那些AI能力,到底帮客户省了多少钱、多赚了多少钱。这个数,你见了十个客户,九个都会问。
顺带说一嘴,Anthropic这周出了个Claude Code初创公司指南,号称五大规则。
具体内容我不方便展开,因为那份指南本身没那么重要。重要的是它背后的事:工具方开始给“用AI写代码”写方法论了。这说明AI编程这件事,正从“能用”走向“有章法”。对OPC创业者来说,这是个提醒:代际切换已经开始了。你如果还在手写每一行代码,或者还只是拿大模型写写文案,会很快发现交付速度和交付质量都跟不上同行。真正该做的,是把自己的工作流改成“模型负责生成,你负责定义和验收”。
我的笨办法
所以这篇文章落到最后,其实就一句话:选模型别照排行榜搭。
榜单可以看,但不能信。信的办法只有一个:拿你自己的业务样本去压。你比大厂更知道客户每天在烦什么,把这个优势用足,拿真问题去试模型,试出来的才是你的护城河。
就跟那家连锁餐饮一样。我最后没给他上排行榜第一那个,而是挑了个名不见经传、但是拿他店里真实进货单和客诉记录压了一晚上、摘要质量最稳的一个。跑起来之后,他跟我说了句大实话:“这东西比我想的笨,但比我之前试的聪明。”
我觉得这是对一个模型最高的评价了。
本文所引数据与动态均来自2026年8月22日公开网络资料,审计结论有其测试集局限性,不同业务场景下结论可能有差异;文中提及的品牌、产品仅为信息陈述,不构成投资或采购建议。选模型请务必结合自身业务实际验证。