清华这个开源项目,打了多少人的脸

2026-08-24舍予基业来源:公众号「舍予AI智能体」
清华这个开源项目,打了多少人的脸
清华开源代码模型VeriLoop Coder-E1引入“先测试验证、再修正”的循证闭环,在多项基准中领先同级开源模型,为企业和开发者提供更可靠的AI编码思路。

有读者凌晨给我发消息,问得挺直接:

“模型价格又降了,GPT-5.6 Sol降了20%,是不是意味着以后代码全交给AI写就行?我怎么感觉越降越慌?”

这是第三个这么问我的人了。

我觉得这问题本身就问错了。降价不是重点,重点是你得先搞清楚,AI写的代码到底能不能用、能不能验、能不能改。

最近我一直在盯清华那个新开源的项目,估计很多人还没反应过来它到底意味着什么。今天就想把这件事和价格战放在一起聊,回答几个我猜你们真正在琢磨的问题。

“模型参数都那么大了,为什么我拿去写代码还是天天翻车?”

先说个可能反直觉的结论:不是模型不够聪明,是你把活给错了对象。

过去两年,几乎所有代码模型的逻辑都是一个字:写。

它是个生成器。你给它需求,它吐代码。吐完就完了,对不对、跑不跑得通、改起来会不会炸,那是你的事。

但真正的企业代码,从来不是“写出来”就结束的事。要能跑、要能测、要能改、要能上生产、要出了bug能定位。这些活,光靠生成能力强根本扛不住。

清华深圳国际研究生院刘厚德、王立博团队最近开源了一款叫VeriLoop Coder-E1的代码模型,中文名叫“循证”。这款模型做了件很不一样的事:它不闷头写代码,而是每一轮生成代码之后,必须先经过测试验证。通不过,就分析原因、修正错误,然后再验证。直到产出可靠代码为止。

官方给的数据是,SWE-bench Verified得分85.20,SWE-bench Pro得分62.38,Terminal-Bench 2.0得分76.40。在32B及以下的开源模型里,前三项全是第一。

这个思路本质上给模型装了一套“循证闭环”。不是“我猜这样能行”,而是“跑一遍,告诉我哪里错,我改,再跑”。

我觉得这是这段时间最值得关注的一个信号:代码模型的主战场,在从“能不能写”转向“能不能改”。

“让AI先测再改,这不就是程序员自己的活吗?为什么要单独做?”

对,这就是关键。

普通AI写代码,你的体验大概率是这样的:它爽快输出一堆,你一看参数名对不上、依赖没装、边界没处理。你复制下来跑,报错。你再丢给它,它说抱歉,再给一版。还是错。

它的认知里没有“跑”这个动作。它可能在训练数据里见过海量代码,但它没真的运行过你的这段。所以它写的不是程序,是“看起来像程序的文本”。

VeriLoop这条路线有意思的地方在于,它把“验证”放进了生成循环里,而且是必经的一步,不是可选项。

团队在项目里讲了一个观点:真正有价值的递归式自我改进,不是模型反复修改自己,而是证据能够改变它未来如何发现错误、如何判断错误、如何纠正错误的方法。

这句话我反复看了三遍。它其实点破了一件事:让AI自己改自己,不如给它一套“用证据逼它改”的机制。

映射到创业者的场景里,这个变化太实际了。你不需要一个能一小时写一万行的AI,你需要一个写完能自己跑测试、跑挂了能自己定位、定位了能自己改对的小队。

“测试能不能外包给AI”这个问题的答案,正在从“勉勉强强”变成“可以认真聊聊了”。

“价格战打成这样,OpenAI降20%,谷歌Gemini 3.7 Flash只卖上一版一半,那我还要不要自建模型?”

央视新闻前几天有个报道,OpenAI从8月21日起把GPT-5.6 Sol的基准价格下调超过20%,三个月有效。上月底,低成本模型还降了80%。谷歌那边,Gemini 3.7 Flash的定价大约只有上一版的一半。

有美媒分析,中国公司开源和定价策略给美国公司带来了压力。这事儿我不评价谁赢谁输,我想说的是另一个层面。

模型正在商品化。而且商品化的速度,比大多数人想得快。

AWS数据库副总裁G2最近在台北讲得挺直白。他说,现在市面上模型几乎人人可用,开源闭源随手拿,企业真正的护城河在哪?答案是把最强的模型,连接上企业独有资料。他还抛了一句原话:“Agent的本质,就是最佳模型加上独特资料。”

这句话可以翻译成人话:模型会越来越不是门槛,但你手里那些只有你有的数据、规则、流程、历史案例,才是真正值钱的那一层。

这听起来有点抽象,我举个我们自己的例子。

我们团队给一个客户做了个报价单审阅的AI。模型本身用现成的,不贵。真正难的是怎么把这家公司几年的历史报价、被拒的案例、老板的红线条款、不同客户的砍价习惯,喂成一套可验证的判断规则。

这套东西不是模型自带的。是我们陪着对方一条一条对齐,慢慢喂出来、测出来、改出来的。这套东西换到任何别家,都得重来。

配图

所以你看,价格一路降,焦虑的反倒是最早囤模型的那拨人。真正稳的,是那些手里把“自己公司的料”攥得很死的人。模型可以用便宜的那个,但料是自己的,别人搬不走。

“那作为一个小老板,我到底该把预算花在模型上,还是花在别的地方?”

这个问题我觉得终于问到点子上了。

我的答案是:如果你不是做模型的公司,就别把预算堆在模型上。把预算花在两件事上:一是选一个能验证、能自纠错的引擎,二是把你自己的业务数据做成能喂给AI的粮。

前者对应的是我说的VeriLoop这条路线。后者对应的是G2说的“资料才是竞争力”。

这两件事会慢慢合成一件事。

我们舍予AI智能体在给客户搭团队的时候,从来没有把“换更强的模型”当成第一动作。我们更关心三件事:客户的业务规则能不能被穷举;客户的测试集够不够真实;客户原来判断对错的“老师傅逻辑”能不能被写成可验证的约束条件。

这些事听着土,但这是我们做了几十个客户之后最深的体会。模型再强,客户自己的测试用例如果是空的,一切都白搭。

所以你会发现,清华这个项目的名字起得有点东西。“循证”——不是让AI“感觉没问题”,是让AI拿证据说话。跑不通,错的就是错的。没有测试,就没有资格说“修好了”。

这条路如果在开源社区继续走下去,创业者最直接的机会是:我们终于可以给AI配一个“质检岗”了。它不是贵得要死的私有化部署,也不是只有大厂才玩得动的方案。它是开源、可量化、能跑在普通人机器上的东西。社区量化版本下载量已经过了一万六,说明真的有开发者在认真拿它干活。

最后说几句实在话

价格你可以等,反正还会降。但验证能力这件事,不能等。

因为当模型烂大街的时候,拼的就不是谁能调API。拼的是谁有一支会跑、会测、会改、能拿着你公司的证据自我纠正的AI战队。

这才是下个阶段的真门槛。


凌晨两点写完这篇,回头看了眼自己的服务器账单。模型确实便宜了,但每小时跑验证任务、回归任务、数据清洗任务的算力支出一点没少。我提醒各位,看清楚AI成本结构再开工,该算的细账,别用“反正降价了”盖过去。

AI 应用开源模型代码生成企业智能化

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。