能写代码的AI不稀奇,能“验完再交”的才要命
昨天跟一个做跨境独立站的OPC朋友吃饭,他跟我吐槽一件事。
他让AI改一段订单判重的代码,AI特别自信,连回五次“已修复”。结果他一跑,全崩。最后他自己逐行看了一遍,发现模型根本没跑测试,是“嘴上说跑了”。
这不是他一个人遇到的事。过去半年,太多创业者被AI代码Agent“能写不能验”这件事坑过。
所以今天清华那个开源模型出来的时候,我第一反应不是看榜单,是看它到底怎么解决“验证”这件事。
值得关注。
清华深圳国际研究生院刘厚德、王立博团队开源了一款代码大模型,叫VeriLoop Coder-E1,中文名“循证”。
这个名字起得很准。它做的事情,不是让AI闷头写代码、写错了再重来,而是装了一套“循证闭环”:每一轮生成的代码必须先经过测试验证,通不过就分析原因、修正错误,然后再验证,直到产出可靠代码。
说白了,它跟普通代码模型最大的区别,不是写得多快、多花哨,而是它每一轮都要“验完了再交”。
这次VeriLoop Coder-E1在几个公开软件工程基准上的得分很有意思。
SWE-bench Verified 85.20,SWE-bench Pro 62.38,Terminal-Bench 2.0 76.40,Deep SWE 33.63。
截至2026年7月27日,按Hugging Face公开社区榜单上的团队自发布结果看,在32B及以下开源模型里,这款模型前三项排第一,智能体基准排第二;在全部开源模型里,四项分别排第二、第一、第一和第五。
对比对象里有DeepSeek-V4-Pro、MiniMax-M3、GLM-5.2、Kimi-K3、Qwen3.6-27B这些大家耳熟能详的名字。
32B的模型,在验证类基准上压过一堆更大参数量的旗舰,这个信号比单纯的“又刷榜了”更值得创业者记一笔。
它背后那个哲学,我挺认可的。
团队讲,循证不是拿信息给既有结论做装饰,而是让证据去挑战甚至推翻系统当前的认识。系统不是反复修改自己,而是被证据纠正之后,改变“未来如何发现错误、判断错误、纠正错误”的方式。
这句话翻译成OPC创业者能听懂的话就是:
AI不能只会说“我改好了”,它得给你看“我跑了什么测试、结果是什么、哪个没过、为什么没过、我改了什么、再跑一遍的结果是什么”。
这个变化为什么关键?
因为过去AI写代码,解决的是“生成”问题。但真实软件工程里,写代码只是开头。改一个订单判重逻辑,可能牵连到促销叠加、币种换算、库存扣减、风控规则十几个模块。
没有验证的代码,不是代码,是风险。
这也是我为什么觉得“验证”正在成为AI编程落地的关键变量。
当天还有一个新闻,跟这件事可以放在一起看。
GLM-5.3的API上线了,官方说擅长复杂编码、防御性网络安全和长程任务,在AA综合智能指数里拿了60分,和Claude Fable 5、GPT-5.6 Sol这些闭源旗舰同级,还和Kimi K3并列开源模型第一。重点在于,它的单任务成本是旗舰模型里最低的,API定价和GLM-5.2持平,权重下周五开源。
一边是“验证能力”往上走,一边是“调用成本”往下压。
这两个变量凑在一起,对OPC创业者意味着什么?
意味着你终于可以认真考虑让AI代码Agent去碰那些“错了代价很大”的活儿了——不只是写个周报脚本、做个表格处理,而是订单系统、库存同步、财务对账、客服工单流转这一类。
但前提是,你得让AI“先验再交”。
开源生态那边也在动。
阿里千问过去6个月全球累计下载量突破30亿次,超过Meta和Google,开源了超过460个模型,生态衍生出30多万个衍生模型。Hugging Face 8月14日的开源模型现状报告把千问列成了开源AI生态里规模最大的基础之一。
Replit则甩出一个动作:推出由GPT-5.6 Luna驱动的Free Mode,让用户不用管token成本,就能把想法变成能跑的软件。OpenRouter同一天宣布和Stripe合并,披露它每天处理来自400多个AI模型、超过10万亿token的调用,服务超1000万开发者。
这些数字背后是一件事:模型的“单位智能成本”在快速下降,分发的管道在变粗。
我个人的判断是,对OPC创业者来说,下一阶段真正拉开差距的,不一定是“谁用了更贵的模型”,而是“谁的AI干活有验证、能接手、可追溯”。
我们自己在舍予AI智能体给老板搭AI战队的时候,对代码类的Agent设了一条死规矩:
不许只回“改好了”。必须附上“我改了什么、我跑了什么、结果是什么”。
去年有个做出海家居的客户,核心痛点是SKU价格改了,库存和利润表没跟上,经常月底发现账面差了一截。我们不是去追最新的模型,而是把他那个“价格更新—库存同步—利润重算”的链路拆开,每一步让Agent给出验证结果再进入下一步。错误率降下来一大截。

这件事让我很确信一点:
模型写代码的能力,已经过了“能不能写”的阶段。现在卡住OPC的,是“敢不敢用”。
而“敢不敢用”的核心,就是验证。
所以今天看到VeriLoop这个开源模型,我心里是有点兴奋的。
不是因为榜单多好看,而是因为它把“验证”这件事做成了一个可以被普通人调用的能力,而且开源。
这意味着你不需要养一支测试团队,不需要等大厂出个企业版方案,你自己就能在本地把“验完再交”这个环节补上。
当然,也别把这款模型神化。官方仓库的下载量只有763次,两个主要社区量化版本分别是16120次和8541次。也就是说,它还处在一个非常早期、非常工程化的阶段。
但这反而是个机会窗口。
那些还在纠结“哪个模型写代码最好”的创业者,大概率还会继续被“表面上修好了”坑下去。
而那些开始把“验证”当回事的人,才有机会把AI从“帮忙写点东西”推到自己生意的核心流程里。
最后说三个建议,给正在做OPC的朋友。
第一,别问AI“能不能做”,先问它“你怎么证明做对了”。把验证当作交付的一部分来要求。
第二,给AI的每步结果加一道“人工可接手的验收口”,不用你懂代码,但你得能看到证据。
第三,关注这类把验证、测试、闭环做进模型本身的开源项目。它们是下一阶段落地场景的底座。
今日适合把你那个“我改好了”的Agent,重新拿出来审一遍。
它到底验过没有?
<sub>本文涉及模型能力、榜单数据与行业动态截至2026年8月20日前后,以各官方发布与公开资料为准;模型表现受部署环境、版本、任务类型影响,具体以实测为准。文中案例与做法仅作参考,创业者请结合自身业务与合规要求独立判断。</sub>