写给做一人公司的朋友:AI终于开始“先做再验”了,这比刷榜更值得你关注

2026-08-20舍予基业来源:公众号「舍予AI智能体」
写给做一人公司的朋友:AI终于开始“先做再验”了,这比刷榜更值得你关注
清华开源模型VeriLoop Coder-E1把代码生成变成先测试、再修正的闭环,对一人公司和小团队来说,AI从生成答案走向验证答案,能直接降低交付翻车率。

老读者都知道,我平时看模型动态,不太盯着榜单起哄。榜单上谁第一谁第二,热闹几天就过去了;真正值得关注的,是那些能改变“活儿怎么干”的变化。

今天想跟你聊一个开源代码模型,清华深圳国际研究生院刘厚德、王立博团队放出来的 VeriLoop Coder-E1,中文名叫“循证”。名字起得挺文气,但做的事很实在——它写代码,不是闷头写、写完拉倒,而是每一轮生成的代码都要先跑测试,通不过就分析原因、改、再验,循环到产出可靠代码为止。

官方给的数据是:SWE-bench Verified 得分 85.20,SWE-bench Pro 62.38,Terminal-Bench 2.0 76.40。在 32B 及以下开源模型里,前三项拿了第一。这个成绩放在一堆几百亿参数的大块头中间,其实不算炸眼,但它的思路让我多看了几遍。

我先说它为什么对你有用。

咱们做一人公司、小团队的人,最怕的不是AI不会写,是AI写出来的东西“看着像那么回事,一跑就崩”。你不可能像大厂那样养个测试团队,更不可能一行行去审它生成的代码。这时候,“会自己验证、自己改”的模型,就是一个关键变量。

它不是把代码生成当成一次性的文本输出,而是把生成、测试、反馈、修正做成一个可持续的闭环。这个思路,值得每个正在用AI做交付的OPC创业者盯着看。我们自己在舍予AI智能体做项目时,也踩过类似的坑:早期给客户搭自动化流程,AI生成的脚本第一版能用,一旦客户数据格式稍有变化就翻车。后来我们把“验证关卡”前置,让每一版交付都先过一遍自检脚本,翻车率降了一大截。清华这个循证模型,等于是把这套逻辑直接做进了模型本身。

说完这个,今天还有几条消息值得你扫一眼,我按对OPC的影响程度从高到低说。

阿里千问的下载量突破30亿次。 据Hugging Face在8月14日发布的报告,过去六个月千问模型家族全球累计下载量已经超过30亿次,超越Meta和Google,成了开源AI生态里规模最大的基础之一。阿里巴巴方面说,千问已经开源了超过460个模型,生态里衍生出30多万个派生模型。

这件事的启发在哪儿?开源模型的“装机量”已经大到一定程度了,真正稀缺的不再是模型权重本身,而是“基于这些模型做出来的、贴着自己业务场景的最后一公里”。下载量30亿次跟你没关系,但你用它调出来一个能把你业务里最耗人的那步省掉的专用小工具,就有关系了。

GLM-5.3的API上线了。 根据AIHOT的日报,这个模型擅长复杂编码、防御性网络安全和长程任务,在AA综合智能指数里拿了60分,跟Claude Fable 5、GPT-5.6 Sol这些闭源旗舰同级,同时和Kimi K3并列开源模型第一。比较有意思的是它的定价:单任务成本是旗舰模型里最低的,API价格跟GLM-5.2持平,权重下周五开源。

我看到这条的第一反应不是“又出一个强模型”,而是“前沿智能的门槛在往下压”。对OPC创业者来说,调用成本低、权重要开源的模型,意味着你可以在不大改架构的前提下,把之前因为贵而不敢上的推理环节补上。很多小团队做产品,卡在“这一步要调用强模型但成本扛不住”,GLM-5.3这类选手出来,是在帮你把成本曲线压下去。

Claude Code更新了一个小功能。 v2.1.236新增了一个环境变量 ANTHROPICDEFAULTMODEL,可以设新会话的默认模型。这功能小到几乎不值得报道,但我觉得它反映出一个方向:编程工具正在把“模型可配置”这件事做得越来越细。你以后可以默认用便宜的模型跑日常小活,碰到硬骨头再手动切到强模型,而不是每次打开都默认给你最贵的那档。省钱这件事,很多OPC创业者比我敏感,不用我多讲。

OpenRouter和Stripe合并了。 这条消息放在平时我可能不会特别提,但今天值得说一句。官方数据是OpenRouter现在每天处理来自400多个模型的10万亿以上token,服务超过1000万开发者和公司,推理量每年至少增长10倍。合并之后,它继续以原名独立运营,产品和路线图不变。

配图

我关注的是那个“400多个模型”。这意味着什么?意味着模型本身正在变成一种可以随时切换的基础设施,你的产品不该绑死在任何一个模型上。对OPC创业者来说,把自己的业务逻辑跟模型解耦,是比选择哪个模型更重要的长期决策。

Anthropic暂时放缓了模型扩展。 原因是OpenAI-Hugging Face事件和即将推出的Astra模型可能触及“关键网络安全能力阈值”。他们暂停了最新模型两周的强化学习训练,同时加强了研究环境的安全要求,包括工作负载隔离、网络隔离、持续安全测试。

这条放在最后,是因为它对大部分OPC创业者的直接影响不大。但它是个信号:前沿模型的能力正在逼近监管和安全的敏感区,这意味着“模型层”的不确定性在增加。你的业务越不依赖某一家模型,抗风险能力就越强。这不是技术判断,是商业判断。

还有一条关于DeepSeek-V4-Pro的,我简单带一下。LMSYS团队在H20 GPU上做了场景化服务配置,单节点能跑到271 output tokens/s,跟B300的383.7 tokens/s差距缩小到1.42倍。这件事对国内有硬件约束的团队有参考意义:不一定要上最新的卡,把手里现有的卡调好,也能逼近高端卡的性能。

今天聊的这几条,如果只让我记住一件事,我会选清华那个“循证”模型的名字——不是因为它分数多高,而是因为它代表了一个方向:AI开始从“生成答案”走向“验证答案”。这个转变,对一个人、一台电脑、十几个客户的小公司来说,比任何榜单之争都更实在。

你手里的活儿,有多少是AI干完了你不敢直接交付、还得自己再验一遍的?那个“再验一遍”,就是下一个能被模型吃掉的东西。

<span style="font-size: 12px; color: #999;">小字提醒:本文提到的模型评测分数均来自各团队在Hugging Face等平台的公开发布数据,其中部分为团队自报结果,横向可比性有限;实际接入生产环节前,建议在你的自有业务数据上做A/B验证。另外,开源权重不等于可以无限制商用,使用前请逐条核对各模型的许可证条款,尤其是涉及模型输出用于客户交付的场景。</span>

AI 应用一人公司开源模型代码生成

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。