模型开始“自己管自己写出来的代码”了

2026-08-20舍予基业来源:公众号「舒毅讲AI」
模型开始“自己管自己写出来的代码”了
清华开源模型VeriLoop Coder-E1让AI写代码后自动验证、改错再交付,在SWE-bench Verified达85.20分,帮你降低交付风险并理解国内外代码模型最新格局。

老读者可能发现了,我最近不太爱聊“哪家又刷榜了”这种话题。

不是榜单不重要。是过去这大半年,开源模型的分数涨得比深圳的房租还快,今天你第一,明天他第一,看多了容易麻木。

今晚想聊一件我盯了挺久、觉得真正值得你花时间琢磨的事:模型开始管自己写出来的代码了。

不是“写代码”,是“管”。写、验、改、再验、最后才交。这套我们过去逼着实习生练了半年才能上手的工作流,现在模型自己跑起来了。

这事往前倒两天,清华深圳国际研究生院开源了一个代码模型,叫 VeriLoop Coder-E1,中文名“循证”。名字起得挺冷,但思路很热。

它的核心就一句话:不让AI闷头写代码,每一轮生成的代码都得过测试,通过了算数,通不过就自己分析原因、改、再验,直到产出可靠代码。在 SWE-bench Verified 上拿了 85.20,35B 以下开源模型里排第一。官方仓库下载量只有 763 次,但社区量化版本一个就跑了 16120 次。

这个细节很有意思,待会展开说。

先说我最近观察到的一个变化。过去我们做AI编程,有个隐藏的误区:大家默认模型生成代码、人来负责验证。验证这活儿,又费神又容易被低估。上周跟一个做跨境电商的朋友喝茶,他说他们技术合伙人跑去做独立站,一个人扛前端后台数据,结果三分之二的时间不是在写功能,是在追一个“为什么昨天还好的今天垮了”的bug。我那会儿就给他看了一个数据:Replit 最近开了个 Free Mode,由 GPT-5.6 Luna 驱动,用户不用考虑 token 成本就能把想法变成能跑的软件。它的卖点不是“能写”,是“能先跑起来,再切换到更强的模型去推理”。

这本质是什么?是让验证成本先降下来,让“先做再验”的循环先转起来。

OpenAI 这条线最近动作不少。除了 Replit 用的 GPT-5.6 系列,还有个细节:OpenAI 启动了一个新计划,强化国家安全领域 AI 的民主监督。这事放在普通开发者眼里可能觉得远,但你如果做的是面向政府、军工、安防的解决方案,它的信号意义得留心,后面合规的门槛大概率是往上走,不是往下。

另一端,Anthropic 这周的动作值得你划重点。Claude Code v2.1.236 加了一个环境变量,ANTHROPICDEFAULTMODEL,新会话默认模型可设,/model 选择还能跨重启保留。单看这条新闻没什么感觉,但结合另一条看就有意思了:Anthropic 因为担心即将推出的 Astra 模型可能达到“关键网络安全能力阈值”,主动放慢了模型扩展速度,停了两周强化学习训练,还加强了工作负载隔离和思维链监控。

一家做AI安全的公司,在安全这事上把自己管得这么紧。这说明什么?说明模型能力到了某个临界点之后,真正的瓶颈可能不在“能不能更强”,而在“更强的同时怎么管得住”。

这个判断放到你自己的产品里也是一个道理。你给客户交付的AI工具,如果只能证明“它很能写”,客户还是会犹豫;但如果你能证明“它写错了自己知道、改完还验证过”,成交的阻力会小很多。

说完海外的,说说国内的。

千问这条线,最近有个挺硬的数据。阿里巴巴官方说,千问过去6个月全球累计下载量超过30亿次,超过Meta和Google,成为全球第一。开源家族超过460个模型,衍生出30多万个衍生模型。Hugging Face 8月14日的开源模型现状报告也认了这个数,说千问成了开源AI生态里规模最大的基础之一。

3900亿参数的Qwen3.5,2月发布那会就在推理、编程、智能体上全面压过Qwen3,还支持201种语言。对OPC的创业者来说,这个信号很直白:开源底座的地位已经稳了。你不需要再纠结“用哪个开源模型打底”这件事了,需要纠结的是,你怎么在它上面长出别人搬不走的活儿。

再看GLM。GLM-5.3 API这周上线,官方说它擅长复杂编码、防御性网络安全和长程任务,在AA综合智能指数上拿60分,和Claude Fable 5、GPT-5.6 Sol同级,和Kimi K3并列开源第一。更关键的是那句话:“单任务成本为旗舰模型中最低,API定价与GLM-5.2持平,权重下周五开源。”

成本持平、能力跳档、还要开源。这意味着什么?意味着你以前不敢在项目里上旗舰级能力的,现在可以算了。以前一个长程任务要精打细算token,现在能放开一点跑。

MiniMax和Kimi,这周没有单独的重磅发布,但都被清华那份基准评测的对比名单点了名。VeriLoop 那篇论文里,把自己的成绩和 DeepSeek-V4-Pro、MiniMax-M3、GLM-5.2、Kimi-K3、Qwen3.6-27B 放在一起比。这说明这几家已经成了国内开源代码模型的默认参照系。你做技术选型,这五家就是你现在绕不开的基本盘。

DeepSeek 这边,我觉得真正值得关注的是那条论文研究:有人针对1.6万亿参数的 DeepSeek-V4-Pro,在 H20 上做场景化服务配置,单节点跑到 271 output tokens/s,和 B300 的 383.7 tokens/s 差距缩到 1.42倍。

这条新闻表面上是性能调优,骨子里是一个非常实际的问题:在紧张的算力供给下,怎么把手里这批卡的吞吐榨出来。对预算有限的创业者来说,这不就是你自己每天都在算的账吗?你做AI应用,最大的成本不是模型订阅费,是GPU和推理时延之间的平衡。这类论文不看,你永远以为自己得花大价钱买B300才能撑起体验,其实H20调一调也能跑出能用的效果。

谷歌 Gemini 这条线,这周的亮点在应用侧。Google 在搜索里推了5项AI学习工具,AI Mode 的生成式UI全球上线英文版,支持交互式可视化和自定义模拟,练习测验覆盖ACT、SAT这些标准化考试。这个信号对教育赛道的创业者尤其重要:巨头开始把AI能力往高频学习场景里塞了。你还在做“拍照搜题”这种工具,再不往个性化模拟和交互式训练上转,很快会被免费功能包掉。

Llama、Mistral、豆包、文心一言、星火、Gemma、百川、Step、Phi、Yi、Skywork 这周没有值得单独展开的新动态,我不硬凑。没消息就是没消息,硬编一条新闻出来糊弄你,是对你时间的不尊重。它们该有的底线能力都摆在那,我的建议是不用天天盯单个模型的新闻,而是要盯你那个场景里,哪一个模型突然发生了一次成本或验证能力的跳变——那才是你需要切进去的时候。

配图

好,回到开头那个数字:763次官方下载,16120次社区量化下载。

这个对比太真实了。它说明现在真正吃开源红利的人,早就不去官方仓库下原版模型了。大家要的是那些能塞进本地推理工具、能在自己那台算不上顶配的机器上跑起来的版本。

这对OPC创业者意味着什么?意味着你的护城河,不在“我能下载到某个模型”,而在“我能把一个大家都能下的模型,调成别人不会调的形态,再配上我自己的验证链路,交付成一个客户肯付钱的结果”。

这也是我们“舍予AI智能体”在做的事。我们给自己的定位是“老板的第一支AI战队”,听起来像句口号,但落到具体业务上就一句话:我们帮老板把那些原来的“等待验证”的时间,压掉。

举一个真实的例子。我们给一家做农贸供应链的老板搭过一套对账流程。他们的历史遗留问题不是没人干活,是单子来了、数据改了、人没同步,月底一对账,几万块对不上,排查得一整天。我们建的方案,核心不是“自动生成一份漂亮的对账单”,而是让每一笔账在生成之后,必须回原文里再验一遍,账和源数据对不上就自动报警。老板后来跟我说,他第一次在月底打开系统,看到“差异处已经定位到具体单据跟备注为空”这几个字,差点给咖啡打翻了。

那个场景我们调的不是最强模型,是验证做得最稳的模型。这也是我对今天AI编程的一个基本判断:能写代码的AI不稀奇,能“验完再交”的才要命。

这个方向,国内国外都在加速。清华的循证模型、 Anthropic 的自我设限、GLM 的成本下探、千问的生态覆盖、DeepSeek 的算力榨取,说到底都在往同一件事上靠:让AI从“能写”走到“能负责”。

你如果还在给客户报方案,说“我们接入大模型,可以自动写代码写文案”,对方大概率左耳进右耳出。

但你换一种说法:“这个AI写完的东西,它自己会先验一遍,错的地方自动回退修正,最后交给你的,是它自己验证过几遍的结果,你的人工只做抽检。”这一句的分量,完全不一样。

这就是今晚想跟你分享的全部。不宏观,不画饼,就是几条我盯了一周的模型动态,加一个我认为接下来最值得押注的走向——把“先做再验”这套纪律,做成你产品里的默认动作。

AI编程开源模型代码验证技术选型

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。