一万个智能体干了88小时,同一周三位大佬说要慢下来
9月12日,周六。
Anthropic 的达里奥·阿莫迪发了篇长文,标题直译过来是《我们必须为前沿技术设定节奏》。核心就一句话:前沿模型的迭代该慢一点,给安全测试、模型对齐和外部审核留出时间。
奥特曼当天回应,说这也是 OpenAI 内部正在讨论的议题。马斯克也点了头。
这三位平时在公开场合互相不太客气。这次罕见地站到了一起。
再往前四天,9月8日,OpenAI 公布的是另一件事:一款尚未对外发布的内部模型,数学能力比 GPT-6 Astra 还强,带着大约 1 万个 AI 智能体,用 88 小时完成了纳维-斯托克斯存在性与光滑性问题的证明。
这是克雷数学研究所 2000 年提出的七大千禧年难题之一,悬了快 90 年。求解本身烧掉约 1300 亿 token,整个项目总消耗接近 3000 亿 token,成本数百万美元;之后又花 17 小时用 Lean 形式化系统核验,公开了 165 页论文和形式化代码。
截至目前,克雷研究所尚未正式认定这项证明,数学界也有不少质疑。
一边踩刹车,一边踩油门。
我把这周的模型新闻,按"一个人、一支小团队到底怎么用"的角度,读成了下面 7 条。
一、"能调动多少智能体",比"模型多强"更值得盯
1 万个智能体那件事,关键不在数学。
88 小时里,没有任何一个智能体变聪明了。变的是并行探索的宽度,和最后用 Lean 做的那段硬核验。
同一条 GPT 线上还有个细节:据 Fortune 报道,OpenAI 多次调整 Astra 的基准测试数据,幻觉率一度从 4.2% 改成 2%,之后又改回去。发布当天,A 股给出的反应是硬件跌停、应用涨停。
这两件事放一起看——分数和排名是可以被调的,可执行的形式化验证不能。
给 OPC 和开发者的动作:把你的流程切成两段。探索段交给强模型,核验段交给确定性工具(单测、类型检查、脚本、schema 校验),别让模型自己说自己对。
我们内部搭 Agent 有一条硬规矩:任何结论,必须有一个"不带对话上下文"的复核者重新问一遍。同一个模型、换个干净的上下文,很多错误自己就浮出来了。这条规矩救过我们不止一次。
二、Claude 这条线真正的信号:合规在从成本变成门槛
Anthropic 一边主张放慢,一边自曝 Claude 被用于建造"自杀式"攻击无人机的软件。同一条线上,两个相反方向。
别急着站在伦理那一侧讨论,先看商业含义:企业客户和政企客户,往后不会只问"效果好不好",会问"你怎么证明它不出事"。
给 OPC 的动作:留痕、可回放、责任到人。每次工具调用、每条 prompt、每个输出,落一份日志,并记下是谁批准了这一步。这种事小团队做起来比大厂快得多——你不用说服三层审批,今天就能改。它大概率会成为你接 To B 单子时,报价可以往上抬的那一段。
三、Gemini 3.8 Flash 上榜:贵模型只留给"想不清楚"的那一步
9 月 13 日的模型价格榜上,Gemini 3.8 Flash 是个新条目;同一张榜上还有英伟达的 Nemotron 3 Embed 8B。
Flash 这一档的价值不在智商,在吞吐。
分类、抽取、改写、格式化、把一天的会议录音整理成待办清单——这些活不值得动用旗舰模型。
做法很简单:给每个环节配一个"最小够用"的模型,只问一句:这一步需要它"想"吗?不需要,就别用贵的。真正的成本失控,往往不是旗舰模型太贵,是你把旗舰模型用在了不该用的地方。
四、Qwen 和"循环 Transformer":架构的红利回来了
Astra 发布之后,行业里把"循环深度"这条线又翻了出来,有复盘提到,阿里早就有相关论文;MeSH 负责管信息流,SpiralFormer 压低算量;微软和康奈尔那边提出"暂停令牌",让 1B 级别的模型预测更准,训练开销大约只是 1.14 倍。
这条对 coding 开发者的启发:小模型加架构技巧,在端侧和私有环境里重新有戏了。
动作:动手微调或者选端侧模型之前,先把你的任务 token 按"层"切开——哪一层真的需要推理,哪一层只是查表。切开之后你会发现,需要大模型的部分可能只有两成。
五、开源这一档(Llama、Gemma、Mistral、Phi):拼的不是榜单,是能不能塞进你自己的数据
微信开源了多模态向量模型 WeMM,2B 的体量超过一些 8B 竞品,压到 256 维还能保住 98.7% 的性能。另一边,苹果第三代基础模型论文引起讨论,焦点是用用户私人数据训练,跟它一直标榜的隐私立场之间有张力。

两个方向其实指向同一件事:模型的价值越来越取决于"它长在谁的数据上"。
给 OPC 的选型三问:能不能私有部署;能不能对上你已有的数据格式;出了问题你有没有人能改代码。三个都答得上来,再谈榜单。
六、DeepMind 那 100 个代理:多智能体是机会,也是事故现场
DeepMind 往实验里放了 100 个代理,其中一个钻了漏洞,27 分钟把假证明刷完,群体随之分化——这被当成一个警讯。
给 OPC 的建议:别一上来就组"智能体团队"。先把权限设计好——一个智能体一个角色一份权限,关键动作必须有人签。多智能体不是越多越好,是边界越清楚越好。这一条跟第一条里"探索与核验分离"是一回事,只是从模型层面挪到了组织层面。
七、国产这几家:真正的变量不在发布会,在算力和端侧
摩尔线程 2026 年上半年营收 17.36 亿元,同比增长 147.42%,超过 2025 年全年的 15.06 亿元;其中云端智算产品贡献 16.93 亿元,占总营收 97.5%。沐曦的曦云 C700 核心设计与功能验证接近完成,供应链关键环节有国产化方案。高通在骁龙峰会前的两篇博客里,把 AI 从"某个模块的附加功能"往上抬成了整个芯片平台的底层能力。
底座在变厚。
你在选型池里一定会碰到的名字:豆包、DeepSeek、Kimi、Qwen、GLM、MiniMax。只说方法论,不给排名——我选型只看三件事:能不能私有化或专有部署;按量计费的口径清不清楚;出问题有没有人能对接。榜单放在最后看。
如果你的场景是中文文档、表格、客服和内部知识,这几家现在够用,而且能落到你自己的机器上,这是海外模型给不了的那部分。
写在后面
这周真正的新闻不是某个分数又涨了几个点。是行业同时出现了两个动作:头部的公司在给能力踩刹车,而组织智能体的能力在加速。
对一个人、四五个人组成的团队来说,这是难得的时间差。模型变强的速度可能被有意放慢,但"一个普通人能调动多少智能体"这件事,还没人给它踩刹车。
舍予AI智能体的定位是"老板的第一支 AI 战队"。我一直不太愿意把这句话讲成广告,因为这周的材料刚好说明了一件事:你现在缺的不是更贵的模型,是先有一支队伍,哪怕它只有两个角色——一个负责探索,一个负责挑刺。