一万个智能体跑了88小时,OpenAI交卷没领奖——这份作业,小团队能抄哪几行

2026-09-23舍予基业来源:公众号「舍予AI智能体」
一万个智能体跑了88小时,OpenAI交卷没领奖——这份作业,小团队能抄哪几行
OpenAI用一万个智能体88小时攻关千禧年数学难题,真正可抄的是分组并行、阶段换战场、专人收口与带验证交付的组织方法,小团队照做即可提升协作产出质量。

9月8日,OpenAI发了一份声明。很短,信息量很大。

一个比GPT-6 Astra更强、还没公开的内部模型,拉起了大约一万个AI智能体,跑了88小时,给出纳维—斯托克斯方程存在性与光滑性问题的解答。论文式证明同步公开,Lean形式化验证代码也一并放了出来。

这道题是克雷数学研究所七道千禧年难题之一,悬赏100万美元。OpenAI说,不领。

然后数学界的争议就来了——结论仍待独立检验。

很多人看到这条新闻的第一反应是"AI又攻克人类难题了"。

我看到的不是这个。我看到的是一个组织样本:一万个智能体,88小时,一个收口的人,两次战场切换。这套东西才是能抄回家的。

先把背景摆清楚

纳维—斯托克斯方程描述流体运动,存在性与光滑性是它最硬的那一块。2000年克雷数学研究所公布七道千禧年难题,这是其中之一。26年过去,无数数学家在上面耗过。

传统解法是:一个或几个顶尖数学家,朝一个方向推,推到卡住为止。慢,而且赌运气——方向错了,前面的时间全废。

这次换了个打法。

它具体做了什么

材料里的描述很克制,但几个动作是清晰的。

分组并行。 约一万个智能体,不是排成一队干活,是被分成若干组,各自尝试不同题面方向。注意,是"不同题面方向",不是"同一个任务切十份"。这个区别很关键——前者是探索,后者只是加速。

先啃一个能啃死的口子。 近100个智能体先花约50小时,证明了无外力欧拉方程存在有限时间奇点。这一步不是主目标,是探路。它验证了方法走得通,也攒下一批中间结论。

换战场。 把资源从欧拉方程转到纳维—斯托克斯。

这一步是我最服气的。多数团队不是死在能力上,是死在"舍不得换方向"上。

收口。 由Codex汇总各组思路,交叉推进。

交付带验证。 不是丢一个结论就完,是同步公开论文式证明和Lean形式化验证代码。代码意味着什么?意味着别人可以拿去跑一遍,自己验。

结果账面上是什么

一个解答,一份公开的验证代码。

争议也在这儿:数学界有不同声音,结论待独立检验,OpenAI自己也没去领那100万。

我倒觉得,这种"给结论但不要求你别问"的姿态,比结论本身更有价值。真正值钱的是那套组织方式跑完了一整轮——从分组、切换、汇总到形式化验证。

换成一个一人公司,能抄哪几行

第一行:先找个收口的人。

一万个智能体再能干,最后是Codex在汇总。没有那个收口的角色,一万个输出就是一万份垃圾。

我们内部排任务的时候有个习惯:先定谁是那个收口的,再决定开几条线。顺序反了,产出就是一堆看上去都对的草稿,谁也不敢用。

第二行:分组按"方向"分,别按"份数"分。

同一个任务切十份,那是当体力活用。分出不同题面方向,那是当研究团队用。

做选题、做方案、做客户分层,都适用:让每组试一条路,最后比较,而不是让十个人写同一个东西的十个版本。

第三行:阶段性给自己换战场。

先证欧拉,再打纳维—斯托克斯。这个顺序不是随便定的,是先用一个能被验证死的小切口把方法跑通,再扑最难的那块。

小团队直接all in主线,通常死得没有回响。

第四行:交东西的时候附上"怎么验"。

Lean形式化验证代码就是这层意思。你给客户的方案、给团队的结论,如果能带上"你可以这样验一遍",信任成本会低一大截。这一行现在就能抄,不花钱。

配图

第五行:别急着开发布会。

手握结论,不领奖,公开说待检验。这是留后路,也是留信誉。小团队最容易犯的错,是把还没验证的东西先喊出去,后面收不回来。

再补一句成本。一万个智能体跑88小时,听起来像天文数字。但那不是一万个顶配模型在烧钱,真正的开销在编排和调度上。

吃钱的从来不是"多开",是"没人收口"导致的返工。

这两天还有几条,值得记一笔

  • Kimi K3落地亚马逊Bedrock(9月21日确认)。月之暗面确认AWS旗下Amazon Bedrock接入开源模型Kimi K3,全球企业开发者可直接调用,此前传的收入分成合作正式落地。Bedrock是Anthropic和OpenAI重要的云渠道。对一人公司来说,这里真正要看的是"分成"这两个字——人不出海,也能让别人替你卖。
  • 小米一晚发了三样(9月22日至23日)。全模态旗舰MiMo-V2.6-Pro、高效推理MiMo-V2.6-Flash,加上平头哥新一代AI芯片真武V900。芯片算力约为上代M890的三倍,单集群可扩展至50万张加速卡。MiMo-V2.6系列的预训练架构和参数规模与上一代持平,提升落在编程、设计、研究上。另外罗福莉直播小米大模型训练,每小时烧钱逾24万。

"参数没变,能力变了"——升级未必等于换更大的底座。

  • 中国大模型周调用量是美国的4.7倍(9月21日)。OpenRouter数据:9月14日至20日全球总调用量129万亿Token,环比增长1.57%,中国大模型连续二十一周领跑,DeepSeek V4.1-Flash登顶,环比增长219%。量在这边,你的落地场景大概率也就长在国内生态里。
  • 讯飞星火X2.5发布,基于全国产算力全流程训练。做政企、做信创方向的团队,这是个硬信号。
  • Cognition AI估值480亿美元(9月8日)。AI编程智能体Devin的母公司完成20亿美元E轮,自5月上一轮起,年化收入从4.92亿美元增至近9亿。编程这条赛道,资本还在加注。

说回那支队伍

我们做舍予AI智能体的时候,一直把"老板的第一支AI战队"挂在嘴边。不是给老板配一个更聪明的问答框,是配一套能自己分工、自己收敛的班子。

OpenAI这一万多个智能体干的事,说到底就是这个——不是模型突然变神了,是有人把一支队伍组织起来了。而组织这件事,从来不需要一万个人才能开始。

一百万美元的奖金没人领,但那份作业已经摊在桌面上了。


本文所涉事件与数据均来自公开报道及厂商披露,截至2026年9月23日,不构成投资或采购建议。模型版本、定价与可用性随时可能调整,接入或下单前请以官方页面为准;AI生成的数学证明、法律与财务类结论仍需人工独立核验。

AI应用智能体协作小团队经营组织效率

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。