GPT-6控机械臂、Claude加了道审查门——这周的大模型新闻,说的是同一件事
GPT-6控机械臂、Claude加了道审查门——这周的大模型新闻,说的是同一件事
这周大模型圈的新闻不少。但把它们摆到一起,我看到的是同一件事:模型能力已经不稀缺了,稀缺的是“它能不能被装进一家真实公司的流程里”——数据放哪、谁审、错了怎么办。
能力是入场券,边界才是生意。
一、Anthropic这周最值得抄的,不是能力
Claude Fable 5.1 上周在 AWS 上线。Anthropic 自己的说法是,它冲着“长时间运行、影响重大的工作”去的——在长会话里处理整个代码库的功能开发、代码审查、性能优化。
但真正让我停下来读第二遍的是另一段。
Fable 5.1 被指定为“受保护模型”(Covered Model)。数据留存最长 30 天,并且要接受亚马逊人员的人工审查,靠一个新模式 awsreview 实现;原先的 providerdata_share 成了旧模式,Bedrock 不再和模型提供商共享客户数据。再往上,AWS 和 Anthropic 一起做的企业前沿安全防护(EFS),让符合条件的客户在用受保护模型的同时,把数据留在自己控制的云环境里。
这段我看了两遍。它其实把两件事拆开了:模型有多少能力是一回事,模型碰得到什么数据、留多久、谁来审,是另一回事。而且后者可以按客户分层。
对 coding 开发者来说,判断顺序变了,而且变得很实在。你要拿模型去碰生产库、客户资料、财务数据的时候,“这家跑分多少”得往后排,先问一句:它给不给得起一条数据边界。
二、王潜那盆冷水,比那段视频值钱
近日 OpenAI 发布 GPT-6 Astra 之后,一段用模型控制机械臂的测试视频在社交平台流传,“通用大模型将降维打击具身智能”的说法又起来了。
9月10日的外滩大会主论坛上,自变量创始人兼CEO王潜回应了这个判断。他说“智能的本体是存在于数据里面的”,模型更多扮演蒸馏器和容器的角色——训练时提炼数据里的能力,部署时承载这些能力。
后面几句更值得记:
- 编程能力的成功不是从对话能力里长出来的,它靠的是大量编程数据和更完善的数据、验证体系;
- 数学能力没有随编程能力自然增强,两者在训练里甚至可能互相干扰,得分别训专家模型再融合;
- 视频生成已经做得很好,也没自然转化成机器人动作控制的优势。
然后是那句我认为最该被一人公司抄走的:GPT-6 控机械臂这件事,验证了“通用数据预训练是有效的”——过去大家担心预训练阶段加入大量通用数据反而有害,Astra 说明这条路有价值。
翻译成做生意的语言:能力不会从别处自动泛化到你这里来。你手里有多少别人拿不走的数据和验收标准,你就有多少护城河。
这正好对上我们自己的做法。舍予AI智能体给客户搭“老板的第一支AI战队”时,第一个月基本不碰新模型,只干一件事:把客户手上跑得最勤的那条流程的口径统一了——输入是什么、输出长什么样、谁来判定这次跑得对不对。口径没统一之前,换什么模型都是浪费钱;统一之后,一个中等模型的稳定产出,就能顶掉一个人的杂活。
三、榜单洗了一遍,大盘其实只涨了1.77%
据《每日经济新闻》引用 OpenRouter 的数据测算,8月31日至9月6日这一周,全球大模型总调用量 115 万亿 Token,周环比只涨了 1.77%。中国大模型的周调用量连续十九周超过美国,维持全球第一;当周前五名里有四款是中国模型。
榜首是腾讯混元 Hy4 preview,单周 14.7 万亿 Token,环比暴增 379%。同时排名出现明显洗牌,此前一周排在第三的小米 MiMo-V2.5、排在第九的 Google Gemini 3.7 Flash,名次都变了。
一周涨 379% 的模型,是从谁碗里拿走的份额?大盘只涨 1.77%,答案是:从别人碗里拿的。
这对开发者的含义很直接——切换成本已经低到以周计。谁家性价比掉队,用户当周就走,不留情面。
四、驳一句饭桌上最常听到的话:“模型都差不多了,等降价就行”

这句话我每周至少听一次。漏洞有两个。
第一,趋同的是“平均分”,不是你那条流程上的分。王潜讲得很清楚:编程、数学、视频生成、动作控制各吃各的数据和验证体系,还会互相干扰。你的业务只落在其中某一条窄赛道上,通用榜单的排名对你几乎没有预测力。你看到的“差不多”,是别人平均出来的。
第二,就算能力真的一样,你也搬不动。Fable 5.1 那个“受保护模型”的分类就是例子:同一个模型,不同客户拿到的留存策略、审查方式、部署边界完全不同。你能换的是模型,换不掉的是围绕它长出来的那一整套约定。
至于等降价——只有没有差异化的东西才只降不涨。真正在涨价的是数据管道和验证能力,那部分从来不打折。
五、这一周的名单,13个品牌,我在盯什么
先把话说在前头:下面只有前三条是这周有公开新料的,其余几家我没有可核实的新动作,不给你编。我只说该盯什么。
GPT:Astra 的多模态加机器人数据能控机械臂,但别指望它自动帮你重构代码。给 coding 开发者的动作是:先把回归用例和验收脚本写出来,那才是你能喂给模型的第一批私有数据。
Claude:Fable 5.1 上 AWS,受保护模型、30天留存、人工审查、EFS。另外 Anthropic 最新报告把“模型输出成为竞争资源”这件事摆上台面,相关报道里美方点名六家中国公司指其“工业化蒸馏”。谁对谁错我不判断,但做产品的人要清醒:你把某家模型的输出沉淀成资产时,它的归属和合规风险迟早有人来问。选型第一个问题应该是“我的数据留在哪”。
Gemini:这轮榜单里 3.7 Flash 名次也变了。给一人公司的建议很简单——架构上留一层薄薄的适配层,别把业务绑死在一家。
Grok:据公开资料,它和 X 平台深度绑定,实时信息是主场。做舆情、选题、内容分发的 OPC 值得盯,它可能比你雇的个人更快发现风向。
Llama:开源权重这条线上的老供给方。客户是工厂、医院、政务这类不能出门的数据,私有化部署就是门槛,也是你的报价理由。
Mistral:开源加欧洲