当阿里和百度开始往自家产品里装对手的模型,OPC的规则已经变了
这行有个认知惯性:总觉得模型再强一点,事情就能再顺一点。参数、Token、推理速度,一年前在死磕,现在还在死磕。
但8月14日发生了件更值得琢磨的事:千问办公上线了智谱GLM-5.3和DeepSeek V4 Pro,用户能在产品首页的“前沿模型”档位直接选用。同一天,百度文库网盘那个通用智能体GenFlow正式启用中文名“库库AI”,推出独立桌面端,模型池里同样塞进了DeepSeek和智谱GLM。
这不是什么技术突破,但比技术突破重要。
腾讯WorkBuddy、字节TRAE Work早就这么干了。从腾讯、字节到阿里、百度,国内头部办公Agent不约而同走向了模型聚合。翻译一下:大厂自己,不再把“独门模型”当护城河了。他们开始把自己当成调度层。
这个信号,很多人没看懂,或者看懂了没敢说。今天说透一点。
OPC的护城河,早就不在模型上
Anthropic第二季度营收超过115亿美元,同比增长1361%。涨这么猛,不是因为Claude忽然变聪明了多少,而是企业客户开始为“能交付完整任务”的智能体买单。模型能力兑现成了任务完成力。
另一边,GPT-5.6的多智能体V2版本上线了,主Agent能把子任务自动委派给不同的模型,每个子Agent还能单独设置推理强度。Codex同步更新。连OpenAI都在把重心从“单个模型有多强”,挪到“多模型怎么协同”。
再看智谱的ZCode升级:加入Goal、子智能体和手机远程控制,官方措辞是“AI编程开始从对话写代码走向任务交付”。
注意这个词:任务交付。不是代码生成,是交付。
模型可以写代码,但任务交付意味着你告诉它要什么结果,它自己拆解、自己调度、自己验证,最后把能用的东西给你。这中间的差距,就是OPC创业者真正该卷的地方。
有人说:模型还不够聪明,现在做编排太早
这个说法我听过太多次。逻辑大概是:模型还老犯错,你让它拆任务、调度其他模型,错得更多。还是等模型再强几代,做编排才稳。
所以我去查了眼前这些模型实际能做到什么程度。摆几个事实。
一个独立开发者拿GPT-5.6做带界面的图片压缩工具,从需求分析、架构设计、写代码、写测试用例到修Bug,全流程一个模型包揽。这个任务人工干要一天,GPT-5.6 Sol用了不到2小时,交付了能直接用的成品。
Mythos 5被定向放给网络安全机构做审计,从代码审计、漏洞定位到构造攻击载荷的全链路都能自主完成。从预览版亮相至今,已经识别出超过一万个高危及以上级别的软件漏洞。
Grok 4.6追平了GPT-5.6 Sol的性能,成本却低了六成。这不是“以后会便宜”,是现在就已经便宜了。
三件事连起来读,结论很清楚:模型在“聪明”这件事上,已经跨过了“能交付任务”的门槛。现在最大的瓶颈不是模型不够smart,而是你没有一个稳定的协作层,把不同模型的效率压到最实在。

Qwen3.5那套东西,指向的是同一个未来
有老板会问:你说的“编排”,是不是就是接个API、把几个模型拼起来、背后自己写点路由规则?
如果这么理解,低估了这件事。
Qwen3.5的公布里有个细节值得关注:参数量397B-A17B,采用门控Delta网络与稀疏MoE结合,在数T多模态token上做早期融合训练,推理、编程、智能体、视觉理解全面超越Qwen3和Qwen3-VL。说人话就是:它一个模型里面,已经在内部做“多职能调度”了。不同专家模块共享一个主干,根据任务性质来激活。
这和GPT-5.6多智能体V2、ZCode的子智能体逻辑是一样的:本质都是把“一个大模型包打天下”的想法拆掉,换成“一组模块按需协作”。
所以别把模型聚合当简单的功能拼接。它本质上是团队协作结构的重塑。
我们自己在舍予AI做“老板的第一支AI战队”,就是这个思路。“第一支战队”不是说给你一堆AI聊天框,而是说:你的一个需求进来,内部要有一组角色去拆解——哪个模型做方案、哪个模型校验、哪个模型落地成能用的东西,中间怎么回退、怎么兜底。这些逻辑,得有人替你搭好。
我内部有个说法叫“模型阵容管理”。不是接了API就完了,而是要清楚每个模型在什么任务上稳定、什么任务上会飘,然后一套自动验证机制在模型版本更新的时候重新跑一轮。GPT-5.6 Sol这周强,不代表下个月还是它强。有些厂商偷偷升级模型,原来的API行为就变了,你都不知道。
这个动作不大,但决定了