这周智能体模型扎堆,别问哪个最强,要问谁能替你干满8小时
这周智能体模型扎堆,别问哪个最强,要问谁能替你干满8小时
有句话憋了几天,今天直接说。
这周大模型圈子很热闹,但热闹法跟以前不太一样。Meta发了Muse Glimmer,xAI发了Grok 4.6,阿里开源了Qwen3.8-Flash-Next,智谱上线了GLM-5.3-Flash,微软还掏出了自研推理模型MAI-Thinking-1。如果只盯着参数和跑分,很容易觉得这又是一波例行更新,没什么新鲜的。
我不这么看。
关键变量不在模型本身,在于这些新东西几乎全部瞄准了同一个方向:让模型从“回答问题”变成“替你干活”。 这是两个物种的分界线。会聊天的模型,你每天晚上打开问两句;会干活的模型,你给它一个任务,它自己拆步骤、调工具、执行、检查、汇报。后者才有商业价值,前者只是消费品。
对OPC创业者来说,这周最该关注的不是哪个模型跑分最高,而是智能体的“用工成本”和“执行权限”正在同时打开,这意味着你可以认真考虑雇一支AI战队了,而不是买几个API装在应用里当功能点缀。
几个信号,拆开看。
Claude in Chrome这周全面开放给所有付费套餐。这意味着什么?模型可以在浏览器里自主导航、点击、填表单,不需要你一步步审批。官方说每次操作前有安全分类器验证,评测中启用防护后,自Opus 4.8起所有模型都没有出现攻击成功案例。我真正关心的不是它安全不安全,而是它终于拿到“手”了。之前模型只能给你建议,现在它可以替你点按钮。这一步跨出去,大量重复性的网页操作就有了被替代的可能。
Grok 4.6主打长时运行智能体。xAI这次没吹推理多强,而是强调模型能持续执行长时间任务。这个信号很直白:智能体的核心战场不在单轮对话,在持久执行。 你让一个AI写封邮件,三秒钟完事,这不叫劳动力;你让它盯着一个数据源,连续八小时抓取、筛选、归档、异常提醒,这才是劳动力。
阿里开源的Qwen3.8-2.4T-A95B,总参数2.4万亿,MoE架构,每token激活95B。名字长得吓人,但重点不是大,是稀疏架构成了行业共识。大模型不再靠无脑堆参数换能力,而是让不同的token激活不同的专家。这对创业者意味着推理成本还能继续往下压,长任务智能体的经济账越来越好算。
智谱的GLM-5.3-Flash,320B总参数激活18B,定价是GLM-5.3的十分之一,限时折扣内是Claude Opus 4.8的四十分之一。这个数字前两篇我已经详细算过账了,这里不重复。我想说的是另一层:价格差出40倍,意味着“高频调用”第一次有了现实基础。 一个智能体任务链跑下来,可能调模型三十次、五十次,如果每次调用都按Opus的价格算,很多场景直接就死了。价格降下来,调用次数才能涨上去。
腾讯混元那条也值得说一句。Hy-MT2-1.8B端侧翻译模型,压缩到574MB和440MB,在B站直播弹幕实时翻译落地,单条耗时500到800毫秒。这是“零件级”AI的典型样本:模型小到可以嵌进产品里,不用联网、不用云端API,就干翻译这一件事,干得比商业API还好。OPC创业者做垂直场景,这种端侧小模型比通用大模型好用得多。
NVIDIA的Nemotron 3.5 Lightning,30B MoE,速度比上一代快四倍。速度这事被很多人低估了。智能体反复调工具、多轮往返,模型每慢一秒钟,整个任务链就跟着慢,用户体验和成本都在恶化。对执行型AI来说,延迟就是钱。
反方最爱拿来说事的那套,这周又听了一遍。质疑大概是这么说的:
“智能体概念吹了两年了,每次发布会都热闹,真落地没几个。模型再强,一碰到真实业务里的边边角角就露馅。说白了你就是换了个词炒冷饭。”

这事我得认真驳一下。
两年前说智能体落地难,我是认的。那时候的问题不是模型不够聪明,是执行权限没打开,调用成本下不来。模型只能生成文字,不能操作你的浏览器、不能调用你的内部系统、不能持续跑几小时不崩。你说这是智能体,它顶多是个聊天机器人穿了件智能体的马甲。
现在情况在变。Claude拿到浏览器执行权限,Grok主打长时运行,端侧小模型把翻译这种具体任务跑通了,价格降了40倍。智能体落地的三个前提——权限、成本、稳定性——第一次同时出现了松动。 不再是某一个模型吹牛,是十几个模型从不同方向往同一个目标拱。这个密度,是过去两年没有过的。
还有一个细节:腾讯那条翻译模型不是实验室玩具,它已经在B站直播弹幕里跑了,单条500到800毫秒。这个延迟数字跟用户体验直接挂钩:弹幕刷过去,翻译慢了半拍,用户就不看了。落地不是PPT上写的可用,是延迟、成本、误判率这些硬指标全被压到业务能接受的范围里。 这条做到了。
所以你说智能体还没落地?它已经在你看直播弹幕的时候,静悄悄地跑着了。
回到我们自己手上在做的事。
我们在做舍予AI智能体的时候,有一个判断一直没有变:老板缺的不是一个更强的模型,是一支不用他盯着的队伍。 很多人问我们,你们选GPT还是Claude还是千问?这个问题本身问错了。真实业务里,一个任务链往往需要三个模型配合:端侧小模型做清洗,便宜的中模型做判断,大模型做最后一步的复杂生成。哪个环节该上哪个,怎么让它们不打架