智能体开始按小时上班,我们还在按次卖问答

2026-09-18舍予基业来源:公众号「舍予AI智能体」
智能体开始按小时上班,我们还在按次卖问答
从华为全联接大会智能体按小时工作的判断出发,结合中国科大一天上线新模型的案例,讲清企业落地智能体真正缺的是记忆、重试与续跑骨架,以及模型网关和主备路由的工程做法。

昨晚我把华为全联接大会的演讲稿转成文字,截了一张图丢进工作群。

汪涛在台上说,智能体已经可以按小时级连续工作,到2030年将以月为单位执行任务。

群里静了半分钟。然后有同事回了一句:我们客户那个Agent,跑到第三步就弹窗问人。

这半分钟,基本是这周所有消息的缩影。后台攒了四个问题,都挺实在,今天一个个聊。

“Agent按小时干活,这话听着挺大。我那个客服Agent三步就跳出去问人,跟这有关系吗?”

先把台面上的东西摆出来。

华为全联接大会2026,9月17日,上海。汪涛给的几个数:大模型参数正迈向10万亿级,2030年到100万亿以上;智能体已能按小时级连续工作,2030年将以月为单位执行任务;中国每日推理Token涨到约500万亿,2030年是百万万亿级;手机端侧模型从2024年的3B走到今天的30B,未来奔100B。同场还发布了昇腾960超节点,用上NPO光互联,配套的AI记忆存储系统也一起亮相。(来源:华为全联接大会2026,9月17日)

这四个数里,最扎人的不是参数,是“按小时”。

小时是一个劳动单位,不是技术单位。以前我们卖Agent,卖的是“能回答”;现在开始卖“能值班”。中间的差距不在模型智商,在骨架:记忆有没有落盘、工具调用有没有重试、任务断了能不能续跑。参数再大,也补不上这三个洞。

给OPC创业者的建议很土但有用——先测你自己的Agent能连跑多久。不是跑demo,是真给它一个活,看它多久崩。

我们做交付时按“一支战队”来配,而不是一个万能助手:几个各管一段的岗,谁断了谁自己接回来。一个岗撑不住一小时,整支队伍就是摆设。

“科大那个平台,DeepSeek新模型发布第二天就全校上线了,12000人在用。这种玩法企业能抄吗?”

配图

材料很干脆:9月10日DeepSeek发布并开源V4.1 Flash,9月11日中国科大大模型公共服务平台就完成部署、面向全校开放,成为国内高校首个上线该模型的平台。平台靠自建算力加统一模型网关,DeepSeek、GLM、Kimi、Qwen等主流模型做到Day 0(发布当日)上线,支持1M超长上下文。截至9月初,12000名师生在用,日均处理Token超300亿,累计突破14000亿。(来源:中国科大新闻网,9月12日)

很多人看到这条,第一反应是“高校资源真好”。我看的是另一件事:从模型发布到全校可用,中间隔了一天。

这个“一天”,是当下最值钱的工程能力。它意味着模型供给可以被当成水电来调度——今天DeepSeek某个版本强就用它,明天GLM出了新版,切过去不用重写业务。关键变量从来不是模型本身,是中间那层网关。

我见过太多小团队,把业务直接焊死在一个模型的API上,调用散落在十几个文件里。这在过去没问题,现在开始变贵。

建议做两件小事:把所有模型调用收口到一层路由,别让它长在业务代码里;给每个场景写好“主用+备用”两条线。

我们自己给客户做方案,从来不锁模型。合同里会写明主用哪个、备用哪个。不是花

AI 应用智能体企业数字化模型网关

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。