它开始伸手帮你干活了
老读者应该知道,我盯模型新闻这习惯,少说也有两年了。但说实话,大部分新闻扫一眼就过去了。模型又更新了,跑分又高了,多模态又强了,这些词听多了跟天气预报一样,知道个大概就行。
但今天这波新闻,我盯着屏幕看了挺久。
不是哪个模型又刷榜了——虽然确实刷了,Qwen3.8-Max-0902 直接把前端编程榜单 CodeArena 干到全球第一,1691 分,混合价每百万 Token 才 5 美元——而是我突然意识到一件事:
模型开始从"跟你说怎么做"变成"直接帮你做了"。
这俩之间隔着的,可能就是 OPC 创业者最该抓住的那条缝。
先看几个具体的事儿。
Claude 官方宣布,Claude Cowork 和 Claude Code 开始支持后台操作电脑。你把任务交给它,它会像人一样点击、输入、打开应用,你自己该干嘛干嘛去。注意,不是"你盯着它操作",是它自己在后台弄,弄完告诉你结果。
Cursor 更直接,推出 Self-Hosted Machines,让云智能体的工具执行直接落在企业自己的机器上。智能体的推理、规划还在云端,但真正干活的手,伸进了你公司内网的服务器里。
腾讯 WorkBuddy 开放平台上线,首批引入上百家生态伙伴,开放底层 Agent 能力,现场发 9 款联名硬件,30 多个行业应用接入。腾讯那边的说法很有意思:"把 WorkBuddy 打造成 Agent 时代的操作系统。"
操作系统这几个字,放在两年前说,那是讲故事。放在今天说,我信了一半。
还有 Manus,9 月 1 日宣布恢复独立运营,创始团队继续领导,方向定在"更主动代用户完成复杂任务"。宇树员工超 100 元报销都要王兴兴亲自批那条新闻,跟大模型没关系,但放在一起看挺有意思——一边是老板亲自抓一百块钱的报销,一边是 Agent 开始自己动手干活。
这俩画面放一块儿,你品品。
我最近在舍予 AI 智能体这边有个特别深的感受。
之前给 OPC 老板搭 AI 战队,大家问得最多的问题是:这个模型智商多少分?那个模型跑分多少?便宜吗?
这几个月,问题变了。
老板们开始问:这玩意儿能不能接上我的客服系统,半夜自动回复?能不能读我的订单表,第二天早上把异常订单给我列出来?能不能看着我的后台,库存快没了就通知供应商?
看出来没有。
从"它聪不聪明",变成了"它能不能替我干活"。
这个变化,比我预想的快。
今天 Qwen 那条新闻里有个细节我特别在意。它说 Qwen3.8-Max"经编程和专业办公专项后训练",前端编程能力全球第一。注意"专项后训练"这几个字。
模型厂商早就不在拼"啥都会一点"了。他们在拼具体场景里能不能直接上手。前端写代码,办公文档处理,语音转文字,后台操作电脑。每个方向都往"替代人手"上冲。
Gemini 3.8 Flash 这次重点在"高精度语音转文本,面向实时语音交互"。GLM-5.3-Flash 开源,320B 总参数,定价压到 Opus 4.8 的四十分之一。GPT-5.6 登陆 Kiro,主打性价比。Qwen3.8-Flash-Next 开源,训练成本大幅下降。
全是一个逻辑:便宜、快、能落地。
我给 OPC 老板的建议就三条,今天掰开说。
第一条:别再买"工具箱",开始雇"值班的人"。
之前大家用 AI,都是自己打开 ChatGPT 或者豆包,把活儿一件一件喂进去,盯着它出结果。这是用工具箱的思路。你是个木匠,工具箱再好,也得你自己动手。
但工具会自己动了。
现在你要想的是:我公司里哪些活儿,是可以交给一个"值班的人"持续干的?客服回复、订单异常筛查、库存预警、日报生成、发票核验……这些活儿不需要多聪明,但需要"一直在"。
在舍予这边,我们给一个做电商的老板配的是三件事:早八点自动拉全店数据出晨报、售前客服标准话术兜底、物流异常订单每小时轮询一次。老板后来说了句话我记得很深:"我每天到公司先看它给我留的条子,比我自己翻后台快,还比我细心。"
这就是从工具到人的转变。
第二条:关键变量是"它能碰到哪儿"。
模型再聪明,碰不到你的数据、你的系统和你的业务流程,就只是个聊天很厉害的外人。
我在舍予内部有个说法,叫"手伸不进业务里,模型再强也是台问答机"。
今天新闻里 Claude 后台操作电脑、Cursor 让智能体在企业自有机器上执行、腾讯 WorkBuddy 开放 Agent 能力,全是在解决"手能伸多长"的问题。
你选模型,除了跑分,应该问:它能不能接进我的系统?能不能读我的私有数据?能不能在我允许的范围里动手执行?不能执行的话,光输出建议,值多少钱?
我见过太多老板,买了一堆 AI 工具,结果全停在"我问问它、它回我一段话"这个层面。不是工具没用,是手没接上。
第三条:警惕"外包依赖",只买自己的核心动作。
这个提醒是写给所有 OPC 创业者的,尤其是做服务型生意的。
你看英伟达要花 129 亿美元买 Hugging Face,Cognition 估值 470 亿美元要融十个亿。基础设施越来越卷,模型越来越便宜,Agent 越来越能干活。这意味着什么?
意味着你以前靠"人工堆出来的交付",别人用一个 Agent 加一个实习生就能做了。
如果你卖的是"我替你花时间",那这个生意会越来越难。你必须找到那个只有你能做、AI 只能辅助的核心动作——可能是你对某个行业的判断、你跟客户的信任关系、你手里那批别人没有的私域数据。
Agent 能把所有人的执行成本都拉下来,这时候剩下来拼的,是判断、资源和信任。这三样,OPC 老板哪样占了,就往哪样使劲。
再往旁边看一眼。
今天还有条新闻,OpenAI 计划推出新模型 Astra,说它已经达到能自主识别和开发零日漏洞的网络安全能力阈值。先给测试人员用,后续通过 Daybreak Blue 项目开放给审核过的用户,做防御性安全用途。马斯克预告再过十天发 Grok 4.7。

这些"能力太强所以要先设护栏"的消息,老实说,跟大多数 OPC 老板关系不大。
但你要建立这个直觉:模型的能力边界,永远比你以为的往前多走半步。
你现在觉得它干不了的活,半年后它可能就干了。你现在觉得非要人盯着的环节,明年可能就不用盯了。你不用追每一个模型发布,但别把"它现在不行"当成静态结论。
另外一个新闻我想提一嘴,宇树员工说超 100 元报销都要创始人亲自批,高管打分普遍在 1 分及以下,重罚轻奖。
跟今天的大模型新闻搁一块儿看,特别扎眼。
一边是 AI 公司把 Agent 放进操作系统,让机器替你干复杂的活儿;另一边是百亿市值公司的老板还在卡一百块钱的报销。管理模式这东西,跟技术没关系,但它决定了你的精力花在哪儿。
你要是天天被一百块钱的审批拴住,模型再能帮你干活,你也腾不出手来部署它。
OPC 创业者最稀缺的资源不是钱,是注意力。AI 帮你省下来的时间,如果你不拿来想业务、做决策、见客户,那省了也白省。
落到今天这份日报上,我给 OPC 创业者圈了两个真正值得关注的信号。
第一个,阿里 Qwen3.8-Max 前端编程登顶 CodeArena,每百万 Token 五美元。
这个对做技术交付、做网站、做小程序、做前端外包的团队,是直接可以算账的事儿。以前一个前端页面从设计到切图到交互,报价几千块很正常。现在你哪怕不会写代码,让模型专项在这个方向上死磕,五美金的 Token 成本能生成几十个页面。你要算的账是:我的交付时间能压缩多少?我同样的人手能多接几个客户?
第二个,Cursor 把智能体的执行放到企业自有机器上。
这个事儿,做 ToB 服务的 OPC 创业者尤其要重视。很多中小企业客户对"数据上云"这事儿天然抵触。你跟他讲 AI 能帮他自动处理订单,他第一反应是:我数据凭什么给你?现在 Cursor 这条技术路线,等于是给"AI 进企业内网干活"打了个样。你以后跟客户讲方案,可以用这套逻辑跟他解释:推理在云上,执行在你自己的机器里,数据不出你的内网。这个说法,能解决你一半的商务阻力。
这两个信号,一个管"降本",一个管"破冰"。够你忙一阵了。
最后说点实在的。
我干 AI 这行,天天看新闻,容易被信息裹着走。但今天静下来一想,这些模型更新背后就一个趋势:
它从"回答你"到"替你干",就发生在最近这几个月。
OPC 创业者不需要懂每一个模型,不需要追每一次发布。你只需要想清楚一件事:我的生意里,哪些动作应该从"我自己做"改成"我安排、它来做"?
想清楚这个,再去看新闻,看哪个模型、哪个产品、哪个开放平台,能让你的手伸得更长一点。
那时候你会发现,AI 最大的价值不是省了你的时间,是把你从"干活的人",变成了真正拍板的人。
小字提醒:本文提及的各模型能力、价格、发布时间及企业动态均来自截至 2026 年 9 月 3 日的公开资料,模型迭代很快,参数与价格可能随时调整,请以各厂商官方最新披露为准。文中关于模型功能的具体表现基于官方披露与公开评测,实际应用中请结合自身业务场景进行小范围验证。文中涉及的舍予 AI 智能体相关案例与做法为团队内部实践,不具备普适性,仅供参考。投资与选型请自行判断,市场有波动,模型有翻车。