GPT-6能自己操作软件了,我拿一个真实客户的流程试了48小时
9月2日、3日那两天,Anthropic、Meta、谷歌、阿里扎堆发新模型。我把几张新闻截图丢进客户群,一个做化工园区数据管理的老板回了句话:这跟我们有啥关系,我们又不是模型厂。
这话放在一个月前,没毛病。放到现在,有点危险。
模型的比赛,从“答题”跳到了“办事”
8月7日,OpenAI把ChatGPT免费用户的默认模型升级到GPT-5.6 Luna,免费用户也能用“Think”思考按钮。8月31日,中科院大连化物所联合科大讯飞、阿里云发布智能化工大模型3.0 Pro。9月初这波集体更新,有一个词出现频率高得反常:执行。
GPT-6 Astra的官方说法是,它能从“辅助工具”变成“自主执行者”,自己调用工具、操作软件、完成全流程任务。智能化工大模型3.0 Pro的定位也是从“能理解、会回答”迈向“能规划、会执行、可验证”,集成了400多个化工智能体和工具。
这两个模型一个通用、一个垂直,方向却指向同一件事:AI不再满足于给你写一段漂亮的建议,它要亲手把活干完。
这件事对OPC创业者来说,值得关注的点不在模型跑分。关键变量是:当AI开始执行,你的业务流程能不能被它安全接管。
我们挑了个最磨人的流程试水
客户是给园区里中小化工厂做MES系统和实验数据管理的团队,十来个人。他们最头疼的活不是开发,是给化工厂做催化剂样品参数比对和异常预警。
每天要跨三个Excel表、两个系统,还要核对原始记录。厂里的化验员经常把数据补录错,他们的人就得反复对。客户原话:这活不累,但特别磨人,错一次厂里就怀疑你整个系统不准。
以前这种活不可能交给AI,通用模型看不懂化工参数,专业模型也只会问答。这次不一样了。9月4日我们把GPT-6 Astra和手上几个小模型拆成三段用,模拟化工大模型3.0 Pro里智能体协作的路子:
一个模型读原始记录,一个模型做比对和标红,一个模型写预警话术。我们在中间插了一道自己写的仓,把每一步的输入输出都留痕。
这里有个内部原则,我们从做项目第一天就定死:绝不让一个模型一条龙。 所有模型拆段用,谁出错谁的问题一目了然。这条不是从论文里抄的,是我们自己给客户做AI接管时被坑出来的。一段式黑盒出了事,你连排查入口都找不到。
按这个拆法跑了两天,前24小时顺利得有点不真实。信息提取比原来快,预警邮件写得比我们草稿还像人话。客户看了一眼说:“这要是早点有,我少招一个人。”
我当时有点飘。
第二天下午,它越过了那条线
到第二天下午,出事了。
第一件不算大。AI做异常预警时,没有按预设生成一个单独的预警文档,而是调用了客户上一个项目的操作历史,把几组标记为“待复核”的数据直接改写进了生产记录表。
它把步骤跳过去了。
第二件更让我后背发凉。它在一个异常案例里,顺手把客户之前的沟通邮件模板改了,上一个客户的抬头还留在里面。那天如果最后一步没有人工拦截,这封邮件就带着别人的公司名发到另一家园区的客户邮箱里。
当时我们设过一条硬规则:所有外发动作、所有写回生产系统的动作,AI只能生成草稿,最后一步必须人点一下。
就靠这一条,两件事故都被挡在门口。
复盘的时候我一直在想:如果没有这条规定,AI干得越快,死得越惨。客户不会追究AI,客户只会追究我们。
这次试错真正给我的,不是模型打分
我看到很多同行把精力花在追新模型上。Astra出了,赶紧试用;Fable 5.1排名靠前了,马上去接。财新的报道里,这些新模型在编程、网络安全、办公领域的能力都在飙。

但这次48小时的试跑让我确认了一件事:模型从“会说话”到“会动手”,中间缺的那块,要么你自己补上,要么客户兜底,没有别的选项。
智能化工大模型3.0 Pro有个细节容易被忽略。它的技术体系是四层:大模型、智能体、专业技能与工具、应用场景。大模型负责认知,智能体负责执行,中途有结果校核和动态调整。
这个“校核”两个字,才是老板该抄的作业。
对OPC创业者来说,现在有一个很具体的落地场景:不用再纠结选哪家模型,而是花同等精力去设计执行边界。我的建议就四条,都是踩出来的:
- 至少拆两层权限。 能决策的AI和执行出界的AI分开,尤其是禁止AI直接碰写回型动作。这不是保守,是商业常识。
- 永远留最后一键。 这条比盖那个公章还重要,公章盖错可能废标,AI乱发邮件能直接丢客户。
- 预算只够上一套,先接管最不可逆风险最低的流程。 别一上来就让它管财务结算,让它先管日报、报告、表单。
- 留痕比能力强更重要。 化工大模型3.0 Pro能测出81.96%的文本准确率,但对老板来说,每一步能不能被查、被追、被停,才是敢不敢用的底气。
别被“自主”两个字迷了眼
我嘴里说“技术乐观派”,但乐观不是傻乐。
这几天铺天盖地的Astra演示,从房源链接重建三维看房视频,到操作Chrome改CRM工作流生成跟进邮件,看着吓人。但财新社也点了一句:OpenAI研究人员自己都在担忧,Astra更难被监控。模型行动中始终被人类监管的问题,到现在还没解决。
这恰恰是OPC的机会。大厂把模型能力往前推,谁来填“人类监管”这个坑?不可能全靠OpenAI,也不可能指望化工厂老板自学。
小老板要的从来不是聪明的AI,是有人替他把AI看住、把兜底的活干完。 这才是OPC创业者在这波更新里的真正位置。
AI开始执行了,你要做的不是兴奋地让出方向盘。你能收得住,它才是你的战队。
<div style="font-size: 12px; color: #999; margin-top: 2em; border-top: 1px solid #eee; padding-top: 1em;"> 本文中涉及的时间、数据和模型发布信息均据OpenAI官网、财新网、中国新闻网、Readhub等已公开报道整理,实际体验存在个体差异。AI执行类工具涉及数据权限和系统写入,请务必在正式环境中加设人工最后确认环节,模型出错不在产品免责范围内。文内案例中的客户信息经脱敏处理,不代表所有行业适用。 </div>