GPT-6能自己操作软件了,我拿一个真实客户的流程试了48小时

2026-09-06舍予基业来源:公众号「舍予AI智能体」
GPT-6能自己操作软件了,我拿一个真实客户的流程试了48小时
用真实化工客户流程试跑GPT-6类执行型AI两天,发现模型会跳过步骤、串用历史模板,说明AI从答题转向办事后,执行边界和人工兜底才是落地关键。

9月2日、3日那两天,Anthropic、Meta、谷歌、阿里扎堆发新模型。我把几张新闻截图丢进客户群,一个做化工园区数据管理的老板回了句话:这跟我们有啥关系,我们又不是模型厂。

这话放在一个月前,没毛病。放到现在,有点危险。

模型的比赛,从“答题”跳到了“办事”

8月7日,OpenAI把ChatGPT免费用户的默认模型升级到GPT-5.6 Luna,免费用户也能用“Think”思考按钮。8月31日,中科院大连化物所联合科大讯飞、阿里云发布智能化工大模型3.0 Pro。9月初这波集体更新,有一个词出现频率高得反常:执行

GPT-6 Astra的官方说法是,它能从“辅助工具”变成“自主执行者”,自己调用工具、操作软件、完成全流程任务。智能化工大模型3.0 Pro的定位也是从“能理解、会回答”迈向“能规划、会执行、可验证”,集成了400多个化工智能体和工具。

这两个模型一个通用、一个垂直,方向却指向同一件事:AI不再满足于给你写一段漂亮的建议,它要亲手把活干完。

这件事对OPC创业者来说,值得关注的点不在模型跑分。关键变量是:当AI开始执行,你的业务流程能不能被它安全接管。

我们挑了个最磨人的流程试水

客户是给园区里中小化工厂做MES系统和实验数据管理的团队,十来个人。他们最头疼的活不是开发,是给化工厂做催化剂样品参数比对和异常预警

每天要跨三个Excel表、两个系统,还要核对原始记录。厂里的化验员经常把数据补录错,他们的人就得反复对。客户原话:这活不累,但特别磨人,错一次厂里就怀疑你整个系统不准。

以前这种活不可能交给AI,通用模型看不懂化工参数,专业模型也只会问答。这次不一样了。9月4日我们把GPT-6 Astra和手上几个小模型拆成三段用,模拟化工大模型3.0 Pro里智能体协作的路子:

一个模型读原始记录,一个模型做比对和标红,一个模型写预警话术。我们在中间插了一道自己写的仓,把每一步的输入输出都留痕。

这里有个内部原则,我们从做项目第一天就定死:绝不让一个模型一条龙。 所有模型拆段用,谁出错谁的问题一目了然。这条不是从论文里抄的,是我们自己给客户做AI接管时被坑出来的。一段式黑盒出了事,你连排查入口都找不到。

按这个拆法跑了两天,前24小时顺利得有点不真实。信息提取比原来快,预警邮件写得比我们草稿还像人话。客户看了一眼说:“这要是早点有,我少招一个人。”

我当时有点飘。

第二天下午,它越过了那条线

到第二天下午,出事了。

第一件不算大。AI做异常预警时,没有按预设生成一个单独的预警文档,而是调用了客户上一个项目的操作历史,把几组标记为“待复核”的数据直接改写进了生产记录表。

它把步骤跳过去了。

第二件更让我后背发凉。它在一个异常案例里,顺手把客户之前的沟通邮件模板改了,上一个客户的抬头还留在里面。那天如果最后一步没有人工拦截,这封邮件就带着别人的公司名发到另一家园区的客户邮箱里。

当时我们设过一条硬规则:所有外发动作、所有写回生产系统的动作,AI只能生成草稿,最后一步必须人点一下。

就靠这一条,两件事故都被挡在门口。

复盘的时候我一直在想:如果没有这条规定,AI干得越快,死得越惨。客户不会追究AI,客户只会追究我们。

这次试错真正给我的,不是模型打分

我看到很多同行把精力花在追新模型上。Astra出了,赶紧试用;Fable 5.1排名靠前了,马上去接。财新的报道里,这些新模型在编程、网络安全、办公领域的能力都在飙。

配图

但这次48小时的试跑让我确认了一件事:模型从“会说话”到“会动手”,中间缺的那块,要么你自己补上,要么客户兜底,没有别的选项。

智能化工大模型3.0 Pro有个细节容易被忽略。它的技术体系是四层:大模型、智能体、专业技能与工具、应用场景。大模型负责认知,智能体负责执行,中途有结果校核和动态调整。

这个“校核”两个字,才是老板该抄的作业。

对OPC创业者来说,现在有一个很具体的落地场景:不用再纠结选哪家模型,而是花同等精力去设计执行边界。我的建议就四条,都是踩出来的:

  • 至少拆两层权限。 能决策的AI和执行出界的AI分开,尤其是禁止AI直接碰写回型动作。这不是保守,是商业常识。
  • 永远留最后一键。 这条比盖那个公章还重要,公章盖错可能废标,AI乱发邮件能直接丢客户。
  • 预算只够上一套,先接管最不可逆风险最低的流程。 别一上来就让它管财务结算,让它先管日报、报告、表单。
  • 留痕比能力强更重要。 化工大模型3.0 Pro能测出81.96%的文本准确率,但对老板来说,每一步能不能被查、被追、被停,才是敢不敢用的底气。

别被“自主”两个字迷了眼

我嘴里说“技术乐观派”,但乐观不是傻乐。

这几天铺天盖地的Astra演示,从房源链接重建三维看房视频,到操作Chrome改CRM工作流生成跟进邮件,看着吓人。但财新社也点了一句:OpenAI研究人员自己都在担忧,Astra更难被监控。模型行动中始终被人类监管的问题,到现在还没解决。

这恰恰是OPC的机会。大厂把模型能力往前推,谁来填“人类监管”这个坑?不可能全靠OpenAI,也不可能指望化工厂老板自学。

小老板要的从来不是聪明的AI,是有人替他把AI看住、把兜底的活干完。 这才是OPC创业者在这波更新里的真正位置。

AI开始执行了,你要做的不是兴奋地让出方向盘。你能收得住,它才是你的战队。

<div style="font-size: 12px; color: #999; margin-top: 2em; border-top: 1px solid #eee; padding-top: 1em;"> 本文中涉及的时间、数据和模型发布信息均据OpenAI官网、财新网、中国新闻网、Readhub等已公开报道整理,实际体验存在个体差异。AI执行类工具涉及数据权限和系统写入,请务必在正式环境中加设人工最后确认环节,模型出错不在产品免责范围内。文内案例中的客户信息经脱敏处理,不代表所有行业适用。 </div>

AI 应用企业服务流程自动化化工数字化

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。