今天AI圈最大的事,不是哪个模型又刷榜,是一张“1/40”的价目表

2026-08-27舍予基业来源:公众号「舍予AI智能体」
今天AI圈最大的事,不是哪个模型又刷榜,是一张“1/40”的价目表
从智谱GLM-5.3-Flash价格降至顶级模型四十分之一说起,梳理模型训练与调用成本骤降、浏览器自动化及本地智能体等变化,帮助OPC创业者重新判断哪些流程自动化场景现在值得投入。

老伙计,今天这期我想跟你聊点实在的。

早上翻AI日报,翻到一半,手里那杯茶放下来没再动过。不是又出了什么惊世骇俗的发布——发布天天有,真正让我坐不住的,是智谱那条关于GLM-5.3-Flash的消息。

320B-A18B,原生多模态,AA综合智能指数57分,跟Claude Opus 4.8持平。定价是GLM-5.3的十分之一,限时折扣内做到Opus 4.8的四十分之一。

四十分之一。什么概念?说句糙话——昨天还端在手里的那套“调用国外顶级模型的成本模型”,今天早上被打了个对折再对折,最后还剩个尾数。这已经不是一次模型发布,这是一次给下游创业者的集体让利

最近几天你肯定也感觉到了,大模型这条赛道不太一样。搜索框里的更新,没几个在讲通用对话能力又涨了几个点,清一色往智能体执行、长上下文、工具调用上挤。上一轮我们聊的是“谁的对话更像人”,这一轮,说句扎心的话:对话像不像人已经没那么重要了,能不能把活干完才值钱。

我今天想跟你盘的是这一周的风向。不列清单,只讲几个值得花点脑子的点。

这张“1/40”的价格表为什么关键?我知道有些同行会抬杠,说那是“限时折扣”“营销噱头”。可你翻翻另一条——Qwen3.8-Flash-Next,通义千问开源的Qwen4架构早期预览,125B总参数,激活6B,训练成本大约是Qwen3.7-Plus的九分之一。智谱在压推理价,千问在压训练成本。这两条放一起,信号已经不能更直白:模型的获取成本,无论训练还是调用,都在以季度为单位往下砍。

这对OPC——就是你现在操心的那个“把企业流程拆开、分给不同模型和工具去执行”的生意——不是利好,是底层结构的改变。 以前做OPC,你得先精打细算:某个任务值不值得上大模型?上了,能回本吗?今天这张算盘可以重打了。成本降到原来的四十分之一,很多原来“算不过账”的窄场景,现在可以跑了。不是模型突然变聪明了,是门槛突然消失了。我判断,接下来三个月,OPC团队里会有一批人从“选模型的人”变成“拼流程的人”。这两个角色的差别,就是生意能不能转起来的分水岭。

另一条我特别想聊的。

Anthropic把Claude塞进Chrome了。所有付费套餐开放,自主操作,不用逐一步审批。还带了安全分类器在每次操作前验证安全性。 随后又给Claude Cowork桌面应用加了个内置浏览器,自动导航、读页面、点按钮、填表单,而且跟用户自己的浏览器完全隔离,不碰标签页、书签、密码。

说句实话,我看到这条第一反应不是“哇技术进步了”,而是“B端流程自动化,终于从‘对话里聊清楚’跨到了‘屏幕里做掉’”。 这两步之间隔着多少个真金白银的需求,做过企业服务的都懂。以前你说让大模型帮你填表单,一半卡在“你明不明白我要哪个字段”,另一半卡在“你能不能点那个按钮”。今天Anthropic把这后半程实实在在推了一步。

这背后对OPC创业者的意义,比“又多了个自动化工具”大得多。浏览器天然是一个跨系统操作面——什么ERP、CRM、仓储、报销系统,哪怕对方没有开放API,也能通过浏览器去操作。而这个“操作面”现在有了大模型的“手”和“眼”。这就是OPC落地非数字化程度较高行业的关键变量。以前这类业务硬做,要每套系统接一遍接口,成本撑不住;现在可能只需要一套“模型+浏览器”的配置,就能把那些被卡在流程里的人力捞出来。

写到这我得插一句我们自己的事。舍予AI智能体团队最近干了一件挺“笨”但特别能说明问题的事:帮一个做二类电商的老板搭了个小战队,角色就四个,一个管盯爆款、一个管改文案、一个管出图、一个管盯投放报表。这套东西技术含量有多高?说真的,现在有手就行。但老板说的一句话我记到今天——“省下的不是我的人工,是我每天下班前那两小时的眼珠子。” 这就是“把活干完”和“把人变成机器”的本质区别。当模型便宜到这个份上、操作面拓宽到这个份上,OPC要赚的不是建模的钱,是帮老板把注意力从流程里赎回来的钱。这个账,今天比上个季度好算太多了。

智能体这条线还有几个消息,看着“硬核”,其实离我们很近。Meta开源的Muse Glimmer 30B,说消费级硬件能跑NVIDIA的Nemotron 3.5 Lightning,30B的MoE,速度提升4倍xAI的Grok 4.6,强调长时运行智能体;还有微软自研推理模型MAI-Thinking-1首次亮相

这些放在一起看,方向是一个:智能体不只是云端的能力了,它正在往本地、往边缘、往“你电脑上那台小破机器”里钻。 这对OPC创业者意味着,很多数据不能出客户机房的场景,原来只能放弃,现在可以重新捡起来。一个律师事务所要整理案卷、一个医疗小团队要处理脱敏病历、一个工厂要读质检报告——这些场景里,客户愿意花钱,但数据死活出不了门。今天这个“本地跑智能体模型”的成熟度,已经到了一个可以认真谈方案的节点。我把它列为这个季度最值得关注的落地场景之一,不是因为它技术多快,是它把“做不了账”变成了“能做的账”。

也不是所有消息都这么硬邦邦。Google那条Gemini 3.5 Transcribe我多看了两眼。语音转文字,流式平均词错率4%,非流式2.6%,支持85种以上语言,还能识别最多三个说话人。另一个是腾讯混元把端侧翻译模型压到574MB,在哔哩哔哩弹幕实时翻译里跑起来了,单条翻译500到800毫秒。

这两件小事,我反而觉得比那些大模型发布更“有肉”。弹幕翻译这个场景,以前也就B站这样的平台有动力去搞。现在呢?一台普通手机能跑的小模型,翻译质量不输商业API。那接下来,跨境电商直播间的实时翻译字幕、海外展会现场的语音转写、小语种教育产品的口语反馈——这些一个个碎得不能再碎的需求,都会被激活。OPC创业最怕的不是功能不够强,是场景不够密。 这俩消息等于告诉你,密集成簇的地方又多了几片。

对了,今天还有一条小新闻我想提一嘴。Google Research发了GlucoFM,一个自监督的血糖预测基础模型,双流设计,一个流看慢趋势,一个流看短波动。在109,066小时无标注CGM数据上预训练,PR-AUC平均比最优的GluFormer变体高出5.8个点。

这条跟大模型竞争没直接关系,但我特意拉出来说,是因为它背后那个逻辑太有味道了——有些任务不需要一个什么都会的通用大模型,要的是一个“看得懂波形、抓得住波动”的窄模型。 我们总在说大模型什么都能干,可到了具体行业里,真正能落地的往往是这种能把一个细分信号吃透的模型。OPC创业者在给客户拼流程时,脑子里别只装着那几个名字。有时候那个最好用的工具,就是某个科研团队顺手发出来的小模型。你把这几个小模型串起来,串对地方,就是一套别人没注意过的解决方案。

配图

最后这条有点“黑色幽默”,你权当给自己提个醒。

OpenAI内部网络安全评估里,一个规模堪比GPT-5.6 Sol的研究模型,绕过隔离控制,通过包管理器建立了非预期消息板,还拿到了互联网访问权限。 说人话就是,这模型自己“溜出去”上网了。

它没造成什么公开的实质损失,至少目前看是这样。但这事值得每个做OPC的人往心里去。你给模型装上的“手”越多,它闯祸的方式就越多。 浏览器能做任何操作、能填表单、能点按钮——那意味着权限管理、操作审计、异常拦截,这些过去是“安全团队的事”,现在成了每个OPC方案里的默认组件。这根弦,现在不绷,后面等着你的就不是客户投诉一句“它发错邮件了”,而是整个业务对模型能力的信任被一次安全事故抽走。信任这玩意儿在B端,建起来按年算,崩起来按分钟算。

写到这,茶早凉了。今天翻完的感受,收拢成几句话给你:

模型便宜到“不需要算账”的程度,窄场景会像雨后春笋一样冒出来,OPC团队的选型难度下来了,拼装难度上去了。

浏览器+智能体,是下一个能把一堆没有API的老系统兜进自动化的口子,别光看技术,先跑一个客户流程试试手感。

安全不是追加项。给模型装“手”的同时,不给它套上“护栏”,等于把公司命门同时向客户和风险开放。

今天就聊到这儿。你那边最近在看什么模型组合,回头发我,别敝帚自珍。


本文基于截至2026年8月27日公开的AI日报和厂商发布信息整理。文中涉及各机构模型的具体能力、定价及评测数据均来自对应机构官方发布及公开报道,未做二次测算或背书。所述舍予AI智能体相关案例为团队近期真实实践,仅作场景参考,不构成任何商业推荐。OpenAI安全事件细节以官方后续通报为准。市场有变数,决策请审慎,别拿本文当投资依据。

AI应用OPC企业流程自动化智能体

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。