8月27日大模型动态里,OPC 最该盯的六件事

2026-08-27舍予基业来源:公众号「舍予AI智能体」
8月27日大模型动态里,OPC 最该盯的六件事
8月27日大模型动态中,OPC创业者最该关注的六件事:从GLM-5.3-Flash的低成本推理、DeepSeek涨价信号、模型周留存价值,到本地部署窗口期和浏览器可编程化趋势,帮助产品选型与成本策略调整。

昨天和一个做 OPC 的朋友聊到半夜,他说最近看模型新闻已经麻了:今天你开源,明天他降价,参数越堆越大,跑分一个比一个高。但自己产品里接的模型,该犯的错一个没少。

我说你盯错地方了。

今天 OpenCode 更新到 8 月 27 日的数据。有个数字很刺眼:一个叫 ox-alpha 的新模型,独立用户直接冲到 44T,把 deepseek-v4-flash 的 17T 甩在后面。这个 ox-alpha 是谁?圈内人知道,就是智谱 GLM-5.3-Flash 的马甲。之前匿名测试阶段,它已经是当周最受欢迎模型。

真正有意思的不是它跑分多高,是价格:限时折扣内只有 Claude Opus 4.8 的 1/40

这周 AI 圈真正的变化,不是又发了哪个模型,是模型能力的分布逻辑变了。挑了六件事,每件后面跟一条对 OPC 创业者的实在启发。

一、GLM-5.3-Flash:便宜不是卖点,“想得动”才是

智谱这周上线并开源了 GLM-5.3-Flash。320B 总参数,A18B 激活,GLM-5 系列第一个原生多模态。AA 综合智能指数 57 分,和 Claude Opus 4.8 持平,编程表现也相当。

参数砍掉近一半,注意力计算量比 GLM-5.3 降了 3.01 倍,KV 缓存降了 4.44 倍。服务跑在国产芯片集群上,自研推理引擎,单 token 成本做到主流英伟达 GPU 水平。

这背后有一篇被很多人忽略的研究。有团队对 13 个主流大模型做了 400 万次回应分析,结论很反常识:最先进的模型,95% 到 98% 的事实都已经编码进参数里了。模型不是“没学过”,是“想不起来”。以前我们以为模型犯错是货架是空的,其实是钥匙丢了。给它思考时间,这类检索失败能修掉大半。

给 OPC 的启发:选模型别只看跑分,要看它“肯不肯想”。 GLM-5.3-Flash 这种架构上把注意力成本打下来的模型,意味着你可以在产品里默认开更长的推理链,不用怕账单爆掉。具体做法:把“推理深度”从模型能力里拆出来,当成一个独立变量调。一个做合同审查的 OPC 产品,用 Flash 开满思考,准确率追平 Opus 4.8,单次调用成本不到原来的三十分之一。这个账你算算。

二、DeepSeek 融资传闻:开源模型的“商业化压力”会传导到你账单上

有知情人士透露,DeepSeek 正推进第二轮融资,计划募资 500 亿元,目标估值 5000 亿元,已聘请投行筹备明年上市。

数字很具体:2026 年前 7 个月营收约 4.75 亿元,是 2025 全年的十倍;净亏损约 7.15 亿,但同比收窄。整体毛利率 44.6%,API 服务毛利率高达 82.9%。盯住最后一句——近期该公司上调了 API 接口定价

OpenCode 数据里,deepseek-v4-flash 独立用户 354K,周留存 68.7%,是绝对的主力。用户量最大的模型开始涨价,这件事比任何跑分都值得 OPC 创业者关注。

给 OPC 的启发:把模型成本当汇率管,别当固定成本。 开源模型定价策略在变,你的产品定价如果没给模型层波动留缓冲,毛利率可能被一波带走。做法很直接:在自己系统里加一个“模型价格监控”,每周拉一次主力模型在 OpenRouter 和官方 API 的变动,超过 15% 就触发成本复审。这不是技术活,是财务纪律。

三、一个被忽略的健康信号:周留存比调用量更值得看

OpenCode 这周还更新了 weekly retention 数据。glm-5.3 周留存 79.1%、kimi-k2.5 是 72.9%、qwen3.5-plus 是 72.6%,minimax-m2.7 是 69.7%,deepseek-v4-flash 是 68.7%。

这说明什么?开发者用脚投票的忠诚度,比想象中高得多。一个模型周留存能到 70% 以上,说明它在真实工作流里确实“能用住”,不是靠一波热度。

给 OPC 的启发:做模型选型,少看演示视频,多看周留存。 你产品后台也应该有类似的“模型留存”视角。不是用户留存,是“任务留存”:用户第一次用你的智能体跑通一件事之后,同类任务还会不会再交给它。如果不会,问题大概率不在模型,在你的任务设计。我们舍予内部做交付时有一条死规矩:每个智能体上线前,必须看同类任务的“二次委托率”,低于 50% 就直接返工。这个数比任何演示评分都真实。

四、Qwen3.8-Flash-Next:训练成本降了 9 倍,接下来是“本地部署”的窗口期

通义千问开源了 Qwen3.8-Flash-Next,多模态 MoE,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9。GDN + QSA 混合注意力,编码和办公任务能力更强。

把这条和腾讯混元端侧翻译模型放一起看,更有意思。混元 Hy-MT2-1.8B 通过 2-bit 和 1.25-bit 量化压到 574MB 和 440MB,翻译质量几乎无损,在 FLORES-200 上优于 Microsoft Translator 这类商业 API,已经在 B 站直播弹幕实时翻译落地了。

一边训练成本骤降,一边端侧小模型性能追平商业 API。

配图

给 OPC 的启发:别把“私有化部署”当成大客户的专属需求。 现在一个 1.8B 的端侧模型能在翻译这种任务上跑赢商业 API。很多垂直场景的 OPC 产品可以开始考虑“混合架构”:敏感数据走本地小模型,粗活走云端大模型。找一两个对数据敏感度高的客户,试点本地小模型承担基础任务,云模型只做需要深度推理的部分。架构今天不设计,等客户主动提出来,你的竞品已经上线了。

五、Claude in Chrome 全面开放:浏览器正在变成“可编程工作台”

Anthropic 本周宣布 Claude in Chrome 面向所有付费套餐全面开放。Claude 可以在浏览器里自主执行操作,不用逐步审批。安全分类器在每次操作前验证安全性,加上提示注入防御之后,自 Opus 4.8 起的所有模型没有出现过攻击成功案例。

同时,Claude Cowork 桌面应用加了内置浏览器,能自动导航网页、阅读页面、点击填表单,和用户自己的浏览器隔离,不碰书签密码。

给 OPC 的启发:智能体吃掉的第一层是“操作记录”。 这件事现在看只是浏览器自动化,但它意味着原来需要人点的流程正在被系统化接管。你做 OPC 产品,如果界面还在让用户手动填表、手动跳转,本质是在和未来的智能体操作流对抗。现在就想清楚:产品里哪些操作可以“托管”给智能体,哪些审批节点必须保留。把这个边界想清楚的 OPC,会比只堆功能的团队走得远。

六、说人话:OPC 现在最该干的,不是追模型,是建“任务路由”

今天的模型市场已经明显供大于求。有 OpenAI 年化收入突破 400 亿美元,有 DeepSeek 准备上市,有智谱把价格打到 1/40,有阿里把训练成本打到 1/9。模型层卷价格、卷成本、卷架构。

但 OPC 创业者真正的壁垒,从来不是“用哪个模型”,而是你如何把用户的任务拆解、路由、兜底。同一个任务,什么时候给云端大模型,什么时候给本地小模型,什么时候该让模型多想一会儿,什么时候该直接返回——这个“任务路由”的能力,才是模型层卷完之后剩下的钱。

我们在舍予给别人搭智能体,从来不从“选个最牛的模型”开始。先问三个问题:这个任务用户最多愿意等几秒?数据能不能出域?用户愿不愿意为高准确率多付钱?三个答案凑一起,模型方案基本就定了。剩下的都是工程。


小字提醒:本文所涉模型价格、融资数据、评测分数均来自公开资料及第三方平台(OpenCode、AIHOT、Readhub 等)截至 2026 年 8 月 27 日的披露,不构成投资建议。DeepSeek 融资消息为知情人士透露,公司未公开置评;限时折扣价格以官方页面为准。OPC 创业者在做模型选型时,建议以自己业务数据的实测结果为准,本文提到的任何模型表现都可能随版本更新而变化。

AI应用OPC创业大模型选型模型成本

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。