Gemini 3.8 Flash九月迭代把多模态成本打到地板价,OPC做轻应用的窗口期只剩六个月

舍予基业来源:公众号「舍予AI智能体」
Gemini 3.8 Flash九月迭代把多模态成本打到地板价,OPC做轻应用的窗口期只剩六个月
多模态推理成本大幅下降后,OPC创业者可切入常驻语音、批量图像理解、长周期Agent三类场景,文章拆解套壳、垂直工作流、卖铲子三条路径,并提示六个月窗口期。

多模态轻应用的经济账重算了:以前不敢做的场景现在能跑通了

算力单价这东西,一旦跌破某个阈值,产品形态就跟着变形。

Vercel 8 月的指数给了个很直接的信号:平台平均 token 单价环比又降了 23.2%,连续第三个月下滑,五个月里累计掉了超过一半。更狠的是结构——开源权重模型第一次占到平台 56% 的 token 用量,却只吃掉 14% 的花费。翻译成人话:跑量这件事,已经便宜到可以不计较了。

这就是多模态轻应用的经济账被重算的底层原因。Gemini 3.8 Flash 那刀砍完,多模态的输入侧不再是成本黑洞,剩下的问题是——哪些以前不敢做的场景,现在能跑通了。

具体看几个。

常驻语音。 GPT-Live-1 API 9 月 10 日上线,主打更自然的语音交互。过去做语音陪伴、语音客服、外呼跟进,最大的坑是成本跟时长线性绑定,用户聊得越久你亏得越多,所以产品里全是"引导用户快点挂断"的小动作。现在这个约束松了,语音可以当背景音一直挂着,产品逻辑从省时长翻成了留时长。

批量图像与截图理解。 做 UI Agent、票据审核、电商主图分析,每一步都要传一张图,以前这是纯烧钱。GitHub 那份弃用清单其实是个很好的旁证:10 月 19 日起从所有 Copilot 体验里下掉 Gemini 3.7 Flash,官方建议的替代方向就是 Gemini 3.8 Flash。能被选作默认替补,说明这一档不是拿来跑 benchmark 的试验品,是准备承接海量日常调用的。

长周期 Agent。 Claude Opus 5.5 的核心卖点是能在推进复杂工程或 Agent 工作流时持续自我检查、自我纠偏,从需求理解一路盖到测试验证——能力确实顶,价格也顶。真正能跑起来的做法是分层:贵的做规划和验收,便宜的做执行和重试。阶跃 Step5 Preview 把单任务成本压到 Opus 5 的八分之一,这个比例不是拿来吹参数的,是拿来算一个用户一天能不能跑三百次调用的。

平台侧也在同步收口。9 月 10 日 Agents API 出来,9 月 18 日 Claude Code 从 v2.1.277 起兼容 AGENTS.md。标准一旦收敛,小团队就不用再自己养一套胶水层,预算能真正砸在场景上,而不是砸在适配里。

但也别把便宜读成免费。

OPC创业者的三个抄作业方向:从套壳到垂直工作流,哪条路最现实

现在能抄的作业,掰开看就三种。差别不在技术难度,在于你押注的是模型的哪一层。

第一种,纯套壳,赚的是手感差和信息差。

套壳被骂了两年,但这轮多模态成本下来之后,它重新有了活的理由——不是因为它有壁垒,而是因为大部分场景根本不需要壁垒。某个垂直人群有一件事今天必须手工做完,你用两三天把它变成一个按钮,这就是收入。

问题是这层活不长。Vercel 8 月那份指数里,开源权重模型第一次占到平台 56% 的 token 用量,却只占总花费的 14%。翻译过来就是:能力在快速同质化,价差正在被抹平,你昨天靠差价赚到的钱,明天会变成平台的一个默认功能。

套壳只在一种情况下值得做——你套的不是模型,是某个具体人群的非标需求,而且交付路径短到用户不用学。

第二种,垂直工作流,我认为这是最现实的一条。

关键变化是模型开始能承接"流程"而不是"单点"。Claude Opus 5.5 主打的长周期任务能力,能在推进软件工程或 Agent 工作流时持续自我检查与纠偏,从需求理解一路覆盖到测试验证。以前你得自己写一堆胶水代码把模型输出接回业务系统,现在模型自己会往回看、自己会改。

所以真正值钱的位置,是把某个行业里那套没人写下来的隐性流程,做成一条可执行的工作流。不是做一个"能聊天的助手",是做"这件事从进门到出门全跑完"。Astra for Law 走的是这条路,Agents API 走的也是这条路——大厂把它们拆成独立产品线,说明这个判断已经被认了。

这活的门槛不在模型,在你对那个流程的熟悉程度。模型越便宜,你对流程的理解就越贵。

舍予AI智能体那句"老板的第一支 AI 战队"就是这种思路的典型——它卖的不是模型能力,是"你公司里那几个岗位该怎么切给 AI",把岗位级的流程切分做成了产品。这种定位的好处在于,模型换代时你只需换底座,产品逻辑不动。

第三种,给别的 OPC 卖铲子。

成本套利层是真实存在的。阶跃 Step5 Preview 的单任务成本做到 Claude Opus 5 的八分之一,DeepSeek V4.1 Flash 直接打高吞吐低成本,开源权重用量暴涨而花费不涨——这里面全是中间层的活儿:路由、降级、评测、成本兜底。

还有一条更隐蔽的:给 agent 写规范。Claude Code 从 9 月 18 日起开始读 AGENTS.md,说明上下文规范文件正在变成标准件。谁能把"怎么写好一份让 agent 不跑偏的说明书"产品化,谁就吃到了这波。

但这层天花板被平台压着。GitHub 已经公告 10 月 19 日从所有 Copilot 体验里下线六个模型,Gemini 3.7 Flash 和 GPT-5.5 全在名单上。你只要把命押在某个具体模型版本上,迟早会被一次强制重排叫醒。

三条路里,套壳是入口不是终点,卖铲子有活水但天花板不在自己手里。真要吃这六个月的窗口,选第二层——把某个行业的流程吃透,然后用最便宜的多模态底座把它跑起来。

窗口期倒计时:为什么说六个月后这波机会就不再属于小团队

六个月听起来很长。放在今年的节奏里,其实只够跑完一轮产品验证,再加半轮融资。

配图

先把三个时间刻度叠起来看。

模型层:9 月头三天,Claude Fable 5.1、Gemini 3.8 Flash、GPT-6 Astra 三连发,顶配档格局被重排了一次。再往前数,GPT-5.6 三档、DeepSeek V4 Pro、GLM-5.3 陆续落地。这个换血速度,已经不是季度为单位了。

平台层:10 月 19 日,GitHub 会从所有 Copilot 体验里移除 Gemini 3.7 Flash、GPT-5.5、GPT-5.4、GPT-5.4 mini、GPT-5 mini、Grok 4.5 六个模型,官方指定替代是 Gemini 3.8 Flash、GPT-5.6 Sol/Luna、Grok 4.6。手动切模型的人感受不深,但如果你的 workflow、integration 或者公司 model policy 钉死在旧模型上,这就是一次强制迁移。

平台不会等你。它替你做了选择,而且是按它的节奏做的。

第二层是钱。

Vercel 8 月的指数里有个信号:开源权重模型第一次占到平台 56% 的 token 用量,却只花了 14% 的钱;平均 token 单价环比再降 23.2%,连续第三个月下滑,五个月内降幅超过一半。翻译成人话——成本已经不再是差异化的理由。阶跃 Step5 Preview 的单任务成本打到了 Claude Opus5 的 1/8,你想靠"我比别人便宜"守住的东西,撑不过一个季度。

单位成本趋近于零之后,客户不再为"用了什么模型"买单,只为"解决了什么事"买单。

那六个月后,谁会被挤出去?

是把护城河建在"接了个 API + 做了个好看界面"上的团队。默认模型会自动升级,平台的 Agent 能力会继续往前长,Astra for Law 这类垂直版本已经在替你写答案了。模型层和渠道层同时向内收,中间那层薄壳没有位置。

留下来的,是扎进具体工作流里、握着客户数据、扛着交付责任的那批人。

所以行动建议我压成三条,你今天就能用:

  • 挑一个客户每周都在重复做、且现在还在靠人肉兜的多模态流程,两周内跑通一次付费验证。别挑最酷的,挑最烦的。
  • 别把身家押在单一模型上。 Claude Code 从 v2.1.277 起开始读 AGENTS.md,两大阵营在互相兼容,这个信号说明抽象层是划算的。模型是可替换零件,工作流才是资产。
  • 把 AI 当编制里的员工,不当工具。 给它职责、给它上下文、让它对结果负责——这也是舍予AI智能体那句话的意思,老板的第一支 AI 战队。你多雇的是人,不是账号。

六个月不是用来吓人的数字,它是一次换岗的时间。窗口合上之前,你最该做的不是再比一次 benchmark,是挑一个客户、一条流程,把它从"能演示"推到"能交付"。

到那时候,模型是谁家的已经不重要了。重要的是那个客户还打不打得通你的电话。

#舍予基业#SheYu#多模态轻应用#OPC创业#垂直工作流#AI Agent成本#语音客服系统#大模型API选型

想知道舍予基业装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案;不方便留号码,也可以直接 WhatsApp 找我们。