GPT-5正式发布,OPC创业者别急着换模型:先把多模态能力塞进这4个产品缝隙里

舍予基业来源:公众号「舍予AI智能体」
GPT-5正式发布,OPC创业者别急着换模型:先把多模态能力塞进这4个产品缝隙里
GPT-5发布后OPC创业者不必急着换模型,真正的机会在把多模态输入口从文本框换成摄像头和麦克风,落地售后报修、内部诊断、销售物料等四个产品缝隙。

先别把GPT-5当升级包:多模态真正的变量是“输入口”从文本框变成了摄像头和麦克

GPT-5 发布快一年了,你团队里真正让它"看"过东西、"听"过声音的人有几个?

如果答案是"没有,我们还是在对话框里打字",那你手里握着的其实还是上一代的用法,只是贵了一点。

有个判断我想放在最前面:GPT-5 这一代,最不值钱的变化是跑分,最值钱的变化是输入口。2026 年初 OpenAI 正式发布 GPT-5,行业第一反应照例是刷榜、比价、换模型。但从今年整个盘子看,真正推动落地场景位移的,不是谁的推理分数高几个点,而是输入从文本框挪到了摄像头和麦克风。

回头看看过去两年。所有 AI 产品的默认交互是键盘输入文字、模型返回文字。我们写的所有 prompt、所有 SOP、所有产品设计,都建立在同一个假设上:用户会先把自己看到的东西"翻译"成文字。

多模态喊了很久,但大多数团队的用法挺滑稽——先拍一张照,再用文字把照片描述一遍。中间那一步人工翻译,把效率全吃掉了。

今年这条链路被打通了。Gemini API 在 2026 年 5 月 5 日的更新里,File Search 已经支持原生多模态检索,图像可以直接被嵌入、被搜索,视觉引用带上了 media_id。Claude 在 3 月 12 日之后能在回答里直接内联生成图表和可视化。更关键的是成本线:Anthropic 9 月 22 日发布的 Claude Opus 5.5,运行成本比 Opus 5 低 40%;Gemini 3.5 主打 Agent 任务,输出速度每秒超过 280 个 token。这些数放在一起意味着同一件事——让模型"看一张图"从奢侈品变成了默认动作。

以前一张图推理一次太贵,产品经理只能把它设计成"可选功能"。现在它可以变成第一入口。

这就是我说的关键变量。你的用户不需要学会描述问题,他只要举起手机。

我们做舍予AI智能体——老板的第一支 AI 战队——的时候,跟不少老板聊过同一件事:别急着换模型。模型三个月一换,你今天迁移的接口,下个季度可能又白干。真正值得动的是输入口。客户报修,让他拍一张图,而不是填一张表;老师傅判断故障,让他对着设备说三十秒,而不是写一段工单;销售讲产品,让他录一段口播,而不是憋一段文案。

输入口一旦改掉,改的是用户在你产品里的动作习惯,这才是迁移成本最高的地方,也是最难被抄走的东西。

换个角度说,文本框是一个输入法,摄像头是一双眼睛。你要做的是让 AI 长在业务流程里,而不是让员工每天多打两百个字。GPT-5 算不算升级包,其实不取决于 OpenAI,取决于你明天敢不敢把那个输入框删掉。

第一刀砍向售后和交付:让客户拍一张图就完成报修、核价、派单,OPC不用再养一个客

输入口从文本框变成摄像头,这件事的杀伤力得落到具体场景才算数。第一刀,我建议砍在售后和交付上——因为这是OPC最不该自己扛、又最扛不住的地方。

先算一笔账。客户报修,文字描述是"设备边上那个口漏水"。客服得猜:哪台设备、哪个口、什么时候买的、保内保外。来回三轮,半小时没了,客户的火也上来了。

真正的成本从来不在修,在沟通。做过后端交付的都懂这句话。

多模态把这段直接砍掉了。客户拍一张图,最好再补一句语音,信息量瞬间拉满:铭牌上的型号、漏水的部位、管路走向、设备新旧,全在画面里。模型要干的不是"看懂这张图",而是从图里抽出结构化字段——型号、故障部位、损坏等级、要不要上门、可能涉及哪些备件。

技术底子已经够了。Gemini 的 File Search 在 2026 年 5 月更新后,可以用 gemini-embedding-2 直接嵌入和检索图像,视觉引用还能给到 media_id。翻译成人话:图进来,能搜、能对上、能溯源。

核价和派单是第二步。把历史工单、报价表、备件价格、师傅的技能标签和排期挂进检索层,模型给出报价区间和派单建议,人只做最后确认。

这里有个关键变量是成本。 多模态调用比纯文本贵,量一上来,OPC 会先被 token 账单劝退。所以 Claude Opus 5.5 把运行成本压到比 Opus 5 低 40%,这种消息对做交付的人比跑分重要得多。模型不只是要更聪明,是要便宜到敢让客户随便拍照。

有人会说,这些活 SaaS 早就能干。不对。SaaS 的前提是客户愿意填表单,而客户不填。

把"填表单"换成"拍一张照",不是一个交互优化,是行为门槛的量级差别。前者要培训客户,后者客户本来就会。

这也是我们做舍予AI智能体的出发点:老板要的不是一个更聪明的聊天框,是一支能干活的 AI 战队。售后是第一个上前线的兵,它不需要工位、不需要排班,客户半夜发来的照片,它接着。

这条路径说白了就三步:客户拍一张图,模型出结构化事实,规则加知识库兜住定价与派单,人只在异常处出现。OPC 的售后,从一个岗位变成一条流水线。

售后跑通之后你会发现,同一套"看图说话"的能力往公司内部挪一步,就是另一块肥肉——老师傅那双眼睛。

第三刀砍向销售物料:一份产品图丢进去,自动出短视频脚本、详情页和话术卡,小团队也

配图

做 OPC 的人都清楚,销售物料是慢性失血。

产品图永远不缺,手机随手一拍就是一堆。缺的是把图变成能用的东西——短视频脚本、详情页、话术卡。找外包,一条片子几百上千块,改三版还没到点上;自己写,写出来的东西隔着屏幕都能闻到 AI 味,发出去掉价。

多模态把这道墙推了。一份产品图丢进去,出来的是三套口径的东西。

逻辑不复杂。图是锚点,模型能识别材质、结构、使用场景,再叠上你输入的产品卖点、目标人群、平台调性,输出就能直接落地。Gemini 五月那版 API 更新把 File Search 做成了原生多模态,图片能直接 embedding、能搜索,grounding 里还带 media_id 做视觉引用——这意味着你的产品图库本身就是一个可检索的资产,而不是躺在相册里的废片。

短视频脚本最容易见效。同一张图,让它按三个钩子方向各出一版:痛点开场、反常识开场、场景开场。你挑一版改,比从零憋一条快太多。

详情页要的是结构。图进去,出来的是模块顺序、卖点标题、参数区文案,你在上面做减法就行,不用再对着空白文档发呆。

最被低估的是话术卡。

详情页是给陌生流量的,话术卡是给已经开口问的人的。图里有什么、客户最容易卡在哪,模型顺着图就能把常见问题和应答一起铺开——尺寸、材质、发货、退换。你改掉不对的,剩下的直接进销售手册。这块以前只有养了销售团队的公司才做,现在一个人也能有。

很多人把 AI 战队理解成工具堆。不是。舍予 AI 智能体讲「老板的第一支 AI 战队」,重点在「战队」两个字——不是买一堆账号,是让这些东西按你的业务顺序排好,各接一段活。一张产品图替你养出一个编导、一个文案、一个售前,这才是杠杆。

要提醒一句:别指望模型凭空编。产品图、你的真实卖点、客户真实问过的问题,这三样凑齐,出来的东西才不飘。你喂进去的语料质量,决定了输出能不能直接拿去用。

三刀砍下来,售后、培训、销售物料,看着是三个部门,其实是同一件事——输入口变了。

从文本框变成摄像头和麦克风,多模态真正改的不是模型有多聪明,而是你到底往里丢了什么。GPT-5、Opus 5.5、Gemini 3.5,版本半年一茬,追不完。追得完的,是你自己的产品图、老师傅的经验、客户问过的每一个问题。

行动建议就一条:这周挑一个缝隙,别挑最难的,挑你最痛的。把一批产品图丢进去,只跑一条链路,比如短视频脚本。跑通了再扩,跑不通,你也知道缺的是哪份素材,而不是哪个模型。

#舍予基业#多模态AI应用#OPC创业#AI售后报修#拍照报修系统#AI销售物料生成#多模态输入口#AI智能体落地

想知道舍予基业装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案;不方便留号码,也可以直接 WhatsApp 找我们。