一个做本地生活SaaS的团队,把8个大模型塞进同一条流水线后,账算不过来了
一个做本地生活SaaS的团队,把8个大模型塞进同一条流水线后,账算不过来了
上个月跟一个做本地生活SaaS的创始人老周复盘,他问了个特别实在的问题:现在模型这么多,到底该用哪个?
我问他自己怎么干的。他打开电脑给我看了一张表,密密麻麻列了十几个场景——商家评价回复、菜单图片识别、客服工单分流、差评情绪分析、合同条款抽取、营销文案生成……后面跟着一列模型名字,GPT、Claude、Gemini、Qwen、DeepSeek、GLM、Kimi、豆包,还有几个国内外的开源模型,全在用。
我说你先别急着问我用哪个,你先告诉我,这张表你每个月花多少钱。
他调出后台账单。单看每个模型单价都在降,OpenAI刚把GPT-5.6 Sol的价格下调了20%多,谷歌Gemini 3.7 Flash定价也几乎是上一版的一半,国内几家更是卷到地板。可诡异的是,他的总账单三个月翻了一倍。
问题出在“用得太随意”。
这事我觉得值得单独拿出来说。
背景:模型越便宜,团队越乱用
老周这公司做本地生活服务商SaaS,服务大几百个餐饮、美业、宠物店老板。他本人是技术出身,对AI很有热情,ChatGPT、云Code、Codex这类工具早就用起来了。2025年底开始,他拉着五个开发搞了个内部AI中台,把市面上主流模型能接的都接了一遍。
想法很朴素:每个任务找最合适的模型。国内文本用国产模型,便宜;复杂推理用GPT或者Claude;图片处理本来想用Qwen3-VL,但发现Gemini对菜单这类结构化图片识别更稳;代码补全用的是本地部署的开源小模型——团队里有个兄弟特别迷Llama和Phi,自己搞了套私有化部署。
看起来是“最佳组合”,实际是“灾难组合”。
光API密钥管理就是一笔烂账。五个人,每人手里捏着六七个接口,有的用官方SDK,有的走中转,有的图便宜去第三方聚合平台。同一个任务,这个月跑A模型,下个月因为B模型又降了几毛钱就切过去。Prompt也没沉淀下来,换个模型,原来的提示词就不太灵了,又要重调。
更难受的是质量参差不齐。客服工单分流这种需要稳定输出的活儿,时不时被一个轻量模型带偏,把“会员储值卡退款”分到了“举报投诉”,客服追问时才露馅。老周说那段时间他天天看人工抽查结果,血压比K线还刺激。
做法:从“用哪个”换成“谁该负责”
上个月他来我办公室聊,我说你这个账乱,不怪模型多,怪你没有“负责任的人”。
我们花了一下午,做了三件事。
第一件事:只留8个模型,每个都有唯一负责人。
砍掉了一批重复场景和临时接进来的小模型。最终定下来框架:GPT-5.6 Sol负责复杂推理和老板对话式报表;Claude负责合同条款抽取和长文档分析;Gemini 3.7 Flash负责图片类识别,因为便宜且快;Qwen3.5负责多语言和本地化消息处理,它支持201种语言方言,本地生活里那些方言评价、俚语,它比英文模型接地气;DeepSeek和GLM负责批量文本分类和打标签;Kimi负责超长工单历史的情绪分析和摘要;豆包负责营销文案初稿,生成速度快,调性也适合国内商户。
每个模型对应一个开发,你想换模型,先写清楚三个理由:质量、成本、维护。不写清楚不准换。这招直接治好了“追新症”。
第二件事:加一层验证,别让模型自己说了算。
清华那个VeriLoop Coder-E1开源的时候,我专门读了几遍技术报告。那个“循证闭环”的思路,对写代码的AI尤其重要——每一轮生成必须经过测试验证,通不过就分析原因、修正,再验证,直到产出可靠代码。得让证据挑战系统的认识,而不是用证据给现有结论做装饰。
这个思路放到日常开发里也一样。老周团队现在所有模型输出,只要进生产、影响商户使用的,必须先过一层规则引擎加人工抽检。抽检不通过,直接回退到上一个稳定版本。一个客服回复如果被标记高风险,自动转人工,AI不硬答。
第三件事:把账单按任务算,不按模型算。

原来账本是“GPT花了多少,Claude花了多少”,现在改成“一个差评回复成本多少,一份合同抽取成本多少,一次客服分流成本多少”。按任务走,才知道哪个模型是在省钱,哪个是在烧钱。比如Qwen3.5做批量分类,单条成本几乎可以忽略,但换成GPT就是几十倍差,效果也就好个5%。这种账人人会算。
结果:成本降三成,差评响应快了一半
改完一个月,老周给我发了消息:总成本降了约三成,最明显的是售后工单响应速度和差评回复质量。
以前一个差评要经过识别情绪、抽取关键点、生成回复草稿、人工润色四步,模型换来换去,草稿有时候还要返工。现在固定了这条链:Kimi做情绪加要点提取,豆包出草稿,GPT只做最后的语气校对。同一份工单,处理时间从六分钟压到三分钟以内,商户老板看到回复的时间短了一半。
最有意思的是,他那个爱折腾开源模型的开发,现在负责的本地小模型只在两处用:一是代码补全私有化,二是夜间无人时的初筛。反而稳定了。人也踏实了,不再每周报一个“我换了个新模型,效果惊人”的消息。
换作你能抄什么作业?
这是我今天真正想说的。很多OPC创业者、coding开发者对模型的态度像集邮,生怕错过哪一个。但你要知道,模型只是生产资料,不是生产力本身。
从最近这批动态里,挑几个关键变量说说。
1/ 价格战还在继续,头部在降,生态在洗牌。OpenAI降GPT-5.6 Sol,谷歌降Gemini 3.7 Flash,英伟达却通知客户AI相关产品涨价超15%。上游算力涨价,下游推理降价,中间谁难受?做模型分发的、靠转售API赚差价的、自己没有核心场景的。创业者别把宝押在“模型套壳”上,要押在“场景里不可替代的那一步”。
2/ 能力差距在缩小,比的是稳定性。Qwen3.5在推理、编程、智能体基准上全面超越前代,DeepSeek推多模态,GLM、MiniMax、Kimi各自有擅长方向。但落在真实业务里,用户不会因为你是“最新版”就容忍你忽好忽坏。老周的教训:稳定产出比偶尔的高光重要得多。创业场景里,客户要的是确定性。
3/ 验证比生成更关键。清华VeriLoop Coder-E1在SWE-bench Verified上85.20分,32B以下开源模型里多项第一。给coding开发者的启发很直接:做代码智能体,别再执着于生成更多代码,要装一套验证闭环。生成-测试-修正-再验证,每一步都让证据说话。Opa创业者也该听这句:让模型出结果,让人做裁判。
4/ 真正的机会在教育客户。老周反馈一个细节让我印象很深,餐饮老板不