一个Agent月账单从8万砍到9千,我们没换模型,只换了个"发车时间"
上个月,我们给一个做零售连锁的OPC客户部署对账Agent,月底看账单,八万二。
老板直接在群里问了一句:你们这AI是拿算力当水喝?
说实话我第一反应也懵。同一个Agent,测试期跑得好好的,怎么一上生产就翻了十倍。后来把OpenRouter的日志拉出来一看,问题根本不在Agent逻辑上,在于它什么时候在跑。
今天正好是2026年8月18日,几个大模型的动态撞在一起,我想把这个案例复盘出来。因为这件事背后的那个变量,比模型本身更值得所有OPC创业者盯紧。
背景:一个看似标准的多模型调度,踩了最贵的坑
客户是做零食折扣店的,400多家门店,每天闭店后要把POS数据、库存变动、退货单汇总,做对账和补货建议。我们做的Agent,简单说就是夜里把数据拉出来,分给模型处理,生成对账报告,第二天早上店长和督导看结果。
技术栈不复杂:主流程挂在一个推理能力强的闭源模型上,量大但简单的数据清洗扔给开源小模型,中间用OpenRouter做路由。当时觉得这套架子挺标准,该省的都省了。
结果上线三周,账单一路往上飙。
后来复盘才发现,Agent是设定在每天闭店后半小时启动,那会儿正好是晚上10点前后。我们看图省事,把所有门店的数据一次性全推上去。高峰期调用、高并发、长上下文、推理强度拉满,还赶上个别模型刚调过价。
八万二就这么烧出来的。
客户那边差点把这个项目毙了。我们也一度怀疑,是不是模型选错了。
转折:不是模型的问题,是"发车时间"的问题
真正破题的,是8月17日DeepSeek的一条公告。
DeepSeek的API从8月17日零点起启用峰谷分时定价。每天9点到12点、下午2点到6点是高峰时段,其余时间是空闲时段,空闲时段价格只有高峰的一半。主力模型V4 Flash和V4 Pro都公布了具体报价,其中V4 Pro高峰时段相比之前初始定价涨幅还挺明显。
我看到这条的第一反应,不是"DeepSeek涨没涨价",而是它把一件以前大家嘴上说、但很少真正当产品策略做的事,摆到了台面上:算力高峰是稀缺资源,应该贵;空闲时段是闲置资产,应该便宜。
这不就是OPC创业者天天帮客户算的那本账吗?
我们回去把这个对账Agent的所有任务重新排了一下。对账这件事,真的有严格的"必须在10点前出结果"吗?其实没有。店长第二天早上7点前看到就行。补货建议更是可以推到凌晨再跑,甚至拆成两批。
于是我们做了三件事。
第一,把可延迟任务挪到凌晨2点到6点之间跑,吃DeepSeek空闲时段的半价窗口。
第二,按任务难度分模型。对账这类结构化、规则性强的活,根本不需要顶配闭源模型。用开源模型跑,结果完全够用。真正需要强推理的异常检测、补货决策,才走闭源。这个逻辑被一条新闻再次印证:法国《回声报》7月的一篇报道对比了Kimi K3和OpenAI的GPT-5.6 Sol,结果很接近,科学推理一个是93.5,一个是94.1,几乎持平。但价格差了不止一个量级。
第三,给这个Agent加了一层调度逻辑。它不再是无脑启动,而是先判断当前时段、任务类型、可用模型价格,再决定发多少任务、发到哪条路线上。本质上,我们是把"分时定价"这套规则,反向装进了Agent的派活机制里。
结果:账单从八万二降到九千三,准确率没掉
说结果。满打满算,新方案跑满一个月,账单九千三。
降了差不多九成。
客户那边从"这玩意儿太烧钱"变成"再给我上一个"。因为对账准确率基本没变化,报告还更早到店长了,凌晨跑完,早上6点App推送,人起来就能看。
这个案例让我确认了一个判断:OPC创业者未来一段时间的核心溢价,不在模型本身,而在模型之间的调度层。
你今天随便打开一个新闻,都能看到信号。
OpenAI在上月底正式解散了那个负责评估前沿模型严重风险的防范团队。你怎么读这条?我读的是:连OpenAI自己都在把资源从"单个模型的安全完备"往"系统层面的可控"上挪。模型不再是那个需要被小心翼翼供起来的东西,它就是个可替换、可调度、可组合的组件。
Anthropic那边,2026年Q2初步营收超115亿美元,同比至少涨了14倍,还在秘交上市申请。Claude的商业化猛冲,但你知道吗,它最近公开了Claude文本水印技术细节,最新模型已内置,老模型也在适配。这说明什么?说明当模型能力卷到一定程度,信任、合规、可追溯这些"水面上"的功夫开始值钱了。
再往大了看,Stripe以超过70亿美元收购OpenRouter,一个聚合了400多种模型、800万用户的基础设施公司。这在两年前根本不可想象。如今它成了AI领域的Stripe,被Stripe自己买了。这说明模型分发的通道,正在变成比单个模型更有定价权的环节。
对OPC创业者和coding开发者,这几条必须抄走

今天的模型动态其实不少,但真正跟OPC创业者钱包相关的,就这几个点。
第一,分时定价会成为常态,但多数开发者还没反应过来。DeepSeek这步棋,大概率不是孤例。阿里云、智谱、MiniMax这些国内平台一直有闲时优惠的探索,只是没这么明确地做成产品策略。对OPC来说,这是一个几乎零成本的优化空间。你的Agent能不能"等一等再跑"?能,就把成本打下来。不能,那就得算清楚,这个即时性到底值多少钱。
第二,Qwen这条线,值得所有做私有化部署的创业者重新审一遍。8月16日,阿里正式开源了Qwen3.8系列模型,之前公开的数据是Qwen系列已经开放了超过460款模型,生态衍生模型突破30万个。Hugging Face的统计更吓人:今年前7个月,Qwen旗下模型在平台累计下载约20.61亿次,远高于Google的4.18亿和Meta的2.27亿。Qwen在Hugging Face上已经有超过15.1万个衍生模型,是Meta整体的2.6倍。这条线对OPC的意义不是"又出个开源模型",而是你给中小企业做代码助手、做私有化部署时,底座选型的空间比以前大得多。
第三,"足够好"正在压过"最好"。美联社7月那篇报道里,有个美国科技高管说了一句大实话:"我们超过90%的人,并不需要Mythos或Fable,我们只需要足够好的东西。"中国模型的Token调用量已经连续15周超过美国,推理价格从5月底的2.04美元/百万token降到8月初的1.16美元。OpenRouter上中国大模型周调用量34.25万亿token,环比还在涨21.76%。这个趋势对OPC创业者来讲,翻译过来就是一句话:别一上来就上最贵的模型,客户不关心你用的是不是顶配,他关心的是这个月账单能不能活下去。
第四,美团这轮内部AI化,是中小实体生意的一面镜子。美团核心本地商业CEO王莆中7月有个内部复盘,很实在。他说2到3月全员"养虾运动"砸下去,成本暴涨还干扰经营;4月才开始各事业部成立AI组织、梳理转型步骤;6到7月用赛马机制逼出AI到底该怎么落;最后7月全场景AI Agent平台CatPaw跑起来,覆盖9万员工、搭了3万个Agent,才真正产生价值。这四步,几乎是我们服务每个传统行业客户都会经历的完整曲线。OPC创业者帮客户踩坑时,心里要有这张地图。
第五,模型在降级,调度在升值。今天你去看Cursor开放Origin代码托管,OpenRouter上线Activity仪表盘和图像API,AgentCore Payments在给LangChain智能体做确定性预算支付,甚至Google开源零信任客服智能体示例——所有这些动作都指向同一件事:模型本身越来越像电,而值钱的是电网、电表和开关。
这就是我说的关键变量。
我们把这个逻辑装进了舍予AI智能体的默认配置里
说句不藏着的话。我们现在给"舍予AI智能体"——就是那支被我们戏称为"老板的第一支AI战队"的团队——做客户交付时,默认就会跑一层成本巡检的Agent。它不干别的,就盯着一件事:每个任务,是不是在它该去的时间、用该用的模型、花该花的钱。
不是每个客户都愿意听你讲"分时定价"那套。但你给他看账单曲线掉下来那一瞬间,基本都听进去了。
这个月我给团队定的规矩也简单:谁再让一个对账任务在晚上9点高峰期跑顶配模型,算事故。
不是开玩笑。
模型天天在变,今天DeepSeek调价,明天Qwen开源,后天Claude上市。但OPC创业者真正要攥在手里的,永远是那层"知道什么时候该派谁去干哪件事"的调度能力。
那才是我们这些人的饭碗。