DeepSeek周末统一低谷价,GPT跟着降了20%,我连夜改的是任务排期不是账单

2026-08-23舍予基业来源:公众号「舒毅讲AI」
DeepSeek周末统一低谷价,GPT跟着降了20%,我连夜改的是任务排期不是账单
解读DeepSeek周末低谷价、GPT降价20%、Qwen下载量领先及字节Seed组织调整等动态,帮开发者理清何时该挪任务、如何选开源模型,避免只看价格或榜单做决策。

周六晚上十一点多,一个做SaaS的朋友在微信上甩过来一张截图,问我:“这咋算?是不是周末跑批量等于白嫖?”

截图是DeepSeek的最新公告:从今天(8月23日)零点起,周六周日全天统一按低谷时段价格收取API调用费用。

这距离8月17日DeepSeek刚上线峰谷定价机制,还不到一周。价格战打到一半,突然把周末的闸门全打开了。

朋友的问题很直接,但我的第一反应不是账单,是任务排期。如果只是把跑批挪到周末,省下的那点Token费用,撑不起一个OPC创业者该思考的变量。

我把这个问题拆开,正好最近有几条模型动态值得串起来聊。

“周末低谷价+GPT降价20%,我是不是该把活儿全挪到周末跑?”

先说你截图里的事。DeepSeek这次调整,本质是把周末的计费逻辑简化了:不再分高峰低谷,全天统一按低谷价收。对开发者来说,周末的调用成本确定性地降下来了,不用再掐着时段发请求。

这是好事吗?短期是。尤其是那些有大批量离线任务的团队——数据清洗、日志分析、批量embedding、测试集跑分,这些活儿跟实时交互没关系,早跑晚跑不差那几分钟。

但更该盯的是这轮价格调整的节奏。

OpenAI这边几乎同一时间宣布,未来三个月内把GPT-5.6 Sol的API价格下调20%以上,每百万Tokens输入从5美元降到4美元,输出从30美元降到20美元。缓存和长上下文的价格也同步松了。而且这个降价不是“Pro用户专属”,直接推到了ChatGPT Work和Codex credits方案里。

两条消息放一起看,信号很明确:模型推理成本还在往下走,大厂之间已经在用价格抢开发者的“默认选项”心智了。

所以回到你那个问题:要不要把活儿全挪到周末?

我的建议是,别因为降价就重排整个生产节奏。真正该做的是把任务分成两类。第一类离线批处理,弹性大,可以毫不犹豫挪到周末低谷跑,省一点是一点。第二类是在线交互、Agent调用、编码辅助这类对延迟敏感的任务,核心成本不在Token单价,在上下文长度和调用次数上——你降的那20%,可能还不够一次长上下文缓存未命中的开销。

落地场景比单价更值得盯。GPT-5.6 Sol这次同步下调了缓存和长上下文档位的价格,对编码开发者来说,这个细节比单纯的输入输出降价更实际:长上下文的单位成本,才是Agent类应用的隐藏大头。

“Qwen下载量是Kimi的55倍,我选开源模型是不是闭眼跟Qwen就行?”

这是另一个读者在后台问的。他的原话是:“看Hugging Face那个报告,Qwen下载量太猛了,我是不是不用纠结了,直接全家桶上Qwen?”

我不这么看。

先承认事实:Qwen确实猛。过去6个月全球累计下载量突破30亿次,超过Meta、Google和中国同行,成为目前全球下载量最高的开放式AI模型家族。阿里这边开源的模型已经超过460个,生态衍生版本30多万个。对照之下,Moonshot Kimi同期下载量大约是3700万次,Qwen是它的55倍。

但这里有个被很多人忽略的结构性数据:在Hugging Face平台上,10亿参数以下的小模型占历史下载量的83%,超千亿参数的巨型模型只占1%。换句话说,开发者投票的不是“最强模型”,是“跑得动的模型”。

GGUF格式的下载量更能说明问题。Qwen每月3960万次,大约是Google Gemma的2倍、Meta Llama的5倍以上。但报告里也点了一句:Llama的GGUF版本数量反而略多于Qwen。

翻译一下:Qwen赢在“货架多、能落地”,Llama赢在“变体多、生态杂”。你如果是做本地部署,第一优先考虑的其实不是模型论文分,是量化版本的质量、推理框架的适配度,以及出了问题能不能找到足够多的社区踩坑记录。

那22个前沿模型的审计结果也再提一遍:37.1%的通过任务涉及作弊,平均通过率41.5%,真实解决率只有26.1%。个别模型虚增高达5倍。即便加入最严苛的反作弊提示,还有8个模型在作弊。

加上Hugging Face在语音识别上的“刷分”测评,结论很一致:现在的模型榜单,分数跟实际落地能力之间的裂缝比你想的大。OPC创业者选模型,如果只看下载量或者只看排行榜,都会掉进同一种坑。

我的建议是,Qwen作为默认的“第一候选”没问题,但别闭眼跟。具体到每一个业务场景,拿真实数据跑一轮评测,比翻任何榜单都管用。特别是Gemma、Mistral、Grok这些在某些垂直任务上可能更顺手,别用下载量把它们一票否决。

“字节Seed这次把B端办公和C端对话拆开了,跟我们有啥关系?”

这问题来自一个做企业交付的朋友。他看到的是字节Seed上周的组织调整:Seed Foundation Model新设四个一级部门,分别管预训练数据、强化学习、B端Agentic模型、C端对话模型。

我更在意的是秦禹嘉负责的那个方向——Product Posttrain-Work,面向B端,做Agentic模型整合发布和办公场景优化。朱文佳那边的Product Posttrain-Chat,则更名后承担C端对话模型。

这个拆法本身就是在纠偏。过去大家喊Agent喊了那么久,真正在办公场景里跑得稳的没几个。原因不复杂:对话模型擅长闲聊式交互,但办公Agent需要的是“理解任务、规划步骤、调用工具、返回结果”这一整条链路的稳定完成。这跟聊天是两种训练目标。

配图

字节把这两个方向拆开,说明大厂已经不再试图用一个模型通吃所有场景。这对OPC创业者是个信号:别指望通用大模型直接把企业交付做完,你的空间恰恰在模型能力到具体业务之间的那层“胶水”上——工作流编排、评测集建设、提示词工程、数据回流、结果校验。

我自己的团队(舍予AI智能体)最近在给客户做模型调度时也踩过这个坑。同一个模型,聊天场景里表现很顺,但一接到“读取工单、判断紧急程度、自动派单、回写系统”这个链路,就经常在第三步断掉。后来我们干脆把“对话”和“执行”拆成两个通道,分别调不同模型,稳定性才提上来。

所以豆包这个动作,落地场景的意思很明确:B端Agentic模型会越来越“办公化”,这意味着会带起一波工具链需求。做coding自动化的朋友,尤其该盯着这个方向。

“Anthropic挖谷歌TPU负责人自研芯片,英伟达60亿砸Poolside,这些上游跟我写代码有啥关系?”

这问题听起来像另一个世界:你靠API吃饭,上游芯片和模型工厂的事,跟你写代码能有什么关系?

但这两个动作,恰恰跟coding开发者未来两年的成本结构直接相关。

Anthropic把前谷歌TPU负责人、七代TPU芯片主导交付者阿米尔·萨莱克请进计算团队,明摆着要自研半导体。以Anthropic现在同时从英伟达、谷歌、亚马逊采购芯片的体量,自研芯片一旦跑通,意味着Claude的推理成本会再下一个台阶。

英伟达那边更直接:60亿美元拿Poolside的AI模型开发软件授权,投前估值120亿美元,还向109名参与Laguna模型研发的Poolside员工发出聘用邀约。重点不是钱,是“模型工厂”(Model Factory)这个授权。英伟达要的不只是模型,是一套把模型开发流程标准化、可复制的系统。

这两件事放一起,结论就清晰了:模型训练和推理的成本曲线还在陡峭下行,模型开发本身也在被“工厂化”。这意味着你今天基于API用量定价的产品,明天可能就要面对成本结构被重构的冲击。

落到coding开发者身上,两件事得做:别把模型调用费用当成固定成本去定价,要设计成可变成本,随着上游降价动态调整毛利空间。同时,如果你的产品还在做“套壳”,趁早往上层走,把价值沉淀到工作流、评测数据、行业know-how这些模型降不动的部分。

另外,最近OpenRouter上冒出来的神秘模型Ox Alpha,号称百万Token级上下文、多模态、免费开放,社区分析指向智谱GLM系列——这可能是下一代多模态模型的早期压力测试。GLM这个信号也值得纳入你的模型观察池里,尤其是做长文档处理和复杂上下文任务的团队。


聊到最后,我想把话说得再直白一点。

这一波模型价格调整和生态变动,真正该改的不是

AI应用模型选型API价格企业智能化

想知道这套东西装到你的生意里是什么样?

留个联系方式,顾问按你的行业给一版可落地的方案。