Grok 4.7跳票两个月终于上线,这周扎堆发新模型的牌桌上,OPC创业者该押哪个?
给老读者的一封信:这周大模型扎堆上新,我劝你先看清“调用量”这张底牌
老读者都知道,我很少在周五之前动笔。但这周实在憋不住——从周二开始,我的信息流就没消停过:Grok 4.7 终于上线,Qwen4、Kimi K3.1 排着队,GPT-6 Sol 和 Opus 5.5 的传言满天飞。朋友圈里一半人在发评测截图,另一半人在问"该换哪个模型"。
先别急着换。我想跟你聊一张被所有人忽略的底牌:调用量。
Grok 4.7 这次跳票跳得漂亮。7 月 24 日马斯克说"4 周内发布",8 月 12 日改口"3 到 4 周",9 月 2 日发帖"10 天后上线",9 月 11 日又来一句"还差点意思,再等几天"。将近两个月,吊足了胃口。发布时官方说 2.1 万亿参数,比 Grok 4.6 多 40%,"价格不变、速度不变、性能全面提升"。
听起来很爽,对吧?但注意我的用词——"官方宣称"。
Grok 4.7 这次的发布策略很值得关注:优先落地开发者端,走 API 和 GitHub Copilot,网页版和 X 内嵌的 Grok bot 都没同步更新。这等于 SpaceXAI 自己承认了,这个模型的定位是编程和知识工作助手,不是给普通用户聊天用的。
为什么?因为真正决定一个模型生死的,从来不是发布会的掌声,是它每天被调用了多少次。
《每日经济新闻》根据 OpenRouter 的数据测算,上周(9 月 14 日到 20 日)全球 AI 大模型总调用量 129 万亿 Token。其中中国模型 67.46 万亿,美国模型 14.21 万亿——中国是美国的 4.7 倍,而且已经连续二十一周领跑。
这组数字,比任何参数表都更能说明问题。
DeepSeek V4.1-Flash 上周登顶调用量榜首,环比增长 219%。一个 7480 亿参数的 Flash 模型,综合指数只有 63.7,看起来不起眼,但纯编程能力是另一个级别。它的 API 定价是输入每百万 token 0.14 美元、输出 0.28 美元。这是什么概念?一个中等规模的自动化项目跑一整个月,成本可能还没你一顿饭贵。
再看 Grok 4.7 的定价:输入 2 美元/百万 token,输出 6 美元/百万 token。性能也许确实强,但价格是 DeepSeek Flash 的十几倍。
我接触过的一人公司和三人小队,最常问的问题是"哪个模型最强"。这个问题问错了。你真正该问的是:哪个模型能在我的场景里被高频调用,而不让我心疼账单。
模型越强,你的取数线和交付线就越要提前画好。否则你会在"更强但更贵"和"够用且便宜"之间反复横跳,最后什么都没落地。
说到底,这一周的热闹是他们的。
你的牌桌上,只有调用量这条曲线,才是真正属于你的底牌。
写给一人公司和三人小队:模型越强,你的“取数线”和“交付线”越要提前画好
模型越强,这件事对一人公司和三人小队来说,其实是把刀。
大厂拿到 Grok 4.7、Claude Opus 4.5 这些新模型,第一反应是往流水线里塞,做评测、做路由、做降本。你不行。你一共就三双手,其中可能还有一双要接客户电话。所以对你来说,真正的问题不是「哪个模型最强」,而是「我这条链条上,哪一段交给模型,哪一段必须我自己扛」。
这就是我想说的两条线。
取数线,是你决定从哪里开始把活丢给模型的地方。Grok 4.7 这次的定位很明确——官方把它当编程和知识工作的助手来发,优先给 API 和 GitHub Copilot,而不是先上网页版聊天。这个信号值得关注:模型厂商自己都在往「开发者工作流」里扎,说明它能干的活,是有明确边界的活。你的一人公司就该顺着这个边界画线。哪些是「给个输入就能出结果」的——写个脚本、跑个数据清洗、把一堆杂乱 SQL 理成能跑的查询,这些都该在线以下,交给模型。DeepSeek V4.1 Flash 输入每百万 token 零点一四美元这个价位,意味着这类重复劳动你几乎可以无脑外包出去,成本低到不用算。
交付线,是你决定「在哪一步必须由人签字」的地方。这条线要是画晚了,麻烦比省下的时间多得多。客户要的不是你跑得快,是你跑得对。一个三人小队最怕的不是产能不够,是把没验过的输出直接推给客户,然后花三倍时间救火。
两条线之间,才是你真正的产能区。
一人公司尤其要警惕一件事:模型越强,人越容易把取数线往下压,恨不得从需求到交付全自动。这不是效率,这是失控。你自己都说不清楚中间发生了什么,客户问一句「这里为什么这么算」,你就哑了。
我见过跑得稳的小队,做法都很土——取数线画在「可逆的动作」上,交付线画在「不可逆的动作」前。生成草稿、跑测试、做初版方案,可逆,放进去。发邮件、交付代码、对外承诺时间,不可逆,必须人过一遍。
这跟团队大小没关系,跟责任归属有关系。三人小队没有 QA 部门,没有法务兜底,那条交付线就是你全部的风控。舍予AI智能体提的「老板的第一支 AI 战队」,我理解的重点不在「战队」,在「老板的」——指挥权还在你手里,模型是兵不是将。取数线是你调兵的范围,交付线是你亲自拍板的关口。这两条线画清楚,你才敢真的把活放出去。
Grok 4.7 跳票两个月这件事,其实也在提醒你:模型的能力是别人给的,节奏也是别人定的。你能定的,只有自己那两条线画在哪。
最后说句实话:牌桌上的热闹是他们的,落地场景才是你自己的
Grok 4.7 终于上线了。2.1 万亿参数,比 4.6 多 40%,输入 2 美元、输出 6 美元每百万 token,官方说推理速度是竞品两倍、价格只要一半。从 7 月 24 日马斯克第一次放话算起,这场发布拖了将近两个月,中间改口了四次。牌桌上终于开牌。
但我更想让你看一眼另一组数字。

上周全球大模型总调用量 129 万亿 Token,中国厂商占了 67.46 万亿,连续二十一周超过美国,是人家的 4.7 倍。DeepSeek V4.1-Flash 登顶,环比增长 219%。另一边,智谱开放平台和 API 翻了 27 倍,MiniMax 同期亏损 21 亿——卖调用成了这个阶段的行业特征,有人赚到了量,有人还在交学费。
这两个画面摆在一起看,才是这周真正的信息量。榜单是他们的,调用量才是你的。模型发得再响,如果没进任何人的生产流程,它就只是一条新闻。
OPC 创业者最容易犯的错,是把发布节奏当成自己的节奏。
Grok 4.7 的参数、GPT-6 Sol 的传闻、Kimi K3.1 的预告、Qwen3.8-Flash-Next 作为 Qwen4 架构的提前预览——这些东西值得关注,但不值得等待。Kimi K3.1 到现在连发布日期、模型卡和 API 都还没有。你把季度计划押在一个还没上线的模型上,等于把命交给别人的排期表。
真正该问的是:这个月,我有没有把一个真实场景跑通?
门槛其实已经低到不像话了。DeepSeek V4.1 Flash 输入约 0.14 美元、输出 0.28 美元每百万 token,MIT 许可,随便部署;V4 Pro 在 SWE-bench Verified 上已经逼近 84%,纯编程能力是另一个级别。一个自动化项目跑一个月,成本可能还不够你请客户吃顿饭。工具早就够了,缺的是动手的人。
所以这周我给你的建议只有一条,很小,但能带走:
- 打开你的工作流,找出那个你每周都在重复、每次都烦到想骂人的环节
- 用最便宜的模型把它包起来,不追求优雅,只要跑通
- 跑完记一笔账:省了多少时间,花了多少钱
第一版一定很糙。但糙的版本能跑,比完美的方案躺在文档里强一百倍。
这也是我一直说"老板的第一支 AI 战队"的原因。舍予AI智能体做的正是这件事——一人公司或者三人小队,不需要先去找技术合伙人,先给自己配一支能干活的队伍,把重复的活交出去,你只留判断和交付。模型越强,这笔账越划算;模型越便宜,你能试错的次数就越多。
最后说句实话。
Grok 4.7 会不会赢过 Claude,Qwen4 什么时候发,答案都不在你手里。但你的客户是谁、你的交付长什么样、你踩过哪些坑、你手里那套别人抄不走的私有流程——全在你手里。
牌桌上的热闹是他们的。场景是你的。
这周挑一个流程,跑通它。三个月后回头看,你会庆幸自己没在等。