GPT Image 2把画图变成了推理,OPC创业者的机会藏在"验证"这两个字里
一个做设计外包的朋友问我:GPT Image 2出来以后,我们这种小团队是不是可
朋友昨晚十一点半给我发消息,就一句话:GPT Image 2 出来了,我们这种做设计外包的小团队是不是可以准备关门了。
他在杭州带四个人,接电商详情页、品牌视觉,还有一批海外客户的社媒图。我问他,你们上个月交付的东西里,有多少是"想出来"的,有多少是"画出来"的。
他想了半天说,八成时间在画,两成在想。
那问题就清楚了。
GPT Image 2 这次真正变的不是画质。它是第一个把推理能力内建进图像生成流程的主流模型——过去那套靠概率采样拼画面的逻辑被换掉了,模型先拆任务,再规划,然后验证自己画出来的东西对不对。这句话翻译成生意语言就是:它开始"懂"客户要什么了,而不只是"看起来像"客户要什么。
对一个靠出图赚差价的外包团队,这是正面冲撞。客户拿着需求描述,自己就能出一版能看的,那你第一层的价值——手速——被直接抽走。
但我不觉得这是关门信号。我更愿意把它看成一次价值迁移。
生成这件事正在变得极度便宜,便宜到几乎不值钱。真正贵起来的是另一头:确认。 客户自己生一百张图之后,他面对的不是"没得选",是"不知道选哪个"。哪张能过平台审核,哪张不踩品牌方的红线,哪张放大到户外大屏不糊,哪张配色跟上一季度 campaign 接得上。这些判断,模型现在做得比人快,但它没法替客户承担后果。
而且有一件事没变过:客户根本说不清自己要什么。这是设计外包这一行最古老、也最值钱的秘密。
所以我跟他讲,别急着关。你们那四个人里,画图的手可以省掉两个,但"帮客户确认什么是对的"这件事,一个人都省不掉,甚至得加人。我们内部干活的思路也是这样——舍予AI智能体那句定位,"老板的第一支 AI 战队",说的就是这个意思。AI 不是画笔,是替你冲锋和执行的那支队,扣扳机的还是你。
挂电话前我问了他一句:你们现在有没有专门的人,在交付之前说"这版不行"?
他说没有,都是我自己看一眼。
那就是入口。
我的判断是:生成能力越强,验证环节越值钱,OPC的机会不在出图,在帮客户确认"这
回到我那位做设计外包的朋友。他问的是"我们是不是没戏了",我的判断正好反过来:GPT Image 2 杀死的不是设计团队,是"出图"这个动作。
它第一次把推理能力内建进图像生成流程,模型自己会拆任务、会检查自己画得对不对,不再靠概率采样拼画面。结果是出图的边际成本被压到一个近乎荒谬的位置。
成本趋近于零的环节,留不住利润。这是常识。
那利润往哪儿跑?往两头跑。一头是定义需求——到底要做什么;另一头是验证结果——做出来的这个东西到底能不能用。中间的执行,也就是过去外包团队吃饭的那部分,正在塌陷。
生成能力越强,验证越值钱,道理不难想通:当你能轻易拿到一百个版本,稀缺的就不再是版本,而是"哪一版对"。 以前客户付钱买"没人能画",现在客户付钱买"有人能替我判断"。
这个规律在编程上已经演过一遍。Codex、Claude Code 把写代码的成本打下来之后,卡住团队的不是写不出来,是没人看得过来。review 从流程里一个过场,变成了真正的瓶颈,也变成了真正的价值所在。视觉这条线会走同一条路,只是晚了几个月。
有个信号值得关注。DevDay 上 OpenAI 放出的 Decisions API,基于 GPT-6 Luna,干的事小得离谱——在一组预设答案里选一个,返回一个置信度分数。150 毫秒,比直接让 Luna 跑同类任务快一个数量级。它卖的不是生成,也不是推理,就是"做判断"本身,被单独拎出来做成了 API。
大厂开始把判断当成一种独立能力来卖,方向就不用再论证了。
但缝隙也在这儿。模型能判断的,是"这张图符不符合我给的指令"——构图、文字、风格。客户要判断的是另外一套东西:这张图放进详情页会不会拉低转化,老板看了会不会拍桌子。技术判定和生意判定之间,差着一整个语境。这个语境模型现在拿不到,短期内也拿不全。
这就是 OPC 的机会位置。别再跟客户说"我出图更快",这句话在今天的报价单上已经不值钱了。要说的是:我替你确认这张图能不能用,而且我有一套标准,每次都按这套标准来。
出图会被免费化。判断不会。
舍予AI智能体 把位置定在"老板的第一支AI战队",我理解的就是这个意思——老板要的从来不是一支画笔,是一个替他把关、敢说"这个不行"的班子。画笔满地都是,能把关的班子稀缺。
GPT Image 2重构了算力需求结构,推理链取代概率采样,视觉工作流的中间环
GPT Image 2 最容易被忽略的地方,是它把画图这件事的"计量单位"换了。
以前文生图是概率采样:一次前向,模型在像素空间里一路猜下去,猜完给你一张。快、便宜,也粗暴——你没法问它为什么这么画,因为它自己也不知道,那只是一串概率落点的结果。GPT Image 2 是主流模型里第一个把推理能力内建进图像生成流程的:画之前先拆任务,画的时候守约束,画完自己回头验一遍,不达标就改。这已经不是采样了,这是跑一段程序。
计量单位一换,算力需求结构跟着变。
采样的成本大致是个常数,一张图一次,加分辨率就加码,量级可控。推理链的成本是可变的——任务多复杂、要验几轮、中间要不要重新规划,每一步都得算一次。原来算力压在"出图那一瞬",现在摊到了整条链上。而且这条链不是只有一张图,一个视觉工作流跑起来,链上每一步都在同时吃算力。
跳阶式增长这个词,这轮讨论里被反复引用。跳的不只是总量,是结构本身变了:从偶发的高峰,变成持续的、跟任务复杂度绑定的底噪。这也是它被当成资本开支周期风向标来看的原因。

更关键的是中间多出来的一环。
prompt → image → 人看,这是旧流程,中间是黑箱。新流程长这样:需求理解 → 结构规划 → 约束清单 → 生成 → 自检 → 修正。中间那几步是能被看见的——布局、文字、校验项,每一个都是实体,能被调用,能被干预,也能被审计。
同期 OpenAI 在 DevDay 上放出的 Decisions API 是个信号:把"从一组预设答案里选一个并返回置信度"单独做成接口,150 毫秒返回。判断被从大模型体里剥出来,变成一层便宜、快、可反复调用的东西。视觉这条链的走向是一样的。
问题是,大厂只交付最后那张图,不交付中间过程。
中间环谁来搭?这就是眼下最实在的落地场景。不是去训模型,是把客户业务里的那条推理链接起来——检查点设在哪儿、每一步的判断标准是什么、跑偏了怎么回退。这件事必须贴着业务做,大厂做不了,也不值得做。舍予AI智能体把自己定位成"老板的第一支 AI 战队",讲的就是这个意思:不是给老板一个模型,是给老板一组能把这条链跑完、并且跑得住的人手。
生成那一段只会越来越便宜,这个趋势不会停。真正的成本,往后会落在链的中间。
视觉工作流验证环节怎么切入:从"帮客户看图"到"帮客户定义什么叫看对",三步找到
三步的第一步,是把"看图"当成一门正经生意接过来,别嫌它低级。
现在客户的真实痛点不是图不够好,是没人敢签字。设计师不敢拍板这版一定能用,甲方市场部不敢说这版对得上品牌规范,于是来回改、来回等、来回扯。生成能力一旦白菜化,稀缺的就从"出图"挪到了"确认"。你去接这个活,收的不是出图费,是确认费——这版能不能过,你给结论,也给依据。OPC团队天生适合干这个:人少、贴近业务、决策链短,一个客户一个客户的判断攒下来,比任何通用模型都懂他要什么。
第二步,把每一次"看图"的判断,沉淀成客户自己的检查清单。
这一步是分水岭。只做第一步,你是个人力外包,规模天花板肉眼可见;做完第二步,你手里有东西了。具体怎么做:拉出客户最近三次返工,逐条问"当时为什么不算过",把答案写成一句话一条的验收条件。构图比例、主体一致性、品牌色偏差、文字有没有糊、手部结构、场景合理性——一条一条落纸。这张清单的价值远超它看起来的样子,因为它是客户脑子里那套隐性标准第一次被写下来。而写在纸上的东西,才能被模型调用。
第三步,把清单往前推,变成"什么叫看对"的定义权。
到这一步,你卖的不是服务,是标准。客户内部评审图之前,先过你定义的这套规则;模型每次生成,也按这套规则自检。OpenAI 在 DevDay 上拿出来的 Decisions API,本质就是把"在一组预设答案里做判断"压到 150 毫秒——这类能力正在变便宜,意味着验证不再是慢工出细活,而是可以塞进工作流里的一个调用。值得关注的是,GPT Image 2 把推理链嵌进生成流程之后,中间环节的每一步都在产生可判断的中间态,这恰恰是验证环节最肥的落地场景:你不用等最终图,你在推理链上就能拦住错误。
这也是舍予AI智能体的定位逻辑——老板的第一支AI战队,不是替你多画几张,是替你把标准立起来、把判断跑起来。国内豆包、千问、智谱、minimax这些模型的多模态能力也在快速跟进,清单一旦被定义清楚,换哪家模型执行都不影响你的位置。
给你一个带得走的动作:这周挑一个返工最多的客户,把他最近三次打回的原因逐条写下来。写完你大概率会发现,只有四到六条,而且前两条解释了八成的返工。这就是你的第一版验收标准,也是你从"帮客户看图"跨到"帮客户定义什么叫看对"的第一块砖。
关键变量从来不是模型画得多好,是谁有资格说"这版过了"。