EvilTokens用AI翻完被盗邮箱,OPC创业者的合规缝隙在哪
先别急着骂黑产,看看EvilTokens把AI用成了什么样
先说一个让我坐直了的事实:2026 年这一波黑产,已经不是在用 AI 写钓鱼邮件了。他们在用 AI 读邮件。
这两件事的差距,比大多数人以为的大得多。
写钓鱼邮件,门槛在"文笔"。语法别扭、称呼不对、口吻不像真人,稍微有点经验的人一眼能看出破绽。这也是过去十年反钓鱼培训能起作用的原因——教人识别"不对劲"。但 EvilTokens 干的事情完全是另一路:它拿到的是一批已经攻破的邮箱,然后让模型去快速理解这些收件箱里的内容——谁在给谁付钱、付款关系是怎么走的、哪些邮件往来构成了可以冒认的身份链条。微软后来联合合作伙伴把相关基建端掉了,这个动作本身说明问题已经大到必须动基础设施层面。
关键变量在这儿:AI 把"读"的成本压到了接近零。
以前一个收件箱要人工翻,翻几十封就得几小时,还要看得懂业务上下文、分得清哪些是噪音哪些是有效关系。这是个体力活,也是黑产规模化的瓶颈——人力永远是瓶颈。现在模型几分钟吞完几年的邮件历史,输出的不是摘要,是结构化的"关系图":谁是付款方,谁是审批人,谁的口气可以模仿。落到落地场景上,这就不是一封钓鱼邮件了,是一条可以复用多次的冒认路径。
我想说的是另一层。
技术圈有个惯性反应,看到黑产用 AI,第一反应是"这帮人在滥用,得管"。这话没错,但没啥信息量。真正值得关注的是:EvilTokens 展示的不是某个模型的越狱技巧,而是一套把通用能力拼成完整工作流的方法论。理解非结构化文本、抽取实体、建立关系、生成符合语境的输出——这套东西,做企业知识库的团队在做,做客服自动化的团队在做,做合同审阅的团队也在做。能力是同一批能力。黑产只是把它接在了被盗数据上。
所以骂黑产骂不出任何解法。它用对了工具,用错了地方,而我们该看的是:同样的工具,合规的那一侧为什么还没跑起来。
一个真实场景:绝大多数公司的收件箱是零审计的。没人知道三年前的某封邮件里暴露了多少付款关系,也没人知道某个离职员工的邮箱里还挂着多少"可冒认对象"。这个位置,AI 现在恰好能补——一次扫描,把风险面画出来。同一个模型,同一个能力,站在哪一边,是个选择。
顺带说一句,国内这一年的模型迭代也在往这条路上走。豆包、智谱、MiniMax、千问、DeepSeek 轮番把长上下文和结构化抽取的价格往下压,能力曲线是往上走的,成本曲线是往下走的。这意味着"给收件箱做一次体检"这件事,从大厂专属,正在变成中小企业也能算得过账的动作。我自己的判断是,未来一年里,"邮箱风险面扫描"会从安全团队的小众工具,变成和财务对账一样常规的季度动作。
至于那一截被微软端掉之后空出来的需求,以及被盗邮箱里到底藏着什么,下一节说。
被盗邮箱里藏着的不是密码,是付款关系和可冒认对象
被盗邮箱的价值排序,跟大多数人想的是反的。
密码排最后。改密码、开二次验证,两分钟的事。真正值钱的是收件箱里那几百上千封邮件拼出来的东西:你在跟谁谈钱、账期多久、谁有权审批、最近有没有人发过"更新收款账户"的通知。这些信息不会因为改一次密码就失效,它们躺在历史邮件里,一年两年都在。
EvilTokens 被点名的地方就在这儿——用 AI 快速理解被盗 Inbox,把付款关系和可冒认对象一起捞出来。纯手工读邮件,一个人一天啃不完一个中型公司的收件箱;现在这一步被压到分钟级。
付款关系是一张图,不是一串账号。
拆开看有几层:
- 谁付钱给谁,金额区间、周期、发票格式
- 审批链:谁签、谁抄送、谁只是知会
- 变更节点:合同续签、供应商切换、年度对账
- 例外情况:临时预付款、加急采购、老板口头答应过的那笔
对黑产来说最后一条最香。它意味着流程可以破例——只要理由看起来对。
可冒认对象是第二层,也是更隐蔽的一层。 AI 读得够多,能把老板的措辞习惯、称呼方式、回复速度、签名档都描出来。然后它只需要挑一个正确的人、在正确的时间、发一封语气正确的邮件。收件人不会去查 SPF,他会想"老板上周刚提过这家供应商"。
GPT-6 Sol 的价钱是 GPT-5.6 的一半,Claude Opus 5.5 比 Opus 5 便宜 40%,缓存读取从 0.5 美元掉到 0.2 美元每百万 token。阅读理解加角色扮演,两项能力同时在降价。这对防守方是同一张牌——关键变量不在模型多强,在于谁先用上。
对一人公司,这个风险是放大的。
OPC 没有财务复核,没有法务会签,收件箱就是全部的财务部、法务部和人事部。别人收到"老板邮件",默认不会怀疑;而老板确实什么都自己拍板,所以"临时改个收款账户"这个剧本,逻辑上完全成立。可冒认对象的命中率接近百分之百。
我一直觉得,OPC 老板现在的处境是:既没有第二双眼睛,又要干掉一整个团队的活。所以得先给自己配一支队伍——舍予AI智能体讲的"老板的第一支 AI 战队",我会把第一个岗位放在收件箱。不是让它回邮件,是让它盯关系:谁能动钱、最近三个月有没有人催过换账户、哪封邮件的语气基线偏了。
防线要从"账号安全"挪到"关系安全"。密码泄露是一条日志,付款关系被读懂是一场事故,量级不一样。
微软端掉那批基建之后,这套阅读理解能力不会消失。工具还在降价,需求还在原地。接住这截需求的,是防守方,还是下一批 EvilTokens。
微软端掉基建之后,留下的那截需求谁来接
微软联合伙伴端掉 EvilTokens 基建这条,多数人看完就翻过去了。我盯着的是它的能力描述——用 AI 快速理解被盗 Inbox、付款关系、可冒认对象。
拆开就是三个动作:读非结构化收件箱、重建付款关系图谱、判断谁可以被冒认。过去要一个熟练的欺诈分析师干几天,现在模型几个小时跑完。攻击方的工具链已经换代,防守方还在人工翻邮件。
基建被端,工具不会消失。模型是公开的,GPT-6 Sol 的价格只有 GPT-5.6 的一半,Claude Opus 5.5 跑起来比 Opus 5 便宜 40%,缓存读取一项降了 60%——代理式工作和写代码的花费大半落在这里。攻击的边际成本在往下走,防守那截需求反而被这次清场照得清清楚楚。
关键变量在供给结构。 防守能力正被两头挤压。
一头是大厂。Palo Alto 的 Unit 42 推出 Continuous Frontier AI Defense,做 agentic offensive security——用 Agent 去打 Agent。这很重、很贵,服务的是有钱养安全团队的公司。
另一头是基础设施。DigitalOcean Managed Agents 把 Agent 放进独立 microVM,支持暂停、恢复、checkpoint,还接好了受管工具。让一个 Agent 去读敏感邮件、跑判断、随时回滚,工程上已经不难。

两头顶着,中间是空的。
而中间这块,恰恰是 OPC 创业者和一人公司最密集的地带。他们没有可被端掉的基建,也没有安全预算,但收件箱里同样藏着付款关系和可冒认对象。这截需求谁来接?不会是安全厂商,也不会是模型公司,而是那些把 Agent 落到具体业务流里的小团队。
比如把“收件箱体检”做成可订阅的动作:Agent 定期扫一遍开户邮件、发票、供应商变更通知,标出异常付款关系,标出可被冒认的身份。这不需要多前沿的模型,需要的是业务流理解和工程上的稳妥。舍予AI智能体把自己定位成“老板的第一支AI战队”,位置感是对的——老板不买安全平台,他需要一支能替他盯收件箱、盯付款关系、盯冒认风险的 AI 队伍。
有人嫌这场景太窄。窄才对。大厂做通用能力,小团队做最后一公里。GPT-6 Sol 和 Luna 的分层逻辑已经说透了:复杂判断用 Sol,超大批量用 Luna,成本按 token 和纠错量算。防守恰恰是超大批量、低单价的活儿,一天扫一堆邮件,大半是噪音,Agent 的价值就在过滤掉噪音的那一下。
微软端掉的是基建,不是需求。它把攻击方的工具链摆上台面,也顺手给防守方画了靶心。谁能把“读懂收件箱”做成合规、可订阅、可回滚的服务,谁就接住了这截需求。
给OPC创业者的三个切口:从收件箱体检到冒认预警
EvilTokens这事翻过来看,等于给OPC创业者递了一份现成的需求清单。黑产拿AI干的三件事——读懂你的收件箱、找出你的付款关系、锁定可冒认对象——你自己先做一遍,就是三个切口。
切口一:给收件箱做一次体检。
一人公司的资产清单不在ERP里,在收件箱里。近十二个月的邮件导出,交给长上下文模型,让它输出三张表:谁在给你付钱、你在给谁付钱、哪些身份关系可以被人拿去冒认——对外签名档、常用落款、合作方对接人、发票抬头,都在里面。
这事一年前属于"想做但算不过账"。现在Claude Opus 5.5把缓存读取从每百万token 0.5美元压到0.2美元,降了60%,而代理式工作的大头成本正好压在缓存读取上。同一份收件箱反复扫、反复比对,账算得过来了。这就是落地场景从"能做"变成"值得做"的分界线。
切口二:把冒认预警做成能交付的东西。
OPC最尴尬的地方是,需要安全能力,但养不起安全团队。Palo Alto Networks在9月22日推出Unit 42 Continuous Frontier AI Defense,走的是agentic offensive security的路子,大厂在做企业级的持续对抗。中间那层是空着的:谁给十几个人的小团队、给一个人的公司做冒认预警?
答案通常是另一个一人公司。你能卖的其实很轻——监测以客户名义发出的异常邮件模式、盯住那几个高频冒认对象的变化、出异常时给人而不是给系统发警报。交付物不需要漂亮,需要的是"有人一直在看"。舍予AI智能体那句"老板的第一支AI战队",落到OPC身上,最早要补的就是这个"一直在看"的岗位。
切口三:把成本压到能订阅。
持续监测的敌人不是模型能力,是账单。两个关键变量:模型侧的降价节奏,GPT-6 Sol的价格只有GPT-5.6的一半,Luna面向高速大量任务,分层的意思就是脏活可以扔给便宜那档;执行侧要隔离,DigitalOcean Managed Agents把agent跑在独立microVM里,支持暂停、恢复和checkpoint,客户数据不跟你的主环境混在一起,出问题能回滚。这不是技术洁癖,是能不能在合规缝隙里站住脚的前提。
三个切口里,我最看好第一个。它不需要客户,不需要定价,不需要说服任何人,只需要你今天动手。
给一个带得走的动作:这周挑两个小时,把近一年的邮件导出来,让模型列三张清单——付款关系、订阅项、可冒认身份。你会比自己想象中更快地发现,名下有五六个从没人看过的收款入口。这张清单也是后面所有生意的地基:先证明你管得住自己的收件箱,再把它变成替老板管收件箱的服务。OPC不需要一支安全部门,需要的是有人把这三件事一直做下去。