过去一段时间,AI 行业一个很少被正面承认的事实是:AI 已经是 AI 自己的最大客户。OpenRouter 给出的数据已经把这个判断做实——2026 年 2 月 6 日之后,Agent 端的 token 消费半年内增长 14 倍,而人类侧只增长 2.8 倍。这是一个不可逆的结构性翻转:模型工厂、路由层、Harness、工具市场、评测集的真正买家,已经从写 Prompt 的人,变成了写 Agent 的人和训练 Agent 的系统。
当这件事发生后,过去三年很多默认的商业逻辑都会被动摇。最显眼的三条是:第一,”最强模型 = 最赚钱”在企业侧并不成立;第二,模型层的边际收益正在被算力与内存的边际成本反向挤压;第三,工程团队真正要竞争的,不再是”我会用 AI”,而是”我的 Agent 能在 AI-to-AI 的循环里更便宜、更稳、更快地把任务闭环”。
从”卖 token”到”卖会话”:商业模型正在被改写
Agent token 消费 14× 增长,最直接的影响不是某一家模型厂商多赚了钱,而是定价、监控、评测这三个产品维度都被迫重写。当 Agent 一次任务可能要跑几十轮工具调用、跨多个模型来回切换时,”每千 token 单价”不再是客户唯一关心的指标,真正决定成本的是”每个会话消耗多少 token、跑多少轮、多少次失败回滚”。
这条逻辑其实已经在产业层面得到验证。Anthropic 把 Claude Mythos 5 放进企业安全场景,按 token 计费但只面向合作伙伴开放;OpenAI 公开警告”持续性 AI 网络攻击”已经成为关键基础设施的新威胁;红队演练默认带 AI。模型厂商不再只把模型卖给最终用户,而是把模型卖给”另一个 Agent 系统”——这本身就说明 AI-to-AI 经济已经在发生。
对个人开发者和中小团队的影响同样直接。继续盯着”哪个模型最强”已经意义有限,更值得投入精力的是路由层、缓存层、会话复盘层:能不能用 3.7 Flash 这种便宜档完成任务,能不能在多模型之间按预算自动切换,能不能把每一轮失败都变成可被检索的经验。把”按会话优化”和”按 token 优化”放在一起做,会是接下来 12 个月性价比最高的工程动作。
Skills 与 Harness 的实证答案:复杂度的临界点已经踩到
如果说 14× 是商业侧的拐点,那么 Skills 的实证研究则是工程侧的拐点。Princeton 与 UCSD 的团队把 Anthropic 不到一周前推出的 Skills 机制做了系统量化:procedural grounding 上带来 65.7% 的提升,但当 skill 库从 5 个涨到 100 个,检索精度从 29.6% 暴跌到 3.3%。换句话说,Skill 不是”加得越多越好”,它有自己的容量上限和失效模式。
这条结论之所以重要,是因为过去半年 Skill、Harness、Meta-harness、共享记忆几乎被默认当作”AI Agent 的未来”。但实证数据提醒了一件事:当 Agent 开始互相消费 token、互相调用工具、互相写入共享记忆,规模一旦超过某个临界点,单纯堆叠 Skill 和 Context 不会带来线性提升,反而会引入检索失效、记忆污染和权限泄漏。
MCP 在这一周更新的官方路线图也印证了同一判断:从工具调用接口扩展到 Agent 间消息、统一 HTTP 传输、Agent 身份与企业级安全——协议层正在主动处理”Agent 互相调用时的复杂度爆炸”问题。再叠加 HarnessRouter、Prism Reviewer、Henka、Locus 这些项目集中出现在 GitHub Trending,可以看到一件事:Agent 4 层栈(协议 → Harness → 沙箱 → 共享记忆)已经从概念走向工程化基线。
算力底座正在反向挤压模型层
商业侧拐点和工程侧拐点之外,还有第三条暗线在同步收紧:算力底座。Nvidia 已经通知大客户,2026 年初交付的 AI 服务器价格上调 15% 以上,GB300 和 Vera Rubin 200 部分型号涨幅约 17%。直接原因是 HBM 与 DRAM 内存供应链紧张,行业测算 1GW 数据中心因此要多花约 50 亿美元。
同一周,Nvidia 用 60 亿美元拿下 Poolside 的”Model Factory”许可与 109 人团队——不是 acquihire,而是把 Poolside 整套模型工业化训练流水线吃下。Waymo 启动自研芯片来减少对 Nvidia 的依赖。一边是 GPU 与内存涨价,一边是头部玩家把”造模型的方法论”和”机器人出租车的算力底座”都收回自建。模型层、应用层和硬件层之间的边界正在被重新切。
这条趋势对个人开发者最直接的含义是:继续把预算压在”本地大模型 + 高端显卡”上的边际收益正在变低,更稳妥的姿势仍然是 API 优先 + 小模型 fallback + 严格 token 预算。当最便宜的 Gemini 3.7 Flash、DeepSeek V4 Pro 0813、Grok 4.6 同周进入 frontier;当国产模型在”长期多轮真实任务”上首次系统性领先闭源——性价比已经成为新竞争维度,单点能力领先已经撑不起商业差异化。
具身一侧:从演示动作到持续不出意外
如果只看软件层,会忽略另一条同样重要的线:具身智能正在悄悄换跑道。WRC 2026 这一周密集曝光的几个信号——银河通用机器人与人类网球选手对打并全球直播、无界动力把”机器人咖啡店”搬进现场并稳定运行、启元机器人 Q1/T1 开启 C 端预订、双足赛车一镜到底完成全自主过弯——它们共同说明一件事:行业评价标准已经从”能不能做出动作”转向”能不能在真实环境里持续工作、不出意外”。
这背后的工程含义是,长时序任务链、动态环境感知、多机协同、异常恢复,正在取代单一动作控制,成为具身智能的新基准。也是同一逻辑,”Agent 4 层栈 + Skills 量化研究 + MCP 协议升级”三个软件层信号会同步出现——它们都在回应同一个问题:复杂系统一旦进入长寿命运行,单纯的”模型够强”已经不够,必须有协议、有 Harness、有沙箱、有共享记忆来托底。
我的判断
AI 行业这一轮真正的变化,不是某一个模型又刷了榜单,也不是又一家厂商发布了更强的 Agent IDE,而是买家身份发生了不可逆切换。AI 已经成为 AI 自己的最大客户,这意味着行业竞争将从”争夺人类 Prompt 用户”转向”争夺 Agent 系统的接入权、调用权与信任权”。
接下来值得长期跟踪的不是某一家模型是否最强,而是三件事:第一,路由层和会话层是否会出现事实标准;第二,Skills、Harness、共享记忆的容量上限与失效模式是否被持续量化;第三,算力涨价压力下,模型工厂是否会出现新的分层——头部闭源 + 中部自建 + 长尾开源 + 个人端侧小模型。当这三件事都逐渐清晰时,今天的许多默认商业判断都需要被重写一遍。