过去 72 小时,AI 行业最值得严肃对待的变化,并不是又有一个模型把某个 benchmark 刷新了,而是同一个判断在六个相互独立的方向上同时被验证:模型层的胜负正在被消化,Agent OS 层正在被各家同时铺起来。
把这一周的几个高强度信号放在一起看——Generalist 的 GEN-1.5 让机器人把”看 3 秒示范”当成了物理版的 In-Context Learning;DeepSeek 在 V4-Flash-Vision-Exp 之外,悄无声息地把自家 agent harness 上线 GitHub;ruvnet/ruflo 把”agent meta-harness”摆到了 Trending;obra/superpowers、mattpocock/skills、cursor/plugins 三件套同步浮现,把”技能协议”从概念推向市场层;Tencent/AI-Infra-Guard 与 Tencent/BrowserSkill 一前一后登 Trending,把 Agent 安全的扫描范围从技能文件扩展到 MCP、浏览器、AI Infra 和 LLM;CopilotKit/OpenBot 直接给每个 Agent 分配一台”虚拟电脑”。六条线分别来自机器人、模型厂商、开源框架、协议层、安全厂商和 Agent runtime,没有一家是另一家的跟随者,也没有一条可以单独解释清楚。它们共同在做的,是把”Agent OS”这个隐含假设变成一套可被并行铺设的工程现实。
从”会调工具”到”能跑操作系统”
过去半年,主流叙事是”Agent 会调用工具了”。但”会调工具”和”Agent OS”是两件事。前者只是把模型塞进一个 for-loop 让它能 fire-and-forget,后者意味着:
- 需要一个可被实例化的执行层(harness / runtime),把模型、记忆、技能、工具、verifier 串成一个长寿命对象;
- 需要一套技能描述规范,让不同模型、不同 CLI、不同厂商之间能复用彼此的能力(Anthropic 8 月 19 日推出 skill 文件接口之后,48–72 小时内 obra/superpowers、mattpocock/skills、cursor/plugins 就分叉出协议、规范和市场层,说明这件事已经不只是概念);
- 需要一层安全栈,让”提案”和”授权”解耦——NVIDIA SkillSpector 扫技能文件、decionis agent-safe-pipeline 引入”提议但不授权”架构、Tencent/AI-Infra-Guard 把覆盖范围推到 Agent / Skills / MCP / AI Infra / LLM 五层;
- 需要一个共享知识层,让 agent 之间的研究、分析、推理能被沉淀,OzBrain 直接把”chat UI 是 ops 视图”作为前提;
- 需要一个执行环境抽象,让 agent 拿到独立的浏览器、文件、工具栈而不互相串扰,CopilotKit/OpenBot 把这个抽象取了一个直白的名字——”a computer of their own”。
这五件事不是”未来设想”。在 72 小时内,每一件都至少有一家头部团队把它以代码、协议、扫描器或产品的形式交出来。
真正有意思的信号:Frontier 厂商开始自建 Agent Harness
本周最容易被忽略但意义最重的,是 DeepSeek 在 V4-Flash-Vision-Exp 之外悄悄上线的 deepseek-ai/deepseek-harness。一个 frontier 厂商开始把 agent 的执行层放进自己的仓库——这件事和 OpenAI Operator、Anthropic Computer Use 不在同一个维度上。后两者是产品,前者是基础设施:当一家头部模型公司愿意把自己的 harness 开源给社区,意味着他们认为”Agent 执行层”是值得自己掌握的产品表面,而不是可以外包给 OpenCode 或 LangChain 的工具层。
同步登场的 V4-Flash-Vision-Exp 把”轻量 + 视觉 + 价格档”组合打通,本身是一个产品动作。但它被 deepseek-harness 包住以后,含义就变了:模型不只是被部署、被调用,而是被自家 harness 编排——harness 决定了”什么任务用哪个模型、什么记忆怎么回收、什么技能怎么挂载”。竞争的重点从”我的模型更好”过渡到”我的 Agent OS 更顺”。
NARI Labs 把 Qwen3-TTS 的实时基线压到 50ms 以下,是同一逻辑的工程侧注脚。当系统层面的推理优化可以把”实时语音”从演示场景变成生产场景,单点模型的边际收益就被进一步压低。能创造增量的,是把延迟、内存、工具调度、状态管理整套一起优化的系统层。
物理版 In-Context Learning:Agent 不再只是”在屏幕上动”
Generalist 的 GEN-1.5 是这一周最容易被低估的一条。它的真正意义不是”机器人看 3 秒就学会”这种演示式数字,而是它把语言模型里的 In-Context Learning 搬到了物理世界:
- 零梯度更新、零微调完成一次示范学习;
- 支持把两段不同演示拼接成连续任务,并自行补足重新定位、换抓法和错误恢复等未演示动作;
- 模拟器里的演示可以迁移到真实世界,意味着”physical prompt”开始跨域生效。
目前 GEN-1.5 一次示范的成功率约 59%,加 5 分钟数据和 10 步梯度更新后可到 83%。这个数字诚实地告诉市场:这条路还远没到”百发百中”。但更重要的是它把机器人部署的成本结构改写了——过去是为每个新任务采集数据和微调,现在是设计安全的演示、验证和恢复机制。这和本周 agent harness、评估器、安全扫描器同步升温是同一件事的两面:能力层和安全层被同步产品化。
为什么这件事值得专门写一篇
本栏目两周前的判断是:模型层的胜负正在被消化,真正的竞争迁移到了路由、协同与治理三条商业表面(详见《AI 行业的下一站竞争,已经不在模型层》)。后来又写了算力底座的松动(详见《AI 行业的下一站松动,已经发生在算力底座》)。这两篇文章关心的是”商业价值往哪一层流”。
这一篇关心的对象不一样。它关心的是:Agent OS 层作为隐含假设,已经从”我们要不要做”变成”谁先做出可被并行的工程现实”。在 72 小时内同步落地的六个方向——物理 prompt、自家 harness、技能协议、安全栈、共享知识、独立 runtime——它们彼此独立,但没有任何一件是孤立的。它们是同一件事的不同切面:在模型商品化的临界点之后,下一个 12 个月真正有定价权的产品表面,是 Agent OS。
对实际工作流的影响
对个人开发者:不要再把”换到更强的模型”当作升级路径。一旦 Agent OS 层成熟,瓶颈会从模型能力转到技能协议、记忆治理、proposal/approval 解耦与可观测。下一阶段值得投入的方向是——把 agent 写得像一个有完整 memory、policy、verifier 的长寿命对象,而不是一个 for-loop 里的临时工人。
对企业:把 agent 接入生产之前,至少要补齐三道门——skill 文件变更后跑 prompt injection 与外泄扫描、MCP/浏览器工具上线前做权限与数据流审计、高风险 exec 默认先生成 proposal 再由独立策略层授权。本周 Tencent/AI-Infra-Guard、SkillSpector、decionis 已经把这三道门的产品形态做出来了,”等一等再说”不再是合理选项。
对教育/研究/任何用 AI 跑长任务的小团队:当”看示范就动手”成立,演示、验证与恢复机制将成为新的研究对象——而不是新模型本身。这条线把机器人、agent、教学场景连到了一个共同的工作流入口上。
判断
Agent OS 不是被”宣告”的。它是被过去 72 小时内同步发生的多件事共同铺出来的。当 frontier 厂商开始自建 harness、当技能协议有了市场层、当安全栈覆盖到 MCP 与 AI Infra、当机器人开始用演示做 prompt——这时候再谈”Agent 是未来”已经晚了半步。该谈的是:谁先把自己的执行层做成可被并行铺设的产品,谁就拿到了下一个 12 个月的定价权。
这条线对未来一年 AI 行业的影响,可能比”又大了一个模型”更持久。