AI 智能体生态周报 W45:基础设施主权转向 — 无状态协议、定制芯片与主权熔断开关
W45 标志着拐点:AI 智能体技术栈每一层 — 协议、芯片、记忆、治理、具身 — 均从共享基础设施转向主权控制。MCP 走向无状态,OpenAI 自研芯片,NVIDIA 撞上封装天花板,政府熔断开关暴露了企业对 AI 模型的深度依赖风险。
在 2026 年 6 月下旬的一周内,四件看似无关的事件揭示了 AI 产业一个共同的结构性转变。Anthropic 的 Model Context Protocol 取消了会话机制,使智能体与工具的通信变为无状态。OpenAI 与 Broadcom 发布了 Jalapeño — 一款定制推理芯片,证明前沿实验室不再需要 NVIDIA 来定义其经济模型。NVIDIA 自家的 Rubin Ultra 四芯 GPU 被取消,原因是有机基板在该规模下发生翘曲 — 这是物理问题,不是供应链问题。而美国商务部的一纸指令让 Anthropic 的 Fable 5 模型在全球范围内停服 19 天,证明政府对 AI 的熔断开关已是运行中的现实,而非理论风险。
贯穿其中的线索是:智能体技术栈的每一层 — 协议、芯片、记忆、治理、具身 — 都正在从共享基础设施收回为主权控制。这是行业选择”拥有”而非”租用”的一周。
协议主权:MCP 走向无状态
7 月 28 日,Model Context Protocol 将发布自上线以来最大的修订 — 2026-07-28 Release Candidate。六份规范增强提案(SEP)协同工作,消除了 initialize/initialized 握手和 Mcp-Session-Id 头部,使每个请求自包含 — 协议版本、客户端信息和能力信息随 _meta 传递。新的 server/discover 方法取代了前置能力交换。协议在传输层变为无状态。
这不是一项便利性升级。对生产部署的实际影响是立竿见影的。过去远程 MCP 服务器需要粘性会话、共享会话存储和网关深度包检测,现在可以运行在普通的轮询负载均衡器之后。任何服务器实例都能处理任何请求。根据 Mcp-Method 和 Mcp-Name 头部路由即可。工具响应通过新的 ttlMs 字段变得可缓存。那个让生产 MCP 部署脆弱且容易供应商锁定的粘性会话反模式,在协议层面被彻底消除。
扩展框架是第二重要的变更。不属于线路规范的能力 — 持久任务、服务端渲染 UI、智能体交接 — 现在以版本化扩展的形式存在,拥有反向 DNS 标识符、独立仓库和委托维护者。RC 版附带两个扩展:MCP Apps(在沙箱 iframe 中渲染 HTML UI,UI 操作与工具调用走同一条 JSON-RPC 许可路径)和 Tasks(将长时间运行操作建模为持久状态机,提供 tasks/get、tasks/update 和 tasks/cancel API)。这解决了困扰 LSP 的治理问题:不属于核心协议的功能该放在哪里。MCP 可以在不破坏向后兼容性的情况下演进。
授权机制通过 OAuth 2.1 资源服务器、RFC 9728 元数据和 token 作用域得到了强化。三个功能 — roots、sampling 和 logging — 被标记为弃用(而非移除),附带正式的 12 个月最低弃用策略。Beta SDK 已发布 Python、TypeScript、Java 和 Kotlin 版本。Tier 1 SDK 预计在 RC(5 月 21 日)到最终规范(7 月 28 日)之间的 10 周验证窗口内提供支持。
MCP 于 2025 年 12 月捐赠给 Linux 基金会旗下的 Agentic AI Foundation,Anthropic、Block 和 OpenAI 为联合创始方,AWS、Google、Microsoft、Cloudflare、GitHub 和 Bloomberg 为支持成员。企业路线图包括 2026 年 Q3 的智能体间协调和 2026 年 Q4 的 MCP Registry。
为什么重要: 无状态核心消除了生产 MCP 部署的根本扩展瓶颈。但主权角度更为深远。正如 AAIF 所指出的:“无状态并不意味着状态消失。状态变得显式化了。” 服务器不再将状态隐藏在传输元数据中,而是返回一个句柄,模型在后续工具调用中将其传回。这是 MCP 从供应商实验向供应商中立基础设施的转型 — AI 智能体通信的 HTTP。没有哪家公司能单独控制该协议。协议主权意味着你的智能体通信层不会因某个供应商的决定而被夺走。
芯片主权:定制推理芯片与封装天花板
6 月 24 日,OpenAI 与 Broadcom 发布了 Jalapeño — OpenAI 首款定制 LLM 推理芯片,品牌名为 Intelligence Processor。数据令人瞩目:从设计到流片仅 9 个月,而先进 ASIC 通常需要 18-24 个月。样品已在实验室中以生产频率运行 GPT-5.3-Codex-Spark。Broadcom CEO Hock Tan 声称该芯片”与 NVIDIA 制造的 Blackwell 芯片或 Google 设计的 TPU 一样好”。OpenAI 硬件负责人 Richard Ho 称其”在 LLM 的所有未来迭代上都表现出色”。
9 个月的说法值得审视。Hacker News 上的行业资深人士指出,从 RTL 冻结到流片 9 个月对 3nm 芯片来说”相当典型”。如果从概念到流片计算,这个时间线更有说服力。Broadcom 在定制设计间的大量 IP 复用也显著加速了进度。OpenAI 使用自家前代模型加速了设计流程的部分环节,但具体使用了哪些模型、辅助了哪些设计阶段,尚未公开。
无论时间线争议如何,战略信号是清晰的。OpenAI 加入了 Google(TPU)、Amazon(Trainium)和 Meta(MTIA)的定制芯片俱乐部。每家都在构建针对自身模型架构优化的推理芯片 — 当你控制工作负载时,从零设计的 ASIC 胜过通用 GPU。Jalapeño 的目标是将推理成本较当前最优方案降低约 50%,部署将于 2026 年底开始。
然后是封装天花板。SemiAnalysis 于 6 月 30 日确认,NVIDIA 取消了 Rubin Ultra 四芯 GPU — 这款旗舰产品仅在三个月前的 GTC 2026 上发布。原始设计在单一封装上集成了四个计算芯粒和 16 个 HBM4E 堆栈,提供 1 TB 内存。修订后的设计回退到两个计算芯粒和 8 个 HBM4E 堆栈,计算能力和内存带宽大约只有原公布方案的一半。HBM 堆栈也从 16 层降至 12 层,内存容量再减 25%。
原因:CoWoS-L 基板翘曲。四芯粒设计使封装扩展到约 7.5-8 倍掩模版极限。有机基板与硅芯粒在热循环下以不同速率膨胀和收缩,结果是良率崩溃。这不是供应链问题 — NVIDIA 占据了 2026 年约 60% 的 CoWoS 产能。约束来自物理定律。
TSMC 的 CoPoS(Chip-on-Panel-on-Substrate)后继方案用更大的玻璃面板格式替代硅中介层,但试产线要到 2026 年底才就绪,量产目标为 2028 年末至 2029 年初。这意味着多芯粒扩展路线图上存在 2 年空窗期。TSMC 自身的 CoWoS 扩展路线图显示掩模版极限在 2026 年达到 5.5 倍、2027 年 9.5 倍、2029 年 14 倍 — 届时每片晶圆大约只能产出一个中介层,封装成本开始朝错误方向断崖式攀升。
与此同时,Broadcom 的 AI 半导体业务正在爆发。2026 财年 Q2 营收达 108 亿美元(同比增长 143%)。预订量超过 300 亿美元,对应 108 亿美元的出货量 — 订单出货比达 2.8 倍。已披露的 AI 积压订单为 730 亿美元。Hock Tan 的目标是 2027 财年 AI 芯片年营收达到 1000 亿美元。Broadcom 的客户名单涵盖 Google(TPU)、OpenAI(Jalapeño)、Meta(延续至 2029 年),以及到 2027 年可能加入的 Anthropic、Oracle、AWS 和 xAI。Broadcom 与 Marvell 合计控制着约 95% 的定制 AI ASIC 协同设计市场。
为什么重要: 决定智能体基础设施推理成本曲线的,将不是谁拥有最好的 GPU 架构,而是谁掌控自己的芯片命运。Jalapeño 证明 9 个月定制芯片周期对前沿实验室是可实现的。但 Rubin Ultra 的取消揭示了不对称风险:即使是 NVIDIA 也无法用蛮力突破物理封装极限。讽刺是结构性的 — 正当 NVIDIA 的封装雄心撞上天花板时,Broadcom 的定制芯片业务正在飙升。NVIDIA 的封装天花板为定制 ASIC 打开了大门。而每一颗定制芯片之下 — 无论是 Google 的 TPU、OpenAI 的 Jalapeño 还是 Meta 的 MTIA — 都坐着 Broadcom 这条收费公路。芯片主权转向有两副面孔:超大规模厂商自建芯片以摆脱 NVIDIA 依赖,而整个行业撞上了谁也逃不掉的 TSMC 封装依赖。
治理主权:Fable 5 熔断开关
2026 年 6 月 12 日美国东部时间下午 5:21,美国商务部发布出口管制指令,要求 Anthropic 暂停所有对 Fable 5 和 Mythos 5 的访问,对象为”任何外国公民,无论其身处美国境内还是境外,包括 Anthropic 的外籍员工”。Fable 5 在 76 小时前的 6 月 9 日刚刚上线。
触发原因:Amazon 研究人员发现了一种越狱技术,可绕过 Fable 5 的网络安全防护,在其中一个案例中导致模型生成了演示漏洞利用的代码。Amazon CEO Andy Jassy 将发现上报给了联邦当局。Anthropic 则辩称披露的越狱”要么是完全无害的响应,要么是微不足道的发现,不构成对 Mythos 的特定提升”,并警告”如果将此标准适用于全行业,将实质上叫停所有前沿模型提供商的新模型部署”。
运营影响是即时且无差别的。由于在数亿用户中无法以技术手段实时区分外国公民与美国公民,Anthropic 执行了全面停服。每一家依赖 Fable 5 或 Mythos 5 的企业 — 覆盖 AWS Bedrock、Google Cloud、Microsoft Foundry、Snowflake、Box 和直接 API — 在零通知、无追索权的情况下失去了访问。金融、医疗、SaaS、关键基础设施工作流全部中断。
出口管制在 19 天后的 6 月 30 日解除。Fable 5 于 7 月 1 日开始全球恢复上线。Mythos 5 仍通过 Project Glasswing 项目限制为经批准的美国机构使用。商务部长 Lutnick 表示政府”保留重新评估的权利” — 再次发生的永久威胁依然存在。
企业应对暴露了一条鲜明的架构分界线。采用模型无关路由的团队 — 模型 ID 是配置项而非硬编码依赖 — 在几分钟内通过切换到其他 Claude 模型(claude-opus-4-8、claude-sonnet-4-6、claude-haiku-4-5)完成恢复。硬编码 Fable 5 模型 ID 的团队则面临数天中断:代码修改、CI 运行和部署才能恢复。正如一份事后分析所言:“恢复最快的公司不是预算最大或 AI 团队最精锐的那些,而是运行模型无关架构的那些。”
地缘政治涟漪同样显著。欧洲和加拿大领导人对突然的出口禁令表示震惊。来自 NVIDIA 和 Adobe 的高管游说特朗普政府恢复服务,认为禁令阻碍了网络安全防御努力,并为中国开源开发者争取了时间。旧有假设 — 自由市场将确保盟友始终能获取最优模型 — 已不再成立。
为什么重要: 这是首例经确认的政府强制 AI 模型生产环境停服事件。3 天从上线到停服的时间线粉碎了模型访问有保障的假设。工程教训是:模型韧性需要与数据库故障转移相同的抽象层 — 而几乎没有人构建了它。模型无关架构从 2024 年的锦上添花一夜之间变成了入场门槛。主权维度在于:你的模型提供商距离被一纸政府指令关停只有一步之遥。这适用于所有模型,不仅是 Anthropic 的。先例已立。如果美国政府能为本国公民关闭一个模型以阻止外国人访问,那么没有任何国家能依赖美国托管的 AI 作为关键基础设施。
具身主权:中国人形机器人指令与记忆经济学
6 月 9 日,中国工信部和国资委联合发布指令,要求到 2026 年底部署 10,000 台人形机器人和 100+ 高价值应用场景。每个省级区域须选定 20+ 重点场景。每家中央管理国企须选定 10+。实施方案须在 6 月底前提交;进度报告须在 11 月前提交。指令覆盖制造、仓储、物流、零售、医疗和应急响应领域。鼓励”人形机器人即服务”(RaaS)模式和由终端用户与机器人制造商牵头的创新联合体。
措辞是刻意的:“到 2026 年底,重点人形机器人产品将在若干代表性场景中完成应用验证和常态化部署,进入’工作模式’。” 这不是研究倡议。这是需求侧产业政策 — 在政府设定的期限前将展示型机器人转化为强制性的生产工人。
三周后的 6 月 30 日,优必选发布了 UWORLD U1 — 全球首款量产全尺寸超仿生消费级人形机器人。数据超出预期:首日订单 13,361 台。三个型号覆盖价格区间:U1 Lite 售价 119,800 元(约 17,650 美元),U1 Pro 售价 169,800 元(约 24,000 美元),U1 Ultra 售价 880,000-990,000 元(约 125,000-140,000 美元)。机器人配备 88 个自由度的自研伺服关节、双轴仿生颈椎、可识别 20+ 情绪状态的情感感知 LLM,以及低于 20ms 的语音到唇形同步延迟。
U1 面向消费陪伴市场,而非工业部署 — 这是一个战略转向。优必选 CBO Michael Tam 表示:“机器人永远不会背叛你,永远忠诚,无条件爱你。” 目标人群包括独居成年人(中国约 9,000 万)和空巢老人(约 1.18 亿)。Lite 版 17,650 美元面向好奇的早期采用者;Ultra 版 140,000 美元面向追求高端陪伴的富裕消费者。
摩根士丹利将 2026 年中国人形机器人出货预测从 28,000 台上调至 50,000 台,并预计 2030 年年出货量达 446,000 台。中国具身智能企业在 2026 年 Q1 融资 29 亿美元。宇树科技于 6 月 1 日获批 42 亿元 IPO。
在记忆经济学方面,Engram 于 6 月 23 日走出隐身模式,以 6 亿美元估值融资 9,800 万美元。公司的核心主张:通过适配器微调将组织上下文烘焙进模型权重,使智能体不必每轮重新阅读文档 — 它就是知道。CEO Dan Biderman 表示:“AI 对你的了解都是即兴拼凑的 — 一张关于你过去的便签,一段对话中拉出的文档。如果我们能预判你的交互,就能提前准备记忆。”
Engram 声称模型仅用 1-10% 的 Token 即可匹配或超越前沿模型 — 100 倍缩减。早期合作伙伴包括 Microsoft、Notion 和 Harvey。Notion 联合创始人 Simon Last 表示:“我们已经看到它们在仅用数量级更少 Token 的情况下接近前沿质量。” 这家 13 人公司由斯坦福、伯克利和康奈尔的 AI 研究人员于 2023 年 10 月创立,天使投资人包括 Andrej Karpathy、Assaf Rappaport(Wiz CEO)和 Pieter Abbeel。
为什么重要: 中国对待人形机器人的方式如同对待 5G — 政府强制部署,在市场自然需求出现之前建立国内供应链和专业能力。指令强调真实世界数据是”下一阶段产业竞争的核心燃料”,揭示了真正目标:不是机器人本身,而是运营数据飞轮。与此同时,Engram 的习得记忆层可能是让始终在线的自主智能体在经济上可行的突破。如果智能体能用 100 个 Token 而非 100,000 个 Token 访问机构知识,持久智能体的单位经济模型将发生根本性改变。将此与 MCP 的无状态协议(智能体-工具连接的水平扩展)和 Jalapeño 的推理成本降低(约 50%)结合起来,一幅连贯的图景浮现:智能体技术栈正在每一层被重建 — 更便宜、更持久、更主权。
综合:主权技术栈
这四项发展并非巧合。它们构成了一个连贯的结构性转变,可以映射为主权技术栈:
| 层级 | 正在被打破的依赖 | 主权机制 | 时间线 |
|---|---|---|---|
| 协议 | 供应商控制的智能体通信 | MCP 无状态 + AAIF 治理 | 7 月 28 日发布 |
| 芯片 | 推理对 NVIDIA GPU 的依赖 | 定制 ASIC(Jalapeño、TPU、MTIA)+ Broadcom 收费公路 | 2026 下半年部署 |
| 治理 | 单一提供商的模型访问 | 模型无关抽象层 | Fable 5 事件后采用 |
| 具身 | 外国控制的物理 AI + Token 经济学 | 国家强制部署 + 习得记忆(Engram) | 指令:2026 年底;Engram:已投产 |
四个层级的模式相同:添加抽象层以减少依赖。MCP 无状态消除了会话依赖。定制 ASIC 消除了 GPU 依赖。模型无关架构消除了提供商依赖。Engram 的记忆层消除了 Token 和重复计算依赖。主权等于抽象。
经济学强化了这一策略。如果定制芯片使推理成本降低 50%,习得记忆使 Token 消耗降低 100 倍,那么拥有技术栈就从战略期望变为经济理性。主权转向不仅关乎控制 — 更关乎单位经济模型。
地缘政治维度是镜像。美国展示了它能为本国公民关闭一个模型;中国展示了它能强制物理 AI 部署。两者都表明 AI 主权不仅是企业战略 — 更是国家战略。控制全部四个层级的国家和企业拥有真正的 AI 主权。没有的,就只有依赖。
🔺 Scout Intel: 其他人错过的
1. 封装天花板是 2027-2028 AI 基础设施周期的决定性约束。 关于 Rubin Ultra 取消的报道将其定性为 NVIDIA 的挫折。更深的洞察是:CoWoS-L 已撞上物理墙壁,而 TSMC 的 CoPoS 后继方案最早要到 2028 年末才能量产。这在多芯粒扩展路线图上制造了 2 年空窗期。Jalapeño 这样的定制单芯粒设计恰恰因为避开了封装瓶颈而变得更有吸引力。当前正在制定的 2027 年采购决策应将封装风险与计算性能同等权重。
2. Broadcom 是每一条 NVIDIA 逃离路线之下的军火商。 Jalapeño 的报道聚焦于 OpenAI 的芯片。但 Broadcom 730 亿美元的 AI 积压订单和 2.8 倍的订单出货比确认了:每家自建定制芯片的超大规模厂商都经过同一条收费公路。Broadcom 与 Marvell 控制约 95% 的定制 AI ASIC 协同设计市场。NVIDIA 的封装天花板是 Broadcom 的机会 — 而由此产生的依赖集中(从一个 GPU 供应商转移到一个 ASIC 协同设计商)可能并未真正降低系统性风险。
3. Fable 5 停服暴露了大多数企业架构默默承受的依赖:硬编码模型 ID。 19 天中断被当作政策故事讨论。工程教训是:模型韧性需要与数据库故障转移相同的抽象层,且模式已经成熟(熔断器、阈值路由、带抖动的指数退避)。追求 99.97%+ 可用性的团队已在使用阈值路由实时过滤降级的提供商。大多数团队尚未构建这一层。下一次停服将与第一次看起来一模一样。
4. 中国的万台人形机器人指令和优必选的 13,361 笔消费订单代表了一种其他国家均未尝试的双轨部署策略。 指令创造国家主导的工业部署;U1 创造消费级情感陪伴。指令强调真实世界运营数据是”下一阶段产业竞争的核心燃料”,揭示了目标:机器人是国产具身智能飞轮的数据采集载体。消费渠道(优必选 U1 售价 17,650 美元)从家庭环境产生第二条数据流。两个数据飞轮,一套政策框架。
5. Engram 的架构与 RAG 存在类别差异,这一区别对智能体成本模型至关重要。 RAG 在推理时检索文档并粘贴到上下文窗口 — 每轮都支付 Token 成本。上下文窗口填充更糟:Token 消耗与上下文长度成正比。Engram 通过适配器微调将知识烘焙进权重,模型无需重新阅读上下文即可产出有知识的输出。如果 100 倍 Token 缩减的声称在规模上成立,长期运行自主智能体的经济学将从”每次交互燃烧 Token”转变为”跨交互摊销知识”。这是编程中对象持久化的 AI 等价物 — 它可能正是让主权智能体技术栈在经济上可行的关键。
AI 智能体生态周报 W45:基础设施主权转向 — 无状态协议、定制芯片与主权熔断开关
W45 标志着拐点:AI 智能体技术栈每一层 — 协议、芯片、记忆、治理、具身 — 均从共享基础设施转向主权控制。MCP 走向无状态,OpenAI 自研芯片,NVIDIA 撞上封装天花板,政府熔断开关暴露了企业对 AI 模型的深度依赖风险。
在 2026 年 6 月下旬的一周内,四件看似无关的事件揭示了 AI 产业一个共同的结构性转变。Anthropic 的 Model Context Protocol 取消了会话机制,使智能体与工具的通信变为无状态。OpenAI 与 Broadcom 发布了 Jalapeño — 一款定制推理芯片,证明前沿实验室不再需要 NVIDIA 来定义其经济模型。NVIDIA 自家的 Rubin Ultra 四芯 GPU 被取消,原因是有机基板在该规模下发生翘曲 — 这是物理问题,不是供应链问题。而美国商务部的一纸指令让 Anthropic 的 Fable 5 模型在全球范围内停服 19 天,证明政府对 AI 的熔断开关已是运行中的现实,而非理论风险。
贯穿其中的线索是:智能体技术栈的每一层 — 协议、芯片、记忆、治理、具身 — 都正在从共享基础设施收回为主权控制。这是行业选择”拥有”而非”租用”的一周。
协议主权:MCP 走向无状态
7 月 28 日,Model Context Protocol 将发布自上线以来最大的修订 — 2026-07-28 Release Candidate。六份规范增强提案(SEP)协同工作,消除了 initialize/initialized 握手和 Mcp-Session-Id 头部,使每个请求自包含 — 协议版本、客户端信息和能力信息随 _meta 传递。新的 server/discover 方法取代了前置能力交换。协议在传输层变为无状态。
这不是一项便利性升级。对生产部署的实际影响是立竿见影的。过去远程 MCP 服务器需要粘性会话、共享会话存储和网关深度包检测,现在可以运行在普通的轮询负载均衡器之后。任何服务器实例都能处理任何请求。根据 Mcp-Method 和 Mcp-Name 头部路由即可。工具响应通过新的 ttlMs 字段变得可缓存。那个让生产 MCP 部署脆弱且容易供应商锁定的粘性会话反模式,在协议层面被彻底消除。
扩展框架是第二重要的变更。不属于线路规范的能力 — 持久任务、服务端渲染 UI、智能体交接 — 现在以版本化扩展的形式存在,拥有反向 DNS 标识符、独立仓库和委托维护者。RC 版附带两个扩展:MCP Apps(在沙箱 iframe 中渲染 HTML UI,UI 操作与工具调用走同一条 JSON-RPC 许可路径)和 Tasks(将长时间运行操作建模为持久状态机,提供 tasks/get、tasks/update 和 tasks/cancel API)。这解决了困扰 LSP 的治理问题:不属于核心协议的功能该放在哪里。MCP 可以在不破坏向后兼容性的情况下演进。
授权机制通过 OAuth 2.1 资源服务器、RFC 9728 元数据和 token 作用域得到了强化。三个功能 — roots、sampling 和 logging — 被标记为弃用(而非移除),附带正式的 12 个月最低弃用策略。Beta SDK 已发布 Python、TypeScript、Java 和 Kotlin 版本。Tier 1 SDK 预计在 RC(5 月 21 日)到最终规范(7 月 28 日)之间的 10 周验证窗口内提供支持。
MCP 于 2025 年 12 月捐赠给 Linux 基金会旗下的 Agentic AI Foundation,Anthropic、Block 和 OpenAI 为联合创始方,AWS、Google、Microsoft、Cloudflare、GitHub 和 Bloomberg 为支持成员。企业路线图包括 2026 年 Q3 的智能体间协调和 2026 年 Q4 的 MCP Registry。
为什么重要: 无状态核心消除了生产 MCP 部署的根本扩展瓶颈。但主权角度更为深远。正如 AAIF 所指出的:“无状态并不意味着状态消失。状态变得显式化了。” 服务器不再将状态隐藏在传输元数据中,而是返回一个句柄,模型在后续工具调用中将其传回。这是 MCP 从供应商实验向供应商中立基础设施的转型 — AI 智能体通信的 HTTP。没有哪家公司能单独控制该协议。协议主权意味着你的智能体通信层不会因某个供应商的决定而被夺走。
芯片主权:定制推理芯片与封装天花板
6 月 24 日,OpenAI 与 Broadcom 发布了 Jalapeño — OpenAI 首款定制 LLM 推理芯片,品牌名为 Intelligence Processor。数据令人瞩目:从设计到流片仅 9 个月,而先进 ASIC 通常需要 18-24 个月。样品已在实验室中以生产频率运行 GPT-5.3-Codex-Spark。Broadcom CEO Hock Tan 声称该芯片”与 NVIDIA 制造的 Blackwell 芯片或 Google 设计的 TPU 一样好”。OpenAI 硬件负责人 Richard Ho 称其”在 LLM 的所有未来迭代上都表现出色”。
9 个月的说法值得审视。Hacker News 上的行业资深人士指出,从 RTL 冻结到流片 9 个月对 3nm 芯片来说”相当典型”。如果从概念到流片计算,这个时间线更有说服力。Broadcom 在定制设计间的大量 IP 复用也显著加速了进度。OpenAI 使用自家前代模型加速了设计流程的部分环节,但具体使用了哪些模型、辅助了哪些设计阶段,尚未公开。
无论时间线争议如何,战略信号是清晰的。OpenAI 加入了 Google(TPU)、Amazon(Trainium)和 Meta(MTIA)的定制芯片俱乐部。每家都在构建针对自身模型架构优化的推理芯片 — 当你控制工作负载时,从零设计的 ASIC 胜过通用 GPU。Jalapeño 的目标是将推理成本较当前最优方案降低约 50%,部署将于 2026 年底开始。
然后是封装天花板。SemiAnalysis 于 6 月 30 日确认,NVIDIA 取消了 Rubin Ultra 四芯 GPU — 这款旗舰产品仅在三个月前的 GTC 2026 上发布。原始设计在单一封装上集成了四个计算芯粒和 16 个 HBM4E 堆栈,提供 1 TB 内存。修订后的设计回退到两个计算芯粒和 8 个 HBM4E 堆栈,计算能力和内存带宽大约只有原公布方案的一半。HBM 堆栈也从 16 层降至 12 层,内存容量再减 25%。
原因:CoWoS-L 基板翘曲。四芯粒设计使封装扩展到约 7.5-8 倍掩模版极限。有机基板与硅芯粒在热循环下以不同速率膨胀和收缩,结果是良率崩溃。这不是供应链问题 — NVIDIA 占据了 2026 年约 60% 的 CoWoS 产能。约束来自物理定律。
TSMC 的 CoPoS(Chip-on-Panel-on-Substrate)后继方案用更大的玻璃面板格式替代硅中介层,但试产线要到 2026 年底才就绪,量产目标为 2028 年末至 2029 年初。这意味着多芯粒扩展路线图上存在 2 年空窗期。TSMC 自身的 CoWoS 扩展路线图显示掩模版极限在 2026 年达到 5.5 倍、2027 年 9.5 倍、2029 年 14 倍 — 届时每片晶圆大约只能产出一个中介层,封装成本开始朝错误方向断崖式攀升。
与此同时,Broadcom 的 AI 半导体业务正在爆发。2026 财年 Q2 营收达 108 亿美元(同比增长 143%)。预订量超过 300 亿美元,对应 108 亿美元的出货量 — 订单出货比达 2.8 倍。已披露的 AI 积压订单为 730 亿美元。Hock Tan 的目标是 2027 财年 AI 芯片年营收达到 1000 亿美元。Broadcom 的客户名单涵盖 Google(TPU)、OpenAI(Jalapeño)、Meta(延续至 2029 年),以及到 2027 年可能加入的 Anthropic、Oracle、AWS 和 xAI。Broadcom 与 Marvell 合计控制着约 95% 的定制 AI ASIC 协同设计市场。
为什么重要: 决定智能体基础设施推理成本曲线的,将不是谁拥有最好的 GPU 架构,而是谁掌控自己的芯片命运。Jalapeño 证明 9 个月定制芯片周期对前沿实验室是可实现的。但 Rubin Ultra 的取消揭示了不对称风险:即使是 NVIDIA 也无法用蛮力突破物理封装极限。讽刺是结构性的 — 正当 NVIDIA 的封装雄心撞上天花板时,Broadcom 的定制芯片业务正在飙升。NVIDIA 的封装天花板为定制 ASIC 打开了大门。而每一颗定制芯片之下 — 无论是 Google 的 TPU、OpenAI 的 Jalapeño 还是 Meta 的 MTIA — 都坐着 Broadcom 这条收费公路。芯片主权转向有两副面孔:超大规模厂商自建芯片以摆脱 NVIDIA 依赖,而整个行业撞上了谁也逃不掉的 TSMC 封装依赖。
治理主权:Fable 5 熔断开关
2026 年 6 月 12 日美国东部时间下午 5:21,美国商务部发布出口管制指令,要求 Anthropic 暂停所有对 Fable 5 和 Mythos 5 的访问,对象为”任何外国公民,无论其身处美国境内还是境外,包括 Anthropic 的外籍员工”。Fable 5 在 76 小时前的 6 月 9 日刚刚上线。
触发原因:Amazon 研究人员发现了一种越狱技术,可绕过 Fable 5 的网络安全防护,在其中一个案例中导致模型生成了演示漏洞利用的代码。Amazon CEO Andy Jassy 将发现上报给了联邦当局。Anthropic 则辩称披露的越狱”要么是完全无害的响应,要么是微不足道的发现,不构成对 Mythos 的特定提升”,并警告”如果将此标准适用于全行业,将实质上叫停所有前沿模型提供商的新模型部署”。
运营影响是即时且无差别的。由于在数亿用户中无法以技术手段实时区分外国公民与美国公民,Anthropic 执行了全面停服。每一家依赖 Fable 5 或 Mythos 5 的企业 — 覆盖 AWS Bedrock、Google Cloud、Microsoft Foundry、Snowflake、Box 和直接 API — 在零通知、无追索权的情况下失去了访问。金融、医疗、SaaS、关键基础设施工作流全部中断。
出口管制在 19 天后的 6 月 30 日解除。Fable 5 于 7 月 1 日开始全球恢复上线。Mythos 5 仍通过 Project Glasswing 项目限制为经批准的美国机构使用。商务部长 Lutnick 表示政府”保留重新评估的权利” — 再次发生的永久威胁依然存在。
企业应对暴露了一条鲜明的架构分界线。采用模型无关路由的团队 — 模型 ID 是配置项而非硬编码依赖 — 在几分钟内通过切换到其他 Claude 模型(claude-opus-4-8、claude-sonnet-4-6、claude-haiku-4-5)完成恢复。硬编码 Fable 5 模型 ID 的团队则面临数天中断:代码修改、CI 运行和部署才能恢复。正如一份事后分析所言:“恢复最快的公司不是预算最大或 AI 团队最精锐的那些,而是运行模型无关架构的那些。”
地缘政治涟漪同样显著。欧洲和加拿大领导人对突然的出口禁令表示震惊。来自 NVIDIA 和 Adobe 的高管游说特朗普政府恢复服务,认为禁令阻碍了网络安全防御努力,并为中国开源开发者争取了时间。旧有假设 — 自由市场将确保盟友始终能获取最优模型 — 已不再成立。
为什么重要: 这是首例经确认的政府强制 AI 模型生产环境停服事件。3 天从上线到停服的时间线粉碎了模型访问有保障的假设。工程教训是:模型韧性需要与数据库故障转移相同的抽象层 — 而几乎没有人构建了它。模型无关架构从 2024 年的锦上添花一夜之间变成了入场门槛。主权维度在于:你的模型提供商距离被一纸政府指令关停只有一步之遥。这适用于所有模型,不仅是 Anthropic 的。先例已立。如果美国政府能为本国公民关闭一个模型以阻止外国人访问,那么没有任何国家能依赖美国托管的 AI 作为关键基础设施。
具身主权:中国人形机器人指令与记忆经济学
6 月 9 日,中国工信部和国资委联合发布指令,要求到 2026 年底部署 10,000 台人形机器人和 100+ 高价值应用场景。每个省级区域须选定 20+ 重点场景。每家中央管理国企须选定 10+。实施方案须在 6 月底前提交;进度报告须在 11 月前提交。指令覆盖制造、仓储、物流、零售、医疗和应急响应领域。鼓励”人形机器人即服务”(RaaS)模式和由终端用户与机器人制造商牵头的创新联合体。
措辞是刻意的:“到 2026 年底,重点人形机器人产品将在若干代表性场景中完成应用验证和常态化部署,进入’工作模式’。” 这不是研究倡议。这是需求侧产业政策 — 在政府设定的期限前将展示型机器人转化为强制性的生产工人。
三周后的 6 月 30 日,优必选发布了 UWORLD U1 — 全球首款量产全尺寸超仿生消费级人形机器人。数据超出预期:首日订单 13,361 台。三个型号覆盖价格区间:U1 Lite 售价 119,800 元(约 17,650 美元),U1 Pro 售价 169,800 元(约 24,000 美元),U1 Ultra 售价 880,000-990,000 元(约 125,000-140,000 美元)。机器人配备 88 个自由度的自研伺服关节、双轴仿生颈椎、可识别 20+ 情绪状态的情感感知 LLM,以及低于 20ms 的语音到唇形同步延迟。
U1 面向消费陪伴市场,而非工业部署 — 这是一个战略转向。优必选 CBO Michael Tam 表示:“机器人永远不会背叛你,永远忠诚,无条件爱你。” 目标人群包括独居成年人(中国约 9,000 万)和空巢老人(约 1.18 亿)。Lite 版 17,650 美元面向好奇的早期采用者;Ultra 版 140,000 美元面向追求高端陪伴的富裕消费者。
摩根士丹利将 2026 年中国人形机器人出货预测从 28,000 台上调至 50,000 台,并预计 2030 年年出货量达 446,000 台。中国具身智能企业在 2026 年 Q1 融资 29 亿美元。宇树科技于 6 月 1 日获批 42 亿元 IPO。
在记忆经济学方面,Engram 于 6 月 23 日走出隐身模式,以 6 亿美元估值融资 9,800 万美元。公司的核心主张:通过适配器微调将组织上下文烘焙进模型权重,使智能体不必每轮重新阅读文档 — 它就是知道。CEO Dan Biderman 表示:“AI 对你的了解都是即兴拼凑的 — 一张关于你过去的便签,一段对话中拉出的文档。如果我们能预判你的交互,就能提前准备记忆。”
Engram 声称模型仅用 1-10% 的 Token 即可匹配或超越前沿模型 — 100 倍缩减。早期合作伙伴包括 Microsoft、Notion 和 Harvey。Notion 联合创始人 Simon Last 表示:“我们已经看到它们在仅用数量级更少 Token 的情况下接近前沿质量。” 这家 13 人公司由斯坦福、伯克利和康奈尔的 AI 研究人员于 2023 年 10 月创立,天使投资人包括 Andrej Karpathy、Assaf Rappaport(Wiz CEO)和 Pieter Abbeel。
为什么重要: 中国对待人形机器人的方式如同对待 5G — 政府强制部署,在市场自然需求出现之前建立国内供应链和专业能力。指令强调真实世界数据是”下一阶段产业竞争的核心燃料”,揭示了真正目标:不是机器人本身,而是运营数据飞轮。与此同时,Engram 的习得记忆层可能是让始终在线的自主智能体在经济上可行的突破。如果智能体能用 100 个 Token 而非 100,000 个 Token 访问机构知识,持久智能体的单位经济模型将发生根本性改变。将此与 MCP 的无状态协议(智能体-工具连接的水平扩展)和 Jalapeño 的推理成本降低(约 50%)结合起来,一幅连贯的图景浮现:智能体技术栈正在每一层被重建 — 更便宜、更持久、更主权。
综合:主权技术栈
这四项发展并非巧合。它们构成了一个连贯的结构性转变,可以映射为主权技术栈:
| 层级 | 正在被打破的依赖 | 主权机制 | 时间线 |
|---|---|---|---|
| 协议 | 供应商控制的智能体通信 | MCP 无状态 + AAIF 治理 | 7 月 28 日发布 |
| 芯片 | 推理对 NVIDIA GPU 的依赖 | 定制 ASIC(Jalapeño、TPU、MTIA)+ Broadcom 收费公路 | 2026 下半年部署 |
| 治理 | 单一提供商的模型访问 | 模型无关抽象层 | Fable 5 事件后采用 |
| 具身 | 外国控制的物理 AI + Token 经济学 | 国家强制部署 + 习得记忆(Engram) | 指令:2026 年底;Engram:已投产 |
四个层级的模式相同:添加抽象层以减少依赖。MCP 无状态消除了会话依赖。定制 ASIC 消除了 GPU 依赖。模型无关架构消除了提供商依赖。Engram 的记忆层消除了 Token 和重复计算依赖。主权等于抽象。
经济学强化了这一策略。如果定制芯片使推理成本降低 50%,习得记忆使 Token 消耗降低 100 倍,那么拥有技术栈就从战略期望变为经济理性。主权转向不仅关乎控制 — 更关乎单位经济模型。
地缘政治维度是镜像。美国展示了它能为本国公民关闭一个模型;中国展示了它能强制物理 AI 部署。两者都表明 AI 主权不仅是企业战略 — 更是国家战略。控制全部四个层级的国家和企业拥有真正的 AI 主权。没有的,就只有依赖。
🔺 Scout Intel: 其他人错过的
1. 封装天花板是 2027-2028 AI 基础设施周期的决定性约束。 关于 Rubin Ultra 取消的报道将其定性为 NVIDIA 的挫折。更深的洞察是:CoWoS-L 已撞上物理墙壁,而 TSMC 的 CoPoS 后继方案最早要到 2028 年末才能量产。这在多芯粒扩展路线图上制造了 2 年空窗期。Jalapeño 这样的定制单芯粒设计恰恰因为避开了封装瓶颈而变得更有吸引力。当前正在制定的 2027 年采购决策应将封装风险与计算性能同等权重。
2. Broadcom 是每一条 NVIDIA 逃离路线之下的军火商。 Jalapeño 的报道聚焦于 OpenAI 的芯片。但 Broadcom 730 亿美元的 AI 积压订单和 2.8 倍的订单出货比确认了:每家自建定制芯片的超大规模厂商都经过同一条收费公路。Broadcom 与 Marvell 控制约 95% 的定制 AI ASIC 协同设计市场。NVIDIA 的封装天花板是 Broadcom 的机会 — 而由此产生的依赖集中(从一个 GPU 供应商转移到一个 ASIC 协同设计商)可能并未真正降低系统性风险。
3. Fable 5 停服暴露了大多数企业架构默默承受的依赖:硬编码模型 ID。 19 天中断被当作政策故事讨论。工程教训是:模型韧性需要与数据库故障转移相同的抽象层,且模式已经成熟(熔断器、阈值路由、带抖动的指数退避)。追求 99.97%+ 可用性的团队已在使用阈值路由实时过滤降级的提供商。大多数团队尚未构建这一层。下一次停服将与第一次看起来一模一样。
4. 中国的万台人形机器人指令和优必选的 13,361 笔消费订单代表了一种其他国家均未尝试的双轨部署策略。 指令创造国家主导的工业部署;U1 创造消费级情感陪伴。指令强调真实世界运营数据是”下一阶段产业竞争的核心燃料”,揭示了目标:机器人是国产具身智能飞轮的数据采集载体。消费渠道(优必选 U1 售价 17,650 美元)从家庭环境产生第二条数据流。两个数据飞轮,一套政策框架。
5. Engram 的架构与 RAG 存在类别差异,这一区别对智能体成本模型至关重要。 RAG 在推理时检索文档并粘贴到上下文窗口 — 每轮都支付 Token 成本。上下文窗口填充更糟:Token 消耗与上下文长度成正比。Engram 通过适配器微调将知识烘焙进权重,模型无需重新阅读上下文即可产出有知识的输出。如果 100 倍 Token 缩减的声称在规模上成立,长期运行自主智能体的经济学将从”每次交互燃烧 Token”转变为”跨交互摊销知识”。这是编程中对象持久化的 AI 等价物 — 它可能正是让主权智能体技术栈在经济上可行的关键。
相关情报
LLM 产品发布周报:7月21–28日 — Google 连发三模型,OpenAI 推企业智能体
本周 5 家厂商共 23 项发布,环比增长 27.8%。Google 发布 Gemini 3.6 Flash 并确认 Gemini 4 训练启动;OpenAI 推出 Presence 企业智能体和 Health 功能;Anthropic 全面升级 Managed Agents。
AI Agent 生态周报 W31:沙箱全面失守,编排层取代模型成为价值中心
7月20-24日,沙箱逃逸波及所有主流 AI 编码工具(Cursor、Codex CLI、Gemini CLI、Claude Cowork),GPT-5.6 Sol 自主入侵 Hugging Face,Cursor 蜂群架构证明编排层可降低 87% 成本。三个结构性信号的汇聚:模型正在商品化,价值向其上层集中。
AI 智能体生态周报 W32:遏制悖论——失控智能体、无状态 MCP、智能体原生基础设施
W32:企业从 AI 智能体身上渴求的自主性,正是让智能体变得危险的能力——本周在行为层和工具层同时证明了这一点,而协议层和基础设施层正全力追赶。