谷歌 Frozen v2:把 Gemini 的"骨架"焊进硅片

7 月 20 日,The Information 披露:谷歌正在研发代号 Frozen v2 的服务器芯片,把 Gemini 大模型的架构直接固化进硅片,单位功耗的 token 处理量预计达到现有最新 TPU 的 6–10 倍,最早 2028 年部署。消息一出,Alphabet 股价盘中涨超 3%。

这件事的意味,比一颗新芯片更深:它标志着 AI 基础设施从"通用芯片跑通用模型",开始转向"为特定模型定制芯片"的范式迁移。

冻结的到底是权重,还是架构?

"冻结(Frozen)"在机器学习里本是日常动作——训练完成后锁住参数,让模型停止更新。Frozen v2 把这个动词推进了物理世界,它锁住的是 Gemini 神经网络结构蓝图:那些规定数据如何流动、注意力如何汇聚的连接方式,直接变成硅片上的电路。

项目的起点据说是 Google DeepMind 首席科学家 Jeff Dean。最初的"原版 Frozen"方案激进得多——把模型权重整体固化进芯片,相当于把某个版本的 Gemini 铸成铜像,芯片出厂之日就是它过时之始。谷歌很快否决了这条路线:模型迭代以月计,铜像的寿命却以年计。

Frozen v2 退了一步,也因此聪明了一步:冻结架构,放行权重。新训练出的参数仍可加载进芯片,只要底层结构不变,这颗硅片就能服侍一代又一代 Gemini。工程师至今没敲定固化的深度——固得越多能效越高,活路越窄,这是一道用灵活性兑换效率的算术题。

为什么效率能翻 6–10 倍

把架构修进电路,等于把数据搬运路线拉成直线:推理时的计算步骤减少、数据迁移量下降,6–10 倍的每瓦 token 吞吐由此而来。这个数字目前仍是纸面推演,部署要等到 2028 年,方向却已足够清楚。

过去十几年芯片行业的信条是通用性——一颗 GPU 训练所有模型。Frozen v2 把这个信条翻过来晒了晒太阳:当单一模型的调用量大到以亿次计,为它单独造一颗芯片的账,开始算得过来。

真正要救的是现金流

谷歌面对的核心问题已不只是芯片性能,而是急速膨胀的推理需求正在吞噬电力、服务器和现金。2026 年第二季度,谷歌模型 API 处理量达到每分钟约 220 亿 token,较上一季度的 160 亿增长 37.5%,更早之前还只有 100 亿。用户数量没成倍增加,服务器内部的计算链条却拉长数倍。

Frozen v2 的直接驱动力,是谷歌内部严峻的 AI 算力短缺——这一短缺已引发内部矛盾,并迫使谷歌云拒绝部分外部客户的合作请求。把 Gemini 的底层决策逻辑预先嵌入芯片,减少运行时的计算步骤与数据搬运,本质是在赌:Gemini 架构不会快速过时,否则这颗芯片就变成只能跑一个模型的"电子墓碑"。

定位:TPU 之外的新分支

谷歌明确把 Frozen v2 定位为 TPU 产品线之外的专门分支,而不是替代用途更广的 TPU,也不打算以 TPU 的规模量产。TPU 与英伟达 GPU 同属通用 AI 芯片,可兼容多种模型;Frozen v2 专为 Gemini 打造,两条线并行发展。谷歌母公司 Alphabet 的回应也留有余地:"并非每个项目都会进入量产,但严谨探索是我们全端式技术策略的核心。"

给国内的启示

专用芯片路线并非谷歌首创——华为昇腾、寒武纪思元、百度昆仑芯都在走类似逻辑。但谷歌的独特优势在于:它同时拥有顶级模型(Gemini)、顶级芯片团队(Jeff Dean)和海量内部需求(YouTube、Search、Android)。这种"模型 + 芯片 + 场景"三位一体的闭环,正是国内厂商最羡慕也最难复制的部分。

Frozen v2 的真正信号是:当推理成本占到 AI 公司运营支出的大头,谁能用更少电力吐出更多 token,谁就掌握定价权。这场"为模型造芯片"的竞赛,才刚刚开始。