中文精炼导读

核心观点

  • Google Quantum AI 在《Nature》发表的论文展示:把强化学习(RL)与量子纠错(QEC)相结合,让量子计算机能够在长时间计算过程中持续适应漂移、保持稳定——相当于"在演奏进行的同时给乐器调音"。
  • 关键洞察是把 QEC 的错误检测事件"一鱼两吃":除了交给解码器推断修正外,还把它们作为强化学习 agent 的主动学习信号,让 agent 在计算进行中动态操控数千个控制参数,抵消漂移、预防新错误。
  • 在 Willow 超导处理器上,RL 操控将纠错码的逻辑稳定性提升 3.5 倍,延长了处理器作为可靠"量子存储器"的时间;即便经过人类专家的穷尽校准,RL 微调仍能额外压低约 20% 的逻辑错误率。
  • 实验把量子存储器的逻辑错误压到创纪录的低水平:surface code 每千次纠错周期少于一次,color code 每百次少于一次。
  • 规模化验证关键结论:在数百量子比特、数万控制参数的数值模拟中,RL 把物理错误率压下来的速度与系统规模无关——所需的 RL 训练迭代次数不随系统变大而增加,从而支持扩展到更大规模的量子计算机。
RL 量子控制框架:错误检测事件同时喂给解码器与 RL 学习信号
RL 量子控制框架:错误检测事件同时喂给解码器与 RL 学习信号

内容精讲

文章用一个交响乐团的比喻开篇:如果小提琴每隔几小节就跑调,整个乐团就得不停停下来调音。所幸真实乐团不会这样——乐器能可靠地保持音准。但这正是今天操作量子计算机的现实:量子计算机本质上是模拟机器,对漂移极其敏感,维持可靠运行需要不断重新校准控制参数(编排量子比特的模拟信号的频率、幅度和相位)。而今天做到这一点需要完全终止整个量子计算。这种"计算与校准彻底分离"是未来的根本瓶颈——有用的量子算法必须连续运行数天甚至数月。

为什么调音这么难?在音乐厅里,跑调的乐器立刻能被听到;但在量子世界没有这种奢侈——仿佛"聆听本身就毁掉演奏",测量量子比特会坍缩它们的量子叠加态。为了保全量子信息,人们采用量子纠错(QEC):利用冗余把许多物理量子比特组成"逻辑量子比特",用对物理量子比特的专门奇偶校验把模拟噪声"数字化"成二进制的错误检测事件。但麻烦在于,这些比特只告诉你"在量子电路的某个有界时空区域内发生了错误",而不知道确切位置——就像听到一个跑调音却不知道是哪个乐手弹的。要定位可能的错误位置并计算必要的修正,需要依赖 QEC 解码器,比如基于真实数据训练的神经网络解码器 AlphaQubit、算法解码器 Tesseract。只要错误足够稀少,解码器就能通过分析错误检测数据恢复逻辑量子信息。

但解码器留下一个关键问题没回答:这些错误最初为什么发生?有些错误源于量子系统与环境不可避免的相互作用(退相干)——这个无情的过程摧毁宏观量子叠加,把量子计算机变成经典计算机,其影响如此普遍,以至于它塑造了我们熟悉的经典现实;这类环境错误永远无法完全防止。但许多其他错误是不精确的控制校准和硬件漂移的体现——这些是仍在人力可控范围内的缺陷。

传统上,量子校准依赖物理模型,这些技术经过了几十年量子控制研究的打磨。但作者指出,跨技术领域,人类手工构建的模型总会撞上性能天花板:早期计算机视觉依赖严格的几何规则而停滞,传统机器人学苦于无法捕捉接触动力学和摩擦的动力学方程,蛋白质折叠问题直到 AlphaFold 等深度学习系统出现前一直难以用传统物理模型解决。这些领域的突破都发生在"转向直接从数据学习"之后。最近 AlphaQubit 已经超越了最强算法 QEC 解码器的准确性,现在量子控制正面临同样的天花板——随着制造工艺和硬件的进步,错误越来越被复杂现象主导,难以用传统建模与校准处理。

答案是"不要只纠错,还要从错误中学习"。谷歌在把 RL 用于传统编程无法解决的复杂问题上有着深厚历史:RL 不依赖显式指令,而是通过经验运作——自主 agent 尝试不同行为,直接利用产生的错误来改进策略。把 RL 用于准确、连续的量子校准几乎是必然的:既然 QEC 已经在源源不断地产生检测事件,那就赋予这些数据一个互补的角色——除了解码和纠错,还把检测事件当作主动学习信号。随着计算推进,RL agent 监视这些数据、学会动态操控控制参数,抵消漂移、预防新错误。

实验在旗舰 Willow 超导处理器上进行。通过故意注入控制参数的人工漂移,RL 操控把纠错码的逻辑稳定性提升了 3.5 倍,延长了处理器作为可靠"量子存储器"的时间。通常把处理器调到峰值性能高度依赖"人在环"——科学家用物理直觉解决难以自动化的边缘情况;但即便经过这种穷尽的专家校准,后续的 RL 微调仍系统性地把逻辑错误率额外压低了 20%。所有技术综合起来,把量子存储器中的逻辑错误压到创纪录的低水平:surface code 中每千次纠错周期少于一次错误,color code 中每百次少于一次。

RL 微调把 surface code(左)与 color code(右)逻辑信息寿命显著延长
RL 微调把 surface code(左)与 color code(右)逻辑信息寿命显著延长

规模化是机器学习与量子研究者都会追问的关键问题。团队做了数百量子比特、数万控制参数的数值模拟:一个校准不当的系统从高物理错误率开始,agent 通过学得更好的控制参数逐步把它降下来,而借助 QEC,逻辑错误率(LER)随系统规模(物理量子比特数)指数级被抑制。关键结论是:RL 降低物理错误率的速度与系统规模无关——所需的 RL 训练迭代次数不随系统大小增加,这得益于 QEC 检测事件对错误的局部敏感性。这意味着该方法可以扩展到更大的系统。作者同时指出,要充分释放 RL 框架的潜力需要更紧密的集成:加快 agent 与量子处理器之间的通信周期、采用更先进的机器学习方法,有望解锁更大的提升。这项工作开启了一个新范式:一台从错误中学习、并且不停止计算的量子计算机。

阅读价值

适合量子计算研究者、对 RL 在物理系统落地感兴趣的机器学习从业者,以及关注量子纠错进展的技术读者:文章清晰解释了"为什么量子校准必须在计算中实时进行"、"错误检测事件如何兼任 RL 学习信号"这两个核心机制,并用 Willow 实测数据与规模化模拟展示了从"人类调参"到"智能体自适应控制"的范式转变;配图直观呈现了控制框架与逻辑寿命提升。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://research.google/blog/towards-a-quantum-computer-that-learns-from-its-errors/