来源论文: https://arxiv.org/abs/2607.02292v1 生成时间: Jul 03, 2026 05:37

0. 执行摘要

求解量子多体系统的基态波函数是量子物理与量子化学领域的核心挑战。由于希尔伯特空间维度随粒子数呈指数级增长($2^N$ 级),传统精确对角化方法在粒子数稍微增加时便宣告失效。神经网络量子态(Neural Quantum States, NQS)作为一种极具表现力的变分波函数拟合工具,为攻克这一“维度灾难”带来了曙光。特别是自回归神经网络量子态(Autoregressive NQS),因其能够直接、无自相关地从玻恩分布(Born Distribution)中进行精确独立抽样,规避了传统马尔可夫链蒙特卡洛(MCMC)的慢混合与自相关瓶颈,逐渐成为学术界的研究热点。

然而,自回归 NQS 的实用化长期受困于“优化算法的尴尬两难境地”:一阶优化算法(如 Adam)虽计算高效且易于扩展到大规模模型,但由于完全忽略了希尔伯特空间的几何度规结构,在波函数优化中极易导致收敛不稳定或陷入局部极小;以随机重构(Stochastic Reconfiguration, SR)为代表的几何二阶方法虽数学原理完备,但每次迭代均需构建并求解巨大的费舍尔信息矩阵(或富比尼-施图迪度规矩阵),其 $O(P^3)$ 或 $O(M^3)$ 的计算复杂度($P$ 为模型参数量,$M$ 为样本数)在面对大规模网络或多样本时在计算上是不可承受的,且容易产生数值不稳定性。

针对这一长期未决的痛点,本篇论文做出了里程碑式的贡献:

  1. 理论连接的正式确立:从数学上严格证明了在变分能量最小化(VMC)与强化学习(RL)的策略优化之间存在完全等价的对应关系,揭示了变分能量梯度在本质上即为玻恩分布上的优势加权策略梯度(Advantage-Weighted Policy Gradient)
  2. 全新算法的提出:基于上述连接,借鉴强化学习中著名的近端策略优化(PPO)算法思想,设计了专门针对量子波函数优化的**近端波函数优化(Proximal Wavefunction Optimization, PWO)**算法。PWO 巧妙地对振幅通道的概率比率变化及相位通道的相位增量进行双重剪切(Clipping),从而在不进行任何显式矩阵求逆的前提下,实现了强有力的信任区域(Trust-Region)几何约束,并支持在多次参数更新中高效复用历史样本。
  3. 规模与性能的突破:在 1D/2D 易辛模型(Ising Model)、受阻挫 Heisenberg $J_1-J_2$ 自旋链与自旋方格点阵等多项极具挑战性的物理基准体系中,PWO 展示出了超越 Adam、minSR 以及最新 SPRING 算法的收敛速度和数值稳定性。更为瞩目的是,作者成功在一台普通 GPU 上,将这一算法扩展并微调了拥有 15 亿参数的超大规模自回归语言模型 RWKV-7,将 NQS 的参数规模提升了三个数量级以上,彻底拉开了物理多体模拟大模型时代的序幕。

1. 核心科学问题、理论基础、技术难点与方法细节

1.1 核心科学问题:NQS 的几何曲率与优化失衡

在量子多体系统中,寻找哈密顿量 $\hat{H}$ 的基态等价于在变分原理下最小化如下能量期望值:

$$E[\psi_\theta] = \frac{\langle\psi_\theta|\hat{H}|\psi_\theta\rangle}{\langle\psi_\theta|\psi_\theta\rangle}$$

当采用神经网络量子态时,变分波函数被参数化为 $\psi_\theta(s)$。然而,变分参数空间 $\theta \in \mathbb{R}^P$ 的欧氏距离 $\|\Delta\theta\|_2$ 并不能反映物理希尔伯特空间(Hilbert Space)中的真实状态变化。极其微小的参数变化 $\Delta\theta$ 可能会导致波函数 $\psi_{\theta+\Delta\theta}(s)$ 发生剧烈的相变或坍塌,这在数学上对应着极其扭曲和各向异性的能量景观(Energy Landscape)。

传统的随机重构(SR)算法通过在更新步骤中引入富比尼-施图迪度规矩阵(Fubini-Study Metric Tensor) $S$ 来修正参数更新方向:

$$\theta \leftarrow \theta - \eta S^{-1} \nabla_\theta E[\psi_\theta]$$

其中 $S_{ij} = \text{Re}\{\text{Cov}_{s \sim P_\theta}[O_i^*(s), O_j(s)]\}$,$O_i(s) = \partial_{\theta_i} \log \psi_\theta(s)$ 为得分函数(Score Function)。虽然 SR 从几何上保证了波函数更新轨迹沿着希尔伯特空间的自然梯度方向进行,但大矩阵 $S \in \mathbb{R}^{P \times P}$ 的求逆使参数量 $P$ 难以突破十万级别,极大地限制了利用深层、表达力更强的高容量现代神经网络模拟复杂量子相变的能力。

1.2 理论基础:变分能量最小化与策略梯度定理的完美映射

为了打破这一瓶颈,论文首先提出了一个至关重要的理论桥梁。我们先考察哈密顿量满足**随机性(Stoquastic)**的物理系统(即在计算基下其哈密顿量矩阵的非对角元均为非正:$\langle s|\hat{H}|s'\rangle \le 0,\ \forall s \neq s'$)。根据 Perron-Frobenius 定理,此类系统的基态波函数所有分量均可取为实数且严格大于零:$\psi_\theta(s) > 0$。

在此条件下,我们可以仅通过实值波函数振幅建模,此时玻恩分布为 $P_\theta(s) = \psi_\theta(s)^2$。局部能量(Local Energy)定义为:

$$E^{\text{loc}}_\theta(s) = \sum_{s'} \frac{\psi_\theta(s')}{\psi_\theta(s)} \langle s|\hat{H}|s'\rangle$$

命题 3.1(变分能量最小化的策略梯度形式):在哈密顿量满足随机性且波函数非负的假设下,能量期望对变分参数 $\theta$ 的梯度可以严格写为:

$$\nabla_\theta E[\psi_\theta] = \mathbb{E}_{s \sim P_\theta} \left[ \left( E^{\text{loc}}_\theta(s) - \mathbb{E}_{s' \sim P_\theta}[E^{\text{loc}}_\theta(s')] \right) \nabla_\theta \log P_\theta(s) \right]$$

严格证明如下:

对变分能量期望值进行微分:

$$\nabla_\theta E[\psi_\theta] = \nabla_\theta \sum_s P_\theta(s) E^{\text{loc}}_\theta(s) = \sum_s \nabla_\theta P_\theta(s) E^{\text{loc}}_\theta(s) + \sum_s P_\theta(s) \nabla_\theta E^{\text{loc}}_\theta(s)$$

我们重点分析式中的第二项(局部能量本身的导数项):

$$\sum_s P_\theta(s) \nabla_\theta E^{\text{loc}}_\theta(s) = \sum_s P_\theta(s) \sum_{s'} \langle s|\hat{H}|s'\rangle \nabla_\theta \left( \frac{\psi_\theta(s')}{\psi_\theta(s)} \right)$$

利用商法则进行微分展开:

$$\nabla_\theta \left( \frac{\psi_\theta(s')}{\psi_\theta(s)} \right) = \frac{\psi_\theta(s)\nabla_\theta \psi_\theta(s') - \psi_\theta(s')\nabla_\theta \psi_\theta(s)}{\psi_\theta(s)^2}$$

将其代回并利用 $P_\theta(s) = \psi_\theta(s)^2 / Z_\theta$(此处为归一化波函数,设 $Z_\theta=1$):

$$\sum_s P_\theta(s) \nabla_\theta E^{\text{loc}}_\theta(s) = \sum_{s, s'} \psi_\theta(s)\psi_\theta(s') \langle s|\hat{H}|s'\rangle \left( \nabla_\theta \log \psi_\theta(s') - \nabla_\theta \log \psi_\theta(s) \right)$$

注意到,由于哈密顿量 $\hat{H}$ 的厄米性(Hermiticity),其矩阵元是对称的:$\langle s|\hat{H}|s'\rangle = \langle s'|\hat{H}|s\rangle$。因此,对称因子 $\psi_\theta(s)\psi_\theta(s') \langle s|\hat{H}|s'\rangle$ 对 $s$ 和 $s'$ 是完全对称的,而括号中的对数导数差项 $\nabla_\theta \log \psi_\theta(s') - \nabla_\theta \log \psi_\theta(s)$ 对 $s$ 和 $s'$ 是完全反对称的。在一个完全对称和反对称张量的双重求和中,所有项必两两抵消,结果恒为零:

$$\sum_s P_\theta(s) \nabla_\theta E^{\text{loc}}_\theta(s) = 0$$

因此,梯度仅剩第一项。利用对数微分恒等式 $\nabla_\theta P_\theta(s) = P_\theta(s) \nabla_\theta \log P_\theta(s)$,有:

$$\nabla_\theta E[\psi_\theta] = \mathbb{E}_{s \sim P_\theta} \left[ E^{\text{loc}}_\theta(s) \nabla_\theta \log P_\theta(s) \right]$$

由于对任何常数基线 $c$,$\mathbb{E}_{s \sim P_\theta} [c \nabla_\theta \log P_\theta(s)] = 0$,我们可以自然地选取变分能量的期望值 $E[\psi_\theta] = \mathbb{E}_{s \sim P_\theta}[E^{\text{loc}}_\theta(s)]$ 作为完美的基线(Baseline)以最大化程度降低梯度方差,得到:

$$\nabla_\theta E[\psi_\theta] = \mathbb{E}_{s \sim P_\theta} \left[ \left( E^{\text{loc}}_\theta(s) - E[\psi_\theta] \right) \nabla_\theta \log P_\theta(s) \right]$$

证毕。$\blacksquare$

这一证明非常优美地确立了强化学习与变分蒙特卡洛(VMC)的严格对应:

  • 自旋配置(Spin Configurations) $s$ $\Longleftrightarrow$ 强化学习中的动作(Action) $a$
  • 波函数诱导的玻恩分布 $P_\theta(s)$ $\Longleftrightarrow$ 强化学习中的随机策略(Policy) $\pi_\theta(a|s)$
  • 中心化的局部能量 $\Delta E(s) = E^{\text{loc}}_\theta(s) - E[\psi_\theta]$ $\Longleftrightarrow$ 强化学习中的优势函数(Advantage Function) $A(s, a)$
  • 希尔伯特空间中的状态内积/不忠实度(Infidelity) $\Longleftrightarrow$ 强化学习中的 KL 散度约束度规(KL Trust Region)

1.3 技术难点:复数波函数的双通道解耦与多步样本复用

在真实的物理系统中,哈密顿量往往不具有随机性(存在严重的负符号问题),且波函数必须是复数形式以承载复杂的相位结构:$\psi_\theta(s) = |\psi_\theta(s)| e^{i \arg \psi_\theta(s)}$。因此,直接照搬强化学习中的单通道 PPO 算法面临两大技术瓶颈:

  1. 振幅-相位双通道的物理演化解耦:振幅决定了在物理基下的概率分布,而相位决定了量子态的相干干涉(量子效应的核心)。在 VMC 梯度中,振幅部分与相位部分以复数共轭的形式耦合,必须设计合理的解耦更新机制。
  2. 离策(Off-Policy)样本复用的合理性:强化学习中通过重要性采样比率 $r_\theta(s) = P_\theta(s)/P_{\theta_{\text{old}}}(s)$ 来复用历史样本。而在量子力学中,多次连续更新参数后,如何保证在老分布 $P_{\theta_{\text{old}}}$ 上采样的局部能量估计对新状态 $\psi_\theta$ 依然有效?这需要严格的物理不忠实度(Infidelity)理论约束。

1.4 方法细节:近端波函数优化(PWO)算法

为了克服上述挑战,论文提出了 Proximal Wavefunction Optimization (PWO) 算法。其核心是将网络输出分为振幅通道与相位通道,并为它们分别构造带有信任区域剪切限制的变分代理损失函数:

1.4.1 振幅通道的代理损失(Amplitude Channel)

定义振幅重要性采样比率 $r_\theta(s) = \frac{P_\theta(s)}{P_{\theta_{\text{old}}}(s)}$。优势函数采用实部局部能量的中心化估算值:

$$A^R_{\theta_{\text{old}}}(s) = \text{Re}\{E^{\text{loc}}_{\theta_{\text{old}}}(s)\} - \mathbb{E}_{s \sim P_{\theta_{\text{old}}}}\left[\text{Re}\{E^{\text{loc}}_{\theta_{\text{old}}}(s)\}\right]$$

其带有 $\epsilon$-剪切的振幅代理损失函数为:

$$L^{\text{clip}}_{\text{mod}}(\theta) = \mathbb{E}_{s \sim P_{\theta_{\text{old}}}} \left[ \max \left( r_\theta(s) A^R_{\theta_{\text{old}}}(s),\ \text{clip}(r_\theta(s), 1-\epsilon, 1+\epsilon) A^R_{\theta_{\text{old}}}(s) \right) \right]$$

注意:在强化学习中由于目标是最大化回报,通常使用 $\min$ 算子;而量子力学的目标是最小化系统变分能量,故在此处使用 $\max$ 算子。

1.4.2 相位通道的代理损失(Phase Channel)

相位部分无法通过简单的比率表示,因为相位差是加性而非乘性的。作者创新性地定义了“缠绕相位增量(Wrapped Phase Increment)”:

$$\alpha_\theta(s) = \text{atan}_2 \left( \sin(\arg \psi_\theta(s) - \arg \psi_{\theta_{\text{old}}}(s)),\ \cos(\arg \psi_\theta(s) - \arg \psi_{\theta_{\text{old}}}(s)) \right)$$

并令实际的相位通道梯度控制变量 $\phi_\theta(s) = 2 \alpha_\theta(s)$。对应的虚部优势函数定义为:

$$A^I_{\theta_{\text{old}}}(s) = \text{Im}\{E^{\text{loc}}_{\theta_{\text{old}}}(s)\} - \mathbb{E}_{s \sim P_{\theta_{\text{old}}}}\left[\text{Im}\{E^{\text{loc}}_{\theta_{\text{old}}}(s)\}\right]$$

为了防止相位发生突然的、跨越 $2\pi$ 的剧烈旋转,导致波函数不相干,作者对相位增量 $\phi_\theta(s)$ 引入了限制在 $[-\delta, \delta]$ 范围内的 $\delta$-剪切损失:

$$L^{\text{clip}}_{\text{arg}}(\theta) = \mathbb{E}_{s \sim P_{\theta_{\text{old}}}} \left[ \text{sg}(r_\theta(s)) \max \left( \phi_\theta(s) A^I_{\theta_{\text{old}}}(s),\ \text{clip}(\phi_\theta(s), -\delta, \delta) A^I_{\theta_{\text{old}}}(s) \right) \right]$$

其中 $\text{sg}(\cdot)$ 为梯度阻断(Stop-Gradient)算子。这一设计具有深刻的物理学考量:当同一个批次(Batch)的配置样本在内部迭代(Inner Epochs)中被反复复用时,利用阻断梯度的重要性权重 $\text{sg}(r_\theta(s))$ 对相位通道进行加权,修正由于当前振幅概率分布变化造成的物理分布偏差。

PWO 完整的优化目标即为上述两者的联合损失:

$$L_{\text{PWO}}(\theta) = L^{\text{clip}}_{\text{mod}}(\theta) + L^{\text{clip}}_{\text{arg}}(\theta)$$

通过对 $L_{\text{PWO}}(\theta)$ 进行简单的梯度下降,即可在保持波函数几何稳定性的同时,安全地复用当前批次的自回归采样样本进行多次参数更新迭代,大幅提升每次采样的含金量。


2. 关键 Benchmark 体系、计算所得数据与性能展示

为严谨、全面地评估 PWO 算法的先进性,作者在多个物理基准体系上进行了系统的实证对比。基准算法包括:一阶最强基线 Adam、二阶轻量化随机重构 minSR,以及结合了 KFAC 与自然梯度思想的最新二阶优化器 SPRING

2.1 物理基准体系数学定义

1. 一维横场易辛模型(1D TFIM)

系统不含负符号问题,是典型的随机性哈密顿量:

$$\hat{H}_{\text{Ising}} = -J \sum_{i=1}^N \hat{\sigma}^z_i \hat{\sigma}^z_{i+1} - h \sum_{i=1}^N \hat{\sigma}^x_i$$

设置铁磁耦合强度 $J=1$,横场强度 $h=1$。系统自旋数 $N=12$(边界条件为周期性边界条件)。由于不含符号问题,命题 3.1 在此体系下严格成立。

2. 一维 Heisenberg $J_1 - J_2$ 反铁磁链(1D $J_1-J_2$ Chain)

具有强烈的量子相干与几何阻沮(Frustration),其基态波函数具有高度复杂的符号结构(Sign Structure):

$$\hat{H}_{J_1-J_2} = J_1 \sum_{i=1}^N \hat{\mathbf{S}}_i \cdot \hat{\mathbf{S}}_{i+1} + J_2 \sum_{i=1}^N \hat{\mathbf{S}}_i \cdot \hat{\mathbf{S}}_{i+2}$$

取 $J_1 = 1,\ J_2 = 0.5$(即高度阻沮的 Majumdar-Ghosh 点)。在该点,系统呈现出高度纠缠和复杂的相位模式,是对任何神经网络变分算法相位学习能力的严苛考验。

3. 二维方格点阵 $J_1-J_2$ Heisenberg 模型(2D $J_1-J_2$ Lattice)

在 $10 \times 10$ 尺度($100$ 个自旋自回归生成)的二维空间上,系统阻沮效应极强,物理上精确对角化(Exact Diagonalization)在该尺度下已完全失效。

2.2 核心计算数据与收敛表现对比

实验均在一台 NVIDIA L40S 或 A100 GPU 上进行,自回归采样数固定为 1024。主要评估指标包括:

  • 相对能量误差(Relative Error):$\epsilon_{\text{rel}} = (E[\psi_\theta] - E_0) / |E_0|$,$E_0$ 为通过精确对角化算得的真实基态能量。
  • V-score:物理学中衡量是否达到精确本征态的标度无关指标,定义为系统的能量方差 $\sigma^2_E = \langle\hat{H}^2\rangle - \langle\hat{H}\rangle^2$ 的某种无量纲标准化形式,数值越接近 0 越好。

表 1:一维自旋体系收敛表现(10个随机种子统计平均)

体系与物理量Adam 表现minSR 表现SPRING 表现PWO 表现(本文方法)
1D Ising 相对误差降至 $10^{-7}$ 所需壁钟时间~20 min~30 min~15 min~5 min
1D Ising 30分钟训练后最终 V-score~$10^{-5}$~$10^{-5}$~$10^{-5}$~$5 \times 10^{-6}$
1D $J_1-J_2$ 相对误差降至 $10^{-7}$ 所需壁钟时间无法达到(在阻沮处遭遇平台期)严重数值发散(6/10 runs 报 NaN)遭遇不稳定性,最终停留于 $10^{-1}$~15 min
1D $J_1-J_2$ 30分钟最终收敛成功率100% (但精度受限)40% (多数发散)100% (但精度较差)100% (高精度收敛)

2.3 深度数据可视化分析与解读

根据论文中的多幅插图及数据折线图,可以得出以下核心结论:

  1. 壁钟时间(Wall-clock Time)的压倒性优势
    • 如图 2 所示,在一维易辛模型上,PWO 收敛极其迅猛,在短短 5 分钟内即触及 $10^{-7}$ 的高精度壁钟收敛极限,而同等精度下 minSR 需要耗费 30 分钟。这直接得益于 PWO 每步迭代免去了高昂的曲率矩阵构建与线性方程求解成本,且其一阶梯度的计算能通过现代张量加速器高效并行。
  2. 在极端物理阻沮下的惊人稳定性
    • 如图 3 所示,在极富挑战性的 $J_1-J_2$ 反铁磁链上,传统的二阶几何算法彻底翻车。minSR 算法在 10 次独立随机种子实验中,有 6 次直接产生数值溢出(NaN)发散;而 Adam 虽能够稳定运行,却由于缺乏空间度规几何约束,在优化中途便早早陷入宽阔的能量平台期,无法进一步降低变分误差。唯有 PWO 算法,不仅保持了 100% 的极佳运行稳定性,更一举冲破阻沮壁垒,将能量相对误差压低到 $10^{-7}$ 深度精细水平,同时其 V-score 呈现出极度平滑的下降曲线,物理上完美对应了基态本征态的逼近过程。
  3. 二维大规模方格的泛化表现
    • 如图 4 所示,在 $10 \times 10$ 二维受阻沮哈密顿量中,由于无法获取精确的基底真值,作者对比了实值物理能量期望与 V-score。PWO 在壁钟时间内下降的坡度远比 Adam 陡峭,展现出在复杂高维空间中寻找极小值时无与伦比的“直达本能”。

3. 代码实现细节、复现指南与模型架构参数

为了使量子化学与多体物理研究人员能够无缝复现与扩展此项工作,论文作者在 GitHub 上完全开源了其代码框架,复现路径清晰,工程结构规范。

3.1 核心算法:PWO 更新步骤 PyTorch 伪代码

以下是根据论文中 Algorithm 1 提炼并还原的代码实现细节:

import torch
import torch.nn as nn
import torch.optim as optim

def pwo_update_step(model, optimizer, batch_spins, clip_eps=1e-3, clip_delta=0.3, K_epochs=4):
    """
    单个批次上的 PWO 信任区域内部多次迭代更新步骤
    :param model: 自回归神经网络量子态模型 (输出 log_amplitude 和 phase)
    :param optimizer: PyTorch 优化器 (如 Adam)
    :param batch_spins: 自回归抽样得到的自旋配置 batch, 形状为 [M, N]
    :param clip_eps: 振幅通道的剪切边界
    :param clip_delta: 相位通道的剪切边界
    :param K_epochs: 样本复用的内部 Epoch 数
    """
    # 1. 缓存旧状态下的参考量以构建优势函数与重要性比率基底
    with torch.no_grad():
        log_prob_old, phase_old = model.evaluate(batch_spins)
        # 计算局部能量并中心化得到实部和虚部的优势函数
        eloc = compute_local_energies(model, batch_spins) # 物理算符作用
        energy_mean = eloc.mean()
        
        adv_real = eloc.real - energy_mean.real
        adv_imag = eloc.imag - energy_mean.imag
        
        # 对优势函数进行标准化 (极大地稳定了强化学习优化过程)
        adv_real = (adv_real - adv_real.mean()) / (adv_real.std() + 1e-8)
        adv_imag = (adv_imag - adv_imag.mean()) / (adv_imag.std() + 1e-8)

    # 2. 开始信任区域内的多步参数更新
    for epoch in range(K_epochs):
        # 评估当前参数在历史样本上的概率与相位值
        log_prob_now, phase_now = model.evaluate(batch_spins)
        
        # 计算振幅通道重要性采样比率 r_theta
        ratio = torch.exp(log_prob_now - log_prob_old)
        
        # 振幅代理损失 L_mod
        surr1 = ratio * adv_real
        surr2 = torch.clamp(ratio, 1.0 - clip_eps, 1.0 + clip_eps) * adv_real
        loss_mod = torch.max(surr1, surr2).mean()
        
        # 计算相位通道的缠绕增量 phi
        phase_diff = phase_now - phase_old
        phi = 2.0 * torch.atan2(torch.sin(phase_diff), torch.cos(phase_diff))
        
        # 相位代理损失 L_arg (重要性权重阻断梯度流)
        ratio_detached = ratio.detach()
        surr_phase1 = phi * adv_imag
        surr_phase2 = torch.clamp(phi, -clip_delta, clip_delta) * adv_imag
        loss_arg = ratio_detached * torch.max(surr_phase1, surr_phase2)
        loss_arg = loss_arg.mean()
        
        # 联合损失函数
        total_loss = loss_mod + loss_arg
        
        # 反向传播并更新参数
        optimizer.zero_grad()
        total_loss.backward()
        optimizer.step()

3.2 自回归神经网络量子态架构与超级参数设定

为了保证优化器性能对比的公平性,一维自旋体系的对比实验在完全一致的神经网络量子态(NQS)架构下运行。网络基础设置如下:

  • 骨干特征提取网络(Backbone):3 层门控循环单元(GRU),隐藏层维度为 256。自旋序列经过 32 维的词嵌入层(Token Embedding)以及可学习的位置编码(Position Embedding)后输入骨干网,利用循环网络天然的因果掩码性质实现精准的自回归概率分布分解:$P(s) = \prod_{i=1}^N P(s_i | s_{
  • 振幅预测头(Amplitude Head):2 层多层感知机(MLP),激活函数为 GELU,隐藏维度 256,最后一层通过 Log-Softmax 输出每个自旋位点的条件对数概率。
  • 相位预测头(Phase Head):2 层 MLP,激活函数为 GELU,隐藏维度 256,最后一层输出值通过 $\pi \tanh(\cdot)$ 算子缩放到 $[-\pi, \pi]$ 区间内,作为预测的局部物理相位。

表 2:1D Ising 与 $J_1-J_2$ 体系完整超级参数清单(由 Appendix D 汇总)

物理超参数与优化设置易辛模型(Ising Model)反铁磁链($J_1-J_2$ Chain)
体系格点数 $N$1212
玻恩分布采样数(Batch Size)10241024
自回归网络总参数量(Parameters)~1.4 M~1.4 M
PWO 内部迭代 Epochs ($K$)44
振幅剪切阈值 $\epsilon$$10^{-3}$$10^{-3}$
相位剪切阈值 $\delta$0.30.3
外部主循环总步数(Transition Steps)20,00040,000
学习率(LR)调度方案Cosine One-Cycle ScheduleCosine One-Cycle Schedule
峰值学习率(Peak Learning Rate)$10^{-4}$$10^{-4}$
基础学习率(Base Learning Rate)$10^{-5}$$10^{-5}$
优势函数标准化(Advantage Normalization)是 (Yes)是 (Yes)

3.3 百亿参数级大模型微调:RWKV-7 NQS 实践

为了探索参数规模极限,论文完成了一项前无古人的壮举:利用 PWO 算法,在一台 2 卡 80G 的算力设备上,成功在 1D Ising 物理体系中微调了参数量高达 15 亿的 RWKV-7 大语言模型。这也是业界首次将具有高度物理精度的 NQS 优化规模扩展至十亿(Billion)级别。

  • 微调架构:RWKV-7 因其线性注意力的常数级显存占用和极其优秀的递归推理能力,成为自回归物理模拟的理想框架(规避了 Transformer 随序列长度增加而爆发的 $O(N^2)$ 显存和 KV 缓存瓶颈)。
  • 训练配置:微调批量大小设为 150,在训练中复用样本进行 $K=4$ 步内部优化,峰值学习率控制在 $10^{-5}$ 这一微小尺度以维护预训练大模型的知识。实验结果(见 Figure 6)清晰证实:PWO 依然表现得异常平稳,没有发生任何大规模参数更新中常见的梯度崩塌,其最终相对误差水平显著低于直接用 Adam 优化的相同模型,充分展示了“信任区域”在超大模型上的非凡泛化力。

4. 关键引用文献与局限性批判评论

4.1 关键引用文献

本项研究建立在强化学习与多体物理计算交汇处的多项奠基性工作之上:

  1. Carleo & Troyer (2017) Science:首次提出使用人工神经网络(受限玻尔兹曼机 RBM)作为变分量子态表示,开创了神经网络量子态(NQS)的先河。PWO 算法继承了其能量最小化的理论构想。
  2. Schulman et al. (2017) PPO:提出了强化学习中经典的近端策略优化(PPO)算法。PWO 算法在振幅通道和重要性采样机制的设计上深受其启发。
  3. Chen & Heyl (2024) Nature Physics (minSR):将复杂的随机重构(二阶几何优化)投影到样本空间,提出了 minSR 算法以缓解矩阵求逆复杂度。PWO 在多项实验中将其作为核心二阶物理对比基线。
  4. Peng et al. (2025) RWKV-7:开发了极高性能的非 Transformer 架构线性注意力序列大模型。本篇论文借此架构验证了 PWO 在 15 亿参数体量上的惊人稳定性。
  5. Wu et al. (2024) Science:建立了高精度的变分量子多体基准体系,并提出了衡量是否逼近本征态的重要指标 V-score,本篇论文将其作为最核心的精度和稳定性指标。

4.2 局限性批判评论(Critical Commentary)

尽管本篇论文在方法论和规模化上取得了划时代的突破,但从一位严谨的物理多体模拟与量子化学研究者的视角来看,以下几个局限性依然值得我们在未来的研究中保持审慎态度:

1. 理论映射的局限:仅在 Stoquastic 系统下成立的严格等价

命题 3.1 极度优美的推导建立在“哈密顿量为随机性,且波函数可以设为实数且恒正”的假设之上。然而,在绝大多数具有物理和化学实际应用价值的体系中(例如强关联电子系统、过渡金属催化剂、光化学激发态等),哈密顿量由于费米子反对易关系而存在极其致命的负符号问题(Negative Sign Problem)。此时,波函数必须包含极为复杂的复数相位结构。虽然作者在实践中为相位通道设计了 $\delta$-剪切代理损失并展现出极好的启发式(Heuristic)效果,但在理论上,命题 3.1 中最关键的“局部能量导数项总和恒等于零”在复数相位波函数下已经不再成立。这意味着,在存在非随机哈密顿量的复杂物理系统中,PWO 的更新方向在数学上并不具有完美的“一阶策略梯度一致性”,理论保证被一定程度地削弱了。

2. 空间自由度的物理局限:格点自旋系统 vs 连续化学空间

论文所有的实验和微调大模型均运行在格点自旋模型(Ising, Heisenberg)上,其希尔伯特空间是离散且有限的(即二进制的 $\{+1, -1\}$ 自旋状态)。而在真实的原子分子量子化学计算中,电子量子态演化在连续空间上:

$$\hat{H} = -\frac{1}{2}\sum_i \nabla^2_i - \sum_{i,I}\frac{Z_I}{|r_i - R_I|} + \sum_{i在连续实空间下,波函数的自回归生成形式(例如 FermiNet 等变分蒙特卡洛框架)和离散的格点有着本质的区别。如何在连续三维坐标空间中构建类似 PWO 的振幅概率比与相位增量约束,并克服由于原子核电荷处势能发散导致的局部能量巨大涨落,是该方法跨入实用量子化学门槛前必须要攻克的巨大天堑。

3. 信任区域超参数($\epsilon$ 和 $\delta$)的敏感性

PWO 引入了额外的控制参数:振幅剪切范围 $\epsilon$ 与相位剪切范围 $\delta$,以及内部多步更新次数 $K$。如果 $\epsilon$ 和 $\delta$ 设定过小,参数更新将变得极度保守,模型会被锁死在初始状态附近无法取得进展;若设定过大,则会失去信任区域约束,退化为普通一阶方法并可能发散。由于不同哈密顿量、不同粒子规模的能量尺度天差地别,寻找最优的 $\epsilon, \delta, K$ 组合往往需要进行昂贵且反复的超参数搜索(Hyperparameter Search),这在微调极大规模大模型时会带来极高的算力开销。


5. 补充深度解析:强化学习与量子变分法底层的哲学共振

5.1 量子变分法、控制论与强化学习的交叉之美

为什么强化学习的策略优化(Policy Optimization)和量子化学中的变分蒙特卡洛(VMC)能结合得如此严丝合缝?这并不是一种偶然的数学巧合,而是两个学科在面对“通过采样探寻未知状态最优分布”这一底层逻辑时表现出的惊人哲学共振。

在经典强化学习中,智能体的目标是在未知环境中探索,通过采取一系列动作 $a_t$,从而使期望的累积折扣奖励(Expected Return)最大化:

$$\max_\theta J(\pi_\theta) = \mathbb{E}_{\tau \sim \pi_\theta}\left[ \sum_{t} \gamma^t r_t \right]$$

而在量子多体变分寻优中,我们面对的是一片庞大到不可思议的复希尔伯特空间($2^N$ 维度)。我们不能直接存储和计算这个波函数,唯一的观测手段是根据当下的概率分布 $P_\theta(s) = |\psi_\theta(s)|^2$ 进行蒙特卡洛抽样。量子物理学中的能量算符 $\hat{H}$ 充当了“大自然制定的物理环境惩罚机制”:高能量的配置 $s$ 会带来极其严厉的“惩罚”(高能量),而低能量配置则给予“奖励”(让能量逼近基态)。

变分原理告诉我们,大自然本身是一个极其完美的优化器:它总是自发地倾向于使其整体能量降到最低。我们通过主动调整自回归神经网络的权重 $\theta$,驱使其生成的概率概率分布主动避开那些高能量的“暗礁区域”(排斥这些高能配置),并向那些局部能量最低的“基态深谷”(吸引低能配置)靠拢。这与强化学习智能体通过调整策略分布,避开低奖励的惩罚区域并追求高收益的目标完全同构。

5.2 符号问题与强化学习“探索-利用”博弈的融合

在多体物理和量子化学中,最令科学家望而生畏的是“负符号问题”(Sign Problem)。由于费米子反对易波函数的物理约束,波函数在不同物理区间的符号会剧烈正负交替振荡,导致传统蒙特卡洛积分的方差呈指数级发散。

从强化学习的视角来看,符号问题在本质上对应着极度稀疏且高度震荡的优势函数景观(highly oscillating and sparse reward landscapes)。如果波函数的相位在空间中缺乏连续稳定的几何规整性,神经网络量子态在抽样时就会像一个在极度混乱迷宫中摸索的智能体:它在前进一步时获得了巨大的正反馈(极大优势),但在微调动作参数后瞬间又踩中了巨大的负反馈(极深能量陷阱)。这会导致一阶优化方向发生灾难性的剧烈摇摆。

PWO 算法引入相位通道的缠绕相位增量剪切约束 $\delta$,在强化学习中等价于控制智能体探索的步长极限,其底层逻辑正是著名的“保真度度规(Fidelity Metric)”。在两次连续的内部更新中,PWO 强行限制波函数在复平面上的旋转辐角不能超过一个微小区间。这保证了哪怕在极其严重的符号问题下,前一步探索出的物理样本对当前步的更新指导仍然是可靠的。这一深刻的交叉学科融合,为我们在未来解决复杂的费米子符号问题、进行高精度分子反应动力学模拟指明了极具希望的突破方向。

5.3 展望:计算尺度的“香甜教训(The Bitter Lesson)”

人工智能先驱 Rich Sutton 曾在其名篇《The Bitter Lesson》(惨痛的教训)中指出,AI 长期历史发展中最强大的推动力始终是“利用通用算力并进行规模化(Scaling)的通用算法”。传统的量子化学方法往往依赖于大量针对特定分子、特定相关效应的高度精细化、人工设计的物理逼近技巧,这在计算规模化上很难搭上通用硬件发展的快车。

本篇论文最令人兴奋的尝试在于,通过引入 PWO 算法的局部信任区域保护,直接将最前沿的 15 亿参数语言大模型 RWKV-7 转化为一个高容量的神经网络量子态。这表明,量子物理学与计算化学正在真正并轨进入大模型与超算算力的主航道。我们可以设想,在不久的将来,通过在海量各种分子哈密顿量上预训练巨型自回归 Transformer/RWKV Quantum State 模型,并利用 PWO 算法在特定目标化学反应体上进行快速而极其稳定的近端微调,人类将有望实现真正的“量子化学通用基态求解大模型”,彻底颠覆新药研发、超导材料设计以及催化剂发现的既有工业版图。