[論文] QeRL:超越效率 — 量化增強的大型語言模型強化學習
NVIDIA 和 MIT 的研究人員開發了 QeRL,這是一個透過量化技術增強大型語言模型強化學習(RL)的突破性框架。結合 NVFP4 量化和低秩適應(LoRA),QeRL 實現了更快速的 RL 訓練並降低記憶體開銷。關鍵創新是自適應量化雜訊機制,將量化雜訊轉化為改善訓練探索的工具。QeRL 在數學推理任務上的速度和準確度都超越了標準技術。值得注意的是,它能夠在單張 H100 GPU 上訓練 320 億參數模型,讓大規模 RL 訓練變得更加民主化。這種方法挑戰了將量化視為妥協的傳統觀點,證明了其在 RL 環境中提升模型性能的潛力。










