LLM

大型語言模型

QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs

[論文] QeRL:超越效率 — 量化增強的大型語言模型強化學習

NVIDIA 和 MIT 的研究人員開發了 QeRL,這是一個透過量化技術增強大型語言模型強化學習(RL)的突破性框架。結合 NVFP4 量化和低秩適應(LoRA),QeRL 實現了更快速的 RL 訓練並降低記憶體開銷。關鍵創新是自適應量化雜訊機制,將量化雜訊轉化為改善訓練探索的工具。QeRL 在數學推理任務上的速度和準確度都超越了標準技術。值得注意的是,它能夠在單張 H100 GPU 上訓練 320 億參數模型,讓大規模 RL 訓練變得更加民主化。這種方法挑戰了將量化視為妥協的傳統觀點,證明了其在 RL 環境中提升模型性能的潛力。

[論文] QeRL:超越效率 — 量化增強的大型語言模型強化學習 閱讀全文 »

NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints

[論文] NaViL:在資料限制下重新思考原生多模態大型語言模型的擴展特性

NaViL 研究論文在原生多模態大型語言模型(MLLMs)方面呈現突破性進展。透過系統性探討設計選擇和擴展特性,該研究顯示原生端到端 MLLMs 能夠以較少訓練資源達到與組合式模型相當的性能。關鍵發現包括 LLM 初始化的好處、專家混合架構的有效性,以及視覺編碼器設計的靈活性。最值得注意的是,該研究揭露了視覺編碼器和語言模型最佳尺寸之間的新穎關聯性,挑戰傳統觀念。所產生的 NaViL 模型在各種基準測試中達到競爭性能,證明了在適當架構考量下原生 MLLMs 的潛力。這項工作對未來 MLLM 發展具有重大啟示,可能在多模態 AI 系統設計上帶來範式轉移。

[論文] NaViL:在資料限制下重新思考原生多模態大型語言模型的擴展特性 閱讀全文 »

WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research

[論文] WebWeaver:運用動態大綱結構化網路規模證據,實現開放式深度研究

由李子健領導的突破性雙代理框架 WebWeaver,透過模仿人類程序革新了 AI 驅動的研究。它在主要基準測試中超越現有系統,解決了當前研究代理的關鍵限制。該框架具有動態規劃器,能根據新證據持續精煉研究大綱,以及採用階層式合成進行高效資訊管理的寫作器。WebWeaver 的記憶庫架構確保最終報告具有強大的來源基礎。廣泛實驗證明其在具挑戰性的開放式深度研究任務中表現卓越。這種方法可以蒸餾到較小模型中,讓更易取得的 AI 達到專家級表現。WebWeaver 代表了處理複雜、資訊密集任務的範式轉變,為更類似人類的人工智慧鋪平了道路。

[論文] WebWeaver:運用動態大綱結構化網路規模證據,實現開放式深度研究 閱讀全文 »

ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization

[論文] ReSum:透過情境摘要解鎖長期搜尋智慧

來自阿里巴巴集團通義實驗室的研究人員開發了 ReSum,這是一種突破性方法,克服了 AI 驅動網頁搜尋代理中的情境視窗限制。ReSum 透過策略性摘要定期壓縮互動歷史,讓代理能夠無限期探索,同時保持對先前發現訊息的認知。這項創新解決了 ReAct 範式中的關鍵瓶頸,該範式中持續附加互動會快速耗盡情境視窗。

[論文] ReSum:透過情境摘要解鎖長期搜尋智慧 閱讀全文 »

Untitled Post

[論文] FlowRL:配對獎勵分佈的大語言模型推理方法

FlowRL 在大語言模型強化學習領域引入了典範轉移,從獎勵最大化轉向獎勵分佈配對。這種新穎方法解決了現有方法普遍存在的模式崩塌問題,促進多樣化探索並防止收斂到有限的解決方案模式。透過將策略模型與完整獎勵分佈對齊,FlowRL 鼓勵涵蓋多種解決策略,從而產生更具泛化性的推理能力。實驗結果證明在數學和程式碼推理任務上持續優於基準方法,相較於基準方法有令人印象深刻的改善。FlowRL 生成大幅更多樣化推演的能力為訓練能夠適應不同問題設定的推理模型開啟了新的可能性,代表了在開發更強健和靈活的 AI 系統方面的重大進展。

[論文] FlowRL:配對獎勵分佈的大語言模型推理方法 閱讀全文 »

VaultGemma: How Google's Privacy-Preserving LLM Is Redefining AI Data Protection

VaultGemma:Google 隱私保護 LLM 如何重新定義 AI 資料保護

Google 的 VaultGemma 標誌著隱私意識 AI 開發的重大躍進。這個創新的大型語言模型採用差分隱私技術來保護使用者資料,同時維持令人印象深刻的效能表現。透過在訓練過程中引入校準的「雜訊」,VaultGemma 防止了個別資料點的記憶化,而不犧牲更廣泛的模式識別能力。
該模型的創建涉及對差分隱私語言模型擴展定律的廣泛研究,平衡運算、隱私和資料預算。儘管只有適中的 10 億參數,VaultGemma 展現了卓越的隱私保護能力和與類似規模非私密模型相當的效能表現。
以開放權重形式發布的 VaultGemma,代表了產業更積極解決隱私問題的更廣泛趨勢。這項發展挑戰了在沒有保護措施的情況下收集更多資料是 AI 進步唯一途徑的假設,可能改變未來 AI 系統在各種敏感領域的設計和實施方式。

VaultGemma:Google 隱私保護 LLM 如何重新定義 AI 資料保護 閱讀全文 »

Anthropic Addresses Claude Quality Degradation: Understanding the Recent Model Output Issues

Anthropic 解決 Claude 品質下降問題:深入了解近期模型輸出異常

Anthropic 最近解決了影響數個 Claude AI 模型的品質問題,包括 Sonnet 4、Haiku 3.5,以及可能的 Opus 4.1。兩個獨立的錯誤被識別並修復,在 2025 年 8 月至 9 月初期間對部分使用者造成輸出品質下降。這些問題突顯了維持先進語言模型一致性能的挑戰。
使用者已經表達了數週的擔憂,特別是在程式碼生成和指令遵循方面。Anthropic 強調這些是非故意的技術錯誤,而非刻意限制。該公司的透明回應包括承諾提供詳細的事後分析。
這起事件強調了持續監控、使用者回饋,以及在使用 AI 系統時保持批判性觀點的重要性。它提醒我們,即使是最先進的模型也可能經歷意外的性能問題。

Anthropic 解決 Claude 品質下降問題:深入了解近期模型輸出異常 閱讀全文 »

The SLM Revolution: Why Small Language Models Are Poised to Dominate Agentic AI

SLM 革命:為什麼小型語言模型將主導代理式 AI

AI 領域正在轉變,挑戰語言模型「越大越好」的典範。NVIDIA 研究人員認為小型語言模型(SLM)是智慧 AI 代理的未來,以極少成本提供與大型語言模型(LLM)相當的性能。微軟的 Phi-2 和 NVIDIA 的 Nemotron-H 系列等現代 SLM 展現了與更大型模型匹敵的能力。SLM 更經濟、靈活,且更符合代理式應用需求。實用的轉換演算法讓組織能從 LLM 轉向 SLM。儘管採用存在障礙,轉向以 SLM 為優先的架構代表更永續且具成本效益的 AI 部署方法。未來很可能屬於策略性部署較小專門模型處理大多數任務,僅在需要額外能力的特定情況下保留較大模型的做法。

SLM 革命:為什麼小型語言模型將主導代理式 AI 閱讀全文 »

Untitled Post

15個經過驗證的策略,在不犧牲效能的前提下降低LLM成本

最佳化LLM成本對於可持續的AI採用至關重要。本指南探討15個經過驗證的策略,在不犧牲效能的前提下降低費用。關鍵技術包括提示最佳化、選擇適當模型、語義快取和智慧路由。進階方法如RAG、提示壓縮和模型蒸餾可以帶來顯著節省。實施高效的記憶體管理、量化和早期停止進一步減少代幣使用。全面監控和建立強健的LLMOps基礎設施對於持續最佳化至關重要。真實世界案例研究顯示在維持品質的同時可實現高達82%的成本削減。透過結合這些策略,組織可以實現大幅節省,促進更廣泛的AI採用和創新。

15個經過驗證的策略,在不犧牲效能的前提下降低LLM成本 閱讀全文 »

LLM-Friendly Documentation: Creating Content That AI Can Understand and Process Effectively

LLM 友善文件:創建 AI 能理解並有效處理的內容

AI 時代的文件必須同時服務人類和機器,特別是大型語言模型(LLM)。LLM 友善文件在保持人類可讀性的同時最佳化 AI 處理內容。關鍵原則包括清晰的階層結構、一致的術語、簡潔的語言和明確的脈絡提供。Markdown 因其簡潔性和可讀性而成為首選格式。
實作 .md 頁面、llms.txt 和 llms-full.txt 等功能可增強 LLM 相容性。內容結構應專注於邏輯階層、按子產品分割,以及包含疑難排解常見問題。包含自包含程式碼片段和脈絡註解的範例驅動文件大大有助於 LLM 理解。
社群資源、OpenAPI 規格和使用 AI 工具的定期測試進一步改善文件品質。隨著 LLM 技術的發展,檢索增強生成和多模態文件等趨勢將塑造未來實務。

LLM 友善文件:創建 AI 能理解並有效處理的內容 閱讀全文 »