AI

HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

[論文] HoloCine:電影級多鏡頭長影片敘事的全域生成技術

來自香港科技大學和螞蟻集團的突破性框架 HoloCine,透過實現連貫的多鏡頭敘事,革命性地改變了 AI 生成影片。不同於目前創造孤立片段的模型,HoloCine 全域性地處理整個場景,確保敘事中角色、環境和風格的一致性。兩個關鍵創新驅動其成功:提供精確導演控制的視窗交叉注意力機制,以及實現高效長程一致性的稀疏鏡頭間自注意力機制。在包含 40 萬個多鏡頭影片樣本的策劃資料集上訓練,HoloCine 在轉換控制、一致性和語義保真度方面優於現有模型。它還展現了角色記憶和電影攝影語言理解的新興能力。儘管存在一些限制,HoloCine 代表了朝向端到端自動化電影製作的重要一步,為內容創作者和電影製作人開啟了新的可能性。

[論文] HoloCine:電影級多鏡頭長影片敘事的全域生成技術 閱讀全文 »

Next-Generation GPU Technology: Sony and AMD's Revolutionary Path Tracing for PS6

次世代GPU技術:Sony與AMD為PS6打造的革命性路徑追蹤技術

Sony與AMD公布了「紫水晶計畫」,這是為下一代PlayStation主機打造的革命性GPU架構。這項合作引入了專用的「輻射核心」來處理進階路徑追蹤,實現更逼真的光照和反射效果。該架構還具備「神經陣列」來改善AI處理能力,以及「通用壓縮」技術來提升記憶體頻寬效率。這些創新承諾從根本改變遊戲彩現方式,提供前所未有的視覺逼真度和效能表現。雖然PlayStation 6的具體細節尚未透露,但產業專家預期將在2027-2028年發布。這項技術躍進可能影響整個遊戲產業,潛在地衝擊未來的PC圖形技術和遊戲以外的專業應用領域。

次世代GPU技術:Sony與AMD為PS6打造的革命性路徑追蹤技術 閱讀全文 »

QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs

[論文] QeRL:超越效率 — 量化增強的大型語言模型強化學習

NVIDIA 和 MIT 的研究人員開發了 QeRL,這是一個透過量化技術增強大型語言模型強化學習(RL)的突破性框架。結合 NVFP4 量化和低秩適應(LoRA),QeRL 實現了更快速的 RL 訓練並降低記憶體開銷。關鍵創新是自適應量化雜訊機制,將量化雜訊轉化為改善訓練探索的工具。QeRL 在數學推理任務上的速度和準確度都超越了標準技術。值得注意的是,它能夠在單張 H100 GPU 上訓練 320 億參數模型,讓大規模 RL 訓練變得更加民主化。這種方法挑戰了將量化視為妥協的傳統觀點,證明了其在 RL 環境中提升模型性能的潛力。

[論文] QeRL:超越效率 — 量化增強的大型語言模型強化學習 閱讀全文 »

StreamingVLM: Real-Time Understanding for Infinite Video Streams

[論文] StreamingVLM:無限影片串流媒體的即時理解技術

來自 MIT Han Lab 的突破性視覺語言模型 StreamingVLM,革命性地改變了即時影片處理技術。它透過有效處理無限影片串流媒體同時維持效能和低延遲,克服了現有模型的限制。該模型的創新架構使用緊湊的鍵值快取,智慧重用注意力狀態和 token 視窗。其訓練方法採用在重疊影片片段上的監督微調,模擬推理時的注意力模式。基於 Qwen-2.5-VL-7B-Instruct 建構的 StreamingVLM 在體育評論方面優於 GPT-4o mini,並增強了一般影片問答能力。在單張 NVIDIA H100 GPU 上以每秒 8 影格的穩定效能,它為各種應用中的連續、即時影片理解開啟了新可能性,讓我們更接近像人類一樣持續感知世界的 AI 系統。

[論文] StreamingVLM:無限影片串流媒體的即時理解技術 閱讀全文 »

The AI Revolution: Navigating Growth, Challenges, and Market Realities in Today's Tech Landscape

AI 革命:在當今科技環境中駕馭成長、挑戰與市場現實

人工智慧已從理論概念快速演進為必要的商業工具,轉型各產業並吸引前所未有的投資。然而,英格蘭銀行和 IMF 等金融機構警告潛在的「AI 泡沫」和市場修正風險。AI 運算能力需求正急劇上升,對能源資源和基礎設施造成壓力。與此同時,AMD 和 OpenAI 等合作夥伴關係正挑戰輝達的晶片市場主導地位,重塑競爭格局。
在市場熱情中,對估值永續性的擔憂持續存在。AI 已經在轉型職場,像 Google 的 Gemini Enterprise 這樣的工具承諾提升生產力。然而,對就業的長期影響仍不確定。當我們駕馭這個複雜環境時,平衡創新與永續成長至關重要。技術採用和投資策略的多元化將是在這個變革時代最大化 AI 好處同時減輕風險的關鍵。

AI 革命:在當今科技環境中駕馭成長、挑戰與市場現實 閱讀全文 »

The AI Bubble Concerns and Valuations: Are We Headed for a Correction?

AI 泡沫疑慮與估值問題:我們正走向市場修正嗎?

金融機構和產業領袖對 AI 領域飆升的估值表達擔憂,將其與過往科技泡沫相提並論。億萬富翁奧蘭多·布拉沃警告出現「AI 泡沫」,將目前情況比作網路泡沫時代。市場高度集中於科技巨頭,AI 相關公司的市值出現戲劇性飆升。
英格蘭銀行和 IMF 已對 AI 期望轉淡時可能出現的市場修正發出警告。雖然今日的科技公司通常比網路泡沫前輩在財務上更為健全,但基於未來潛力而非當前表現的過度估值風險仍然存在。
建議投資人專注於將 AI 整合到獲利產品中的成熟企業,以及採用由明確投資報酬率指標驅動的產業。長期投資人可能將任何修正視為投資擁有可持續 AI 商業模式公司的機會。

AI 泡沫疑慮與估值問題:我們正走向市場修正嗎? 閱讀全文 »

NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints

[論文] NaViL:在資料限制下重新思考原生多模態大型語言模型的擴展特性

NaViL 研究論文在原生多模態大型語言模型(MLLMs)方面呈現突破性進展。透過系統性探討設計選擇和擴展特性,該研究顯示原生端到端 MLLMs 能夠以較少訓練資源達到與組合式模型相當的性能。關鍵發現包括 LLM 初始化的好處、專家混合架構的有效性,以及視覺編碼器設計的靈活性。最值得注意的是,該研究揭露了視覺編碼器和語言模型最佳尺寸之間的新穎關聯性,挑戰傳統觀念。所產生的 NaViL 模型在各種基準測試中達到競爭性能,證明了在適當架構考量下原生 MLLMs 的潛力。這項工作對未來 MLLM 發展具有重大啟示,可能在多模態 AI 系統設計上帶來範式轉移。

[論文] NaViL:在資料限制下重新思考原生多模態大型語言模型的擴展特性 閱讀全文 »

OpenAI's Strategic Expansion: How DevDay 2025 Is Reshaping the AI Development Landscape

OpenAI 的策略性擴張:DevDay 2025 如何重塑 AI 開發版圖

OpenAI 的 DevDay 2025 展示了 AI 開發的變革性願景。活動發表了 Apps SDK,讓第三方服務能夠無縫整合到 ChatGPT 中。AgentKit 賦能開發者創建專業化的 AI 代理,而 Codex 的全面開放則革命性地改變了程式設計協助。與 AMD 的里程碑式合作夥伴關係讓 OpenAI 的硬體供應鏈多元化,顯示出雄心勃勃的成長計畫。GPT-5 Pro 和 Sora 2 擴展了公司的模型產品組合,增強了開發者的能力。這些發表將 ChatGPT 定位為數位互動的中央樞紐,可能顛覆傳統的應用程式生態系統。透過創造全方位的 AI 開發平台,OpenAI 正在重塑我們與科技互動的方式,並擴展人工智慧在各行各業的可能性。

OpenAI 的策略性擴張:DevDay 2025 如何重塑 AI 開發版圖 閱讀全文 »

The New AI Chip Wars: How OpenAI's AMD Partnership Is Reshaping The Computing Landscape

全新 AI 晶片大戰:OpenAI 與 AMD 合作如何重塑運算版圖

AI 晶片市場正經歷著 OpenAI 與 AMD 突破性合作帶來的劇烈轉變。這項五年協議涉及 60 億瓦特的 AMD AI 晶片以及 OpenAI 潛在 10% 股份,挑戰了 Nvidia 的主導地位。AMD 股價飆升 23.7%,反映了投資者對其競爭能力的信心。對 OpenAI 而言,這使其晶片供應多元化,不再僅依賴 Nvidia。這項合作標誌著 AI 基礎設施競爭的新時代,可能推動創新並降低成本。它也突顯了資料中心和 AI 硬體的大規模投資,預計 2025 年全球 IT 支出將達到 5.74 兆美元。這項合作可能重塑 AI 運算版圖,為企業提供更多選擇並加速 AI 進步。

全新 AI 晶片大戰:OpenAI 與 AMD 合作如何重塑運算版圖 閱讀全文 »

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

[論文] VChain:影片生成推理的視覺思維鏈

VChain 是來自南洋理工大學和 Eyeline Labs 的突破性框架,彌合了影片生成與類人推理之間的差距。它利用 GPT-4o 的推理能力來增強影片擴散模型,無需大量重新訓練。這個三階段方法包括視覺思維推理、稀疏推理時調整和影片採樣。此方法顯著改善了生成影片中的物理推理、常識理解和因果關係。VChain 在推理時高效運作,無需外部資料集。它代表了將推理整合到生成模型中的範式轉變,展示了不同 AI 系統如何協同工作。這項進展對於在各種應用中創造邏輯一致且物理合理的影片具有深遠影響。

[論文] VChain:影片生成推理的視覺思維鏈 閱讀全文 »