生成式AI

HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

[論文] HoloCine:電影級多鏡頭長影片敘事的全域生成技術

來自香港科技大學和螞蟻集團的突破性框架 HoloCine,透過實現連貫的多鏡頭敘事,革命性地改變了 AI 生成影片。不同於目前創造孤立片段的模型,HoloCine 全域性地處理整個場景,確保敘事中角色、環境和風格的一致性。兩個關鍵創新驅動其成功:提供精確導演控制的視窗交叉注意力機制,以及實現高效長程一致性的稀疏鏡頭間自注意力機制。在包含 40 萬個多鏡頭影片樣本的策劃資料集上訓練,HoloCine 在轉換控制、一致性和語義保真度方面優於現有模型。它還展現了角色記憶和電影攝影語言理解的新興能力。儘管存在一些限制,HoloCine 代表了朝向端到端自動化電影製作的重要一步,為內容創作者和電影製作人開啟了新的可能性。

[論文] HoloCine:電影級多鏡頭長影片敘事的全域生成技術 閱讀全文 »

StreamingVLM: Real-Time Understanding for Infinite Video Streams

[論文] StreamingVLM:無限影片串流媒體的即時理解技術

來自 MIT Han Lab 的突破性視覺語言模型 StreamingVLM,革命性地改變了即時影片處理技術。它透過有效處理無限影片串流媒體同時維持效能和低延遲,克服了現有模型的限制。該模型的創新架構使用緊湊的鍵值快取,智慧重用注意力狀態和 token 視窗。其訓練方法採用在重疊影片片段上的監督微調,模擬推理時的注意力模式。基於 Qwen-2.5-VL-7B-Instruct 建構的 StreamingVLM 在體育評論方面優於 GPT-4o mini,並增強了一般影片問答能力。在單張 NVIDIA H100 GPU 上以每秒 8 影格的穩定效能,它為各種應用中的連續、即時影片理解開啟了新可能性,讓我們更接近像人類一樣持續感知世界的 AI 系統。

[論文] StreamingVLM:無限影片串流媒體的即時理解技術 閱讀全文 »

OpenAI's Strategic Expansion: How DevDay 2025 Is Reshaping the AI Development Landscape

OpenAI 的策略性擴張:DevDay 2025 如何重塑 AI 開發版圖

OpenAI 的 DevDay 2025 展示了 AI 開發的變革性願景。活動發表了 Apps SDK,讓第三方服務能夠無縫整合到 ChatGPT 中。AgentKit 賦能開發者創建專業化的 AI 代理,而 Codex 的全面開放則革命性地改變了程式設計協助。與 AMD 的里程碑式合作夥伴關係讓 OpenAI 的硬體供應鏈多元化,顯示出雄心勃勃的成長計畫。GPT-5 Pro 和 Sora 2 擴展了公司的模型產品組合,增強了開發者的能力。這些發表將 ChatGPT 定位為數位互動的中央樞紐,可能顛覆傳統的應用程式生態系統。透過創造全方位的 AI 開發平台,OpenAI 正在重塑我們與科技互動的方式,並擴展人工智慧在各行各業的可能性。

OpenAI 的策略性擴張:DevDay 2025 如何重塑 AI 開發版圖 閱讀全文 »

Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models

[論文] Video-LMM 後訓練:大型多模態模型在影片推理領域的深度探討

影片理解已達到關鍵轉捩點,隨著大型多模態模型的崛起。羅徹斯特大學的突破性調查探討了後訓練方法如何將基礎影片感知轉變為先進推理系統。該研究確定了三大關鍵支柱:結合思維鏈推理的監督式微調、使用群組相對政策最佳化的強化學習,以及用於改善可靠性的測試時間擴展。這些技術解決了影片處理中的獨特挑戰,包括時間定位、時空定位和多模態整合。該調查整理了重要的基準測試和評估協議,強調標準化報告的重要性。展望未來,研究人員強調了有前景的方向,如結構化推理介面、組合式獎勵和信心感知系統。這項全面檢視提供了統一框架和路線圖,用於推進影片理解能力。

[論文] Video-LMM 後訓練:大型多模態模型在影片推理領域的深度探討 閱讀全文 »

The Unreasonable Effectiveness of Scaling Agents for Computer Use

[論文] 電腦使用代理人擴展的不合理有效性

行為最佳 N 選一(bBoN)透過產生多個解決方案嘗試並智慧選擇最佳方案,徹底革新了電腦使用代理人。這種由 Simular Research 開發的「廣度擴展」方法大幅改善了任務成功率,在基準測試上達到 69.9% 的準確率——幾乎與人類表現的 72% 相匹配。該框架的關鍵組件——行為敘述生成器和最佳 N 選一判斷器——有效地總結和比較解決方案軌跡。建構於 Agent S2 基礎上並推出 Agent S3,bBoN 展現了隨著 rollouts 增加和模型多樣性提升的一致改善。它在不同作業系統間顯示強大的泛化能力,並為在真實世界應用中部署可靠的電腦使用代理人指出了充滿前景的方向,儘管在共享資源管理方面存在一些限制。

[論文] 電腦使用代理人擴展的不合理有效性 閱讀全文 »

Google's AI Revolution: How Gemini is Transforming Photos, Search, and Entertainment

Google 的 AI 革命:Gemini 如何改變照片、搜尋與娛樂體驗

Google 的 Gemini AI 正在革命化其生態系統中的使用者互動。從 Google 相簿的對話式照片編輯到 Google Chat 的 AI 驅動訊息最佳化,該公司正讓精密科技變得人人可及。Google TV 現在提供 AI 驅動對話,而 Play Store 整合 Gemini Live 提供遊戲內協助。Search Live 結合即時 AI 語音搜尋與影片功能,改變我們尋找資訊的方式。這些進展為內容創作者和開發者簡化工作流程,而 AI Plus 擴展到超過 40 個國家展現了 Google 對全球 AI 可及性的承諾。隨著 Gemini 整合深化,我們可以預期跨越所有設備和服務更無縫、直覺的科技體驗。

Google 的 AI 革命:Gemini 如何改變照片、搜尋與娛樂體驗 閱讀全文 »

WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning

[論文] WebSailor-V2:透過合成資料與可擴展強化學習跨越專有代理的鴻溝

WebSailor-V2標誌著自主AI代理的重大躍進,縮小了開源與專有深度研究系統之間的差距。這個30B參數模型透過創新的資料生成和強化學習技術,在具挑戰性的基準測試中超越了更大型的對手。研究人員開發了SailorFog-QA-V2,一個建立在複雜知識圖譜上的資料集,並實施了雙環境訓練方法。該模型在BrowseComp和Humanity’s Last Exam上達到令人印象深刻的分數,與頂級專有代理匹敵。透過採用ReAct框架並專注於強大的基礎,WebSailor-V2證明了較小、高效的模型能夠匹配大型專有系統的能力。這項突破讓更多人能接觸到先進的AI研究工具,並為通用人工智慧的未來發展提供了範本。

[論文] WebSailor-V2:透過合成資料與可擴展強化學習跨越專有代理的鴻溝 閱讀全文 »

Windows AI Lab: Microsoft's Bold Next Step in AI Evolution and Multi-Model Strategy

Windows AI Lab:微軟在 AI 演進與多模型策略中的大膽下一步

微軟的 AI 策略正快速演進,Windows AI Lab 的推出標誌著朝向實驗性 AI 功能和直接使用者回饋的重大轉變。這項倡議補充了微軟超越 OpenAI 的擴展合作夥伴關係,包括將 Anthropic 的 Claude 模型整合到 Microsoft 365 Copilot 中。該公司正透過 AI 驅動的 Edge 增強功能重新構想瀏覽體驗,旨在提供更互動和高效的使用者體驗。這些發展正在重塑 Windows、生產力工具和企業解決方案,承諾提升無障礙性、簡化工作流程和增強安全性。微軟的多面向方法強化了其對競爭對手的地位,為 AI 無縫整合到運算各個方面的未來奠定了基礎。

Windows AI Lab:微軟在 AI 演進與多模型策略中的大膽下一步 閱讀全文 »

Scaling Agents via Continual Pre-training

[論文] 透過持續預訓練擴展 AI 代理能力

阿里巴巴通義實驗室開發的突破性 AI 代理 AgentFounder,引入了代理持續預訓練(Agentic CPT)來革新 AI 代理開發。這種新穎的三階段方法加入了專注於代理行為的中間訓練階段,解決了目前兩階段模型的限制。透過使用一階動作合成和高階動作合成等創新資料合成方法,AgentFounder-30B 在多個基準測試中達到最先進效能,超越現有開源模型和一些專有系統。這項研究證明了代理能力的對數擴展模式和改進的微調效率。這項工作為更有能力的通用 AI 代理鋪平了道路,這些代理能夠自主導航複雜資訊環境並解決多步驟問題。

[論文] 透過持續預訓練擴展 AI 代理能力 閱讀全文 »

GenExam: A Multidisciplinary Text-to-Image Exam - A New Benchmark for Testing AI's Ability to Draw Like an Expert

[論文] GenExam:跨領域文字轉影像考試 – 測試 AI 專家級繪圖能力的全新基準

GenExam 是一個突破性基準,挑戰 AI 模型處理跨領域文字轉影像考試,推動人工通用智慧的邊界。涵蓋 10 個學術科目,測試 AI 繪製需要深度學科知識的複雜圖表能力。當前最先進的模型,包括先進的商業模型,在這項任務上表現困難,嚴格評分低於 15%。該基準揭露了現今 AI 系統的重大限制,突顯了閉源和開源模型之間的差距。GenExam 的全面評估框架測量語義正確性和視覺合理性,提供嚴格和寬鬆評分。隨著 AI 朝向更通用能力發展,GenExam 提供關鍵指標,提高期望並為跨領域 AI 影像生成的未來發展提供路線圖。

[論文] GenExam:跨領域文字轉影像考試 – 測試 AI 專家級繪圖能力的全新基準 閱讀全文 »