資料科學

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

[論文] VChain:影片生成推理的視覺思維鏈

VChain 是來自南洋理工大學和 Eyeline Labs 的突破性框架,彌合了影片生成與類人推理之間的差距。它利用 GPT-4o 的推理能力來增強影片擴散模型,無需大量重新訓練。這個三階段方法包括視覺思維推理、稀疏推理時調整和影片採樣。此方法顯著改善了生成影片中的物理推理、常識理解和因果關係。VChain 在推理時高效運作,無需外部資料集。它代表了將推理整合到生成模型中的範式轉變,展示了不同 AI 系統如何協同工作。這項進展對於在各種應用中創造邏輯一致且物理合理的影片具有深遠影響。

[論文] VChain:影片生成推理的視覺思維鏈 閱讀全文 »

The Revolutionary Impact of Machine Learning in Chemistry and Material Science: Accelerating Scientific Discovery

機器學習在化學與材料科學的革命性影響:加速科學發現

機器學習正在革新化學與材料科學的科學研究,讓研究人員能夠克服計算障礙並加速發現週期。這種強大的協同效應在分子設計、催化和材料工程方面特別明顯。計算化學機器學習勢能的最新進展正在改變科學家建模表面化學反應的方式,實現更快速的潛在催化劑材料篩選。在藥物研究中,結構導向藥物設計已得到顯著增強,使有前景治療化合物的識別更加高效。蛋白質結構預測透過稀疏去噪模型取得顯著改善,而深度強化學習正在加速材料科學中的晶體結構弛豫。這些創新正在推動從能源到交通運輸等多個領域的進步,承諾重塑科學探索和工業應用。

機器學習在化學與材料科學的革命性影響:加速科學發現 閱讀全文 »

OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

[論文] OmniWorld:用於 4D 世界建模的多領域多模態資料集

OmniWorld 是一個突破性的 4D 世界建模資料集,解決了視覺智慧系統中的關鍵資料限制問題。由上海人工智慧實驗室和浙江大學的研究人員開發,它結合了 OmniWorld-Game 資料集與來自各個領域的公開資料集。這個全面性的資源提供了前所未有的規模、多樣性和模態豐富性,在大小和模態覆蓋範圍上都超越了現有的合成資料集。

[論文] OmniWorld:用於 4D 世界建模的多領域多模態資料集 閱讀全文 »

Untitled Post

[論文] THOR:透過強化學習進行工具整合階層式最佳化的數學推理框架

THOR 是一個突破性的數學推理框架,透過階層式強化學習將外部工具與大型語言模型整合。它透過生成高品質資料、執行細粒度最佳化,以及利用即時回饋增強推論來解決工具整合推理中的關鍵挑戰。THOR 的創新組件包括用於資料生成的 TIRGen、雙重最佳化策略,以及推論期間的自我修正機制。在具挑戰性的數學基準測試評估中,THOR-Thinking-8B 在維持合理成本的同時超越了更大的模型。該框架的效益延伸到數學之外,在程式碼生成任務中也展現改善。THOR 代表了結合語意理解與精確執行的重大進展,有可能徹底改變 AI 處理需要創意和計算準確性的複雜推理任務的方法。

[論文] THOR:透過強化學習進行工具整合階層式最佳化的數學推理框架 閱讀全文 »

SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

[論文] SigLIP 2:具備改良語意理解、定位與密集特徵的多語言視覺語言編碼器

SigLIP 2 由 Google DeepMind 於 2025 年 2 月發布,標誌著視覺語言模型的重大躍進。這個新的多語言編碼器家族建立在 SigLIP 架構基礎上,融入創新技術來增強語意理解、定位和密集特徵提取。訓練配方結合了 sigmoid 損失、基於解碼器的預訓練,以及自蒸餾與遮罩預測。提供兩種變體:固定解析度和原生長寬比可變解析度。SigLIP 2 擁有改進的多語言能力,支援 109 種語言,並在零樣本分類、檢索、密集預測和定位任務上展現卓越效能。其多功能性使其適用於從視覺搜尋到自主系統的各種應用,而其開源特性讓更多人能夠使用尖端的視覺語言技術。

[論文] SigLIP 2:具備改良語意理解、定位與密集特徵的多語言視覺語言編碼器 閱讀全文 »

Untitled Post

[論文] ScaleCUA:透過跨平台數據擴展開源電腦使用代理

ScaleCUA 代表了電腦使用代理的突破性進展,解決了與 GUI 互動的 AI 系統訓練資料有限的挑戰。其創新的跨平台資料收集管道結合自動化代理和人類專家,從多個作業系統收集多樣化的互動資料。產生的模型在 GUI 理解、元素定位和任務完成基準測試中展現卓越效能。關鍵發現突顯了跨平台資料、統一動作空間和明確推理對增強代理能力的重要性。透過開源釋出他們的模型、資料集和方法論,研究人員為推進 AI 驅動電腦自動化領域提供了寶貴資源。

[論文] ScaleCUA:透過跨平台數據擴展開源電腦使用代理 閱讀全文 »

Understanding Evaluation Metrics for NLP: An Intuitive Guide to Measuring AI Performance

理解 NLP 評估指標:衡量 AI 效能的直觀指南

NLP 評估指標對於衡量模型效能至關重要,但理解它們可能具有挑戰性。本指南專注於在介紹公式之前建立直觀理解。我們探討為什麼僅憑準確率往往不足,使用仇恨言論檢測範例來說明語境的重要性。精確率和召回率被介紹為關鍵指標,解決模型是否捕捉到所有重要內容以及其預測是否可靠的問題。F1 分數平衡了這些考量,對不平衡資料集特別有用。對於翻譯和摘要等複雜任務,我們討論了 BLEU 和 ROUGE 等專門指標。我們也觸及了 BERTScore 等新方法以及人工評估的持續重要性。透過專注於核心問題和真實世界應用,實務工作者可以自信地駕馭 NLP 評估。

理解 NLP 評估指標:衡量 AI 效能的直觀指南 閱讀全文 »

7 Beginner-Friendly Machine Learning Projects You Can Complete This Weekend

7個新手友善的機器學習專案,這個週末就能完成

機器學習正在全面革新各行各業,而實際操作經驗對於掌握這項技術至關重要。本指南介紹了七個新手友善的專案,可以在週末完成,涵蓋機器學習的各個方面。從預測鐵達尼號生存率到識別手寫數字,這些專案提供了處理現實世界資料和常見演算法的實際經驗。
每個專案都介紹了不同的技術和領域,如分類、迴歸、自然語言處理和電腦視覺。通過完成這些專案,有志成為資料科學家和機器學習工程師的人可以建立全方位的技能組合,並獲得將機器學習應用於解決現實問題的信心。
這些專案使用公開可用的資料集,需要最少的設置,非常適合週末學習。記住,目標不是完美,而是理解過程並嘗試不同的方法。這些專案為在令人興奮的機器學習領域進一步探索提供了堅實的基礎。

7個新手友善的機器學習專案,這個週末就能完成 閱讀全文 »

Master the Bias-Variance Tradeoff: The Key to Successful Machine Learning Models

掌握偏差-變異權衡:成功機器學習模型的關鍵

偏差-變異權衡是機器學習中的基本挑戰,在系統性誤差(偏差)與模型敏感性(變異)之間取得平衡。這個概念指導模型開發和最佳化的關鍵決策。高偏差導致欠擬合,而高變異則導致過擬合。從業者可以透過學習曲線和表現指標來診斷這些問題。解決偏差的策略包括增加模型複雜性和特徵工程,而變異可以透過正規化和集成方法來減少。理解這種權衡對成功的 AI 實施至關重要,正如 MIT 研究顯示 95% 的 AI 專案未能帶來商業影響所證明的。掌握這個概念讓資料科學家能夠建構可靠、可泛化的模型,並駕馭現實世界機器學習應用的複雜性。

掌握偏差-變異權衡:成功機器學習模型的關鍵 閱讀全文 »

Excel's AI Revolution: How Microsoft's New COPILOT Function Is Transforming Spreadsheet Work

Excel 的 AI 革命:微軟全新 COPILOT 函數如何改變試算表工作模式

微軟的 Excel COPILOT 函數標誌著試算表技術的革命性轉變。運用 GPT-4.1-mini,它讓使用者能夠在熟悉的公式結構內使用自然語言提示與資料互動。這項 AI 驅動功能簡化了複雜任務,可能將分析時間減少 60%,並讓各種技能水準的使用者都能進行進階資料操作。
COPILOT 將純文字轉換為試算表操作,解決了 Excel 陡峭學習曲線的問題。它可以分類回饋、產生文字、總結資料,甚至協助構思。雖然功能強大,但有使用限制,且不建議用於關鍵計算。
目前提供給 Microsoft 365 Copilot 授權持有者使用,COPILOT 代表了生產力軟體的未來,工具會適應我們表達意圖的自然方式。隨著它的演進,可能會重新定義試算表能力以及誰能有效從資料中獲得價值。

Excel 的 AI 革命:微軟全新 COPILOT 函數如何改變試算表工作模式 閱讀全文 »