OpenAI宣佈推出了一個全新的AI評測基準——PaperBench,旨在評估AI智能體是否能夠重現前沿AI研究的實驗結果。這個基準要求AI智能體從零開始複製20篇於2024年國際機器學習大會(ICML)上發表的頂級論文,包括理解論文核心貢獻、開發代碼庫以及成功執行相關實驗等。PaperBench的推出不僅對AI智能體的評估提供了新的標準,也為AI技術的發展提供了新的挑戰和機會。
PaperBench是一個基於AI智能體複製前沿AI研究能力的評測基準。這個基準選取了ICML 2024會議上的20篇Spotlight和Oral論文,涵蓋了深度強化學習、健壯性和概率方法等多個研究主題。每篇論文都配備了詳細的評分標準,共計8,316個可獨立評估的子任務,以確保評估的準確性和公正性。
複製前沿研究:PaperBench要求AI智能體從零開始複製頂級論文的實驗結果,包括理解論文核心貢獻、開發代碼庫以及成功執行相關實驗。這項挑戰不僅考驗AI的理解能力,也考驗其實際應用能力。
層級化評分標準:每篇論文的評分標準都以樹狀結構設計,將每個任務分解為多個可獨立評估的子任務。這使得評估過程更為細緻和客觀。
與原作者合作:PaperBench的評分標準是與每篇論文的原作者共同制定的,確保評估的準確性和實用性。
自動評判系統:OpenAI開發了一個基於大型語言模型的自動評判系統,能夠對AI智能體的複製嘗試進行評分,減少人工評估的時間和成本。
在初步測試中,多個知名大模型被評估,結果顯示即使是最先進的模型也未能完全超越人類基準線。Claude 3.5 Sonnet(新版本)在測試中取得了最高分數,平均複現得分為21.0%。其他模型的表現則不佳,大多數得分低於10%。這些結果表明,當前AI智能體在長期任務執行和實際應用方面仍存在不足。
PaperBench的推出對AI技術的發展具有重要意義。它不僅為AI智能體提供了一個新的評估標準,也為未來AI模型的設計和優化提供了方向。通過PaperBench,研究人員可以更好地了解AI智能體的能力和局限性,從而推動AI技術的進一步發展。
OpenAI的PaperBench基準標誌著AI評估的新里程碑。透過這個基準,AI智能體的能力將被更全面地評估,推動AI技術朝著更實用和高效的方向發展。未來,隨著AI技術的不斷進步,PaperBench這類基準將在推動AI創新和應用中發揮重要作用。