AI工具有那些? @ 香港AI工具平台
METR 研究:AI Agents 能獨立完成的任務長度,大約每 7 個月就會翻倍一次:人工智慧研究機構 METR(Model Evaluation and Testing Research)最新研究揭示一項關鍵趨勢:AI 代理(Agents)能獨立完成的任務時長,自 2018 年以來平均每 7 個月翻倍一次。這項以「任務長度」為核心的評估框架,為理解 AI 自主能力提供突破性視角,預示著未來五年內 AI 可能接管人類需耗時數週的複雜專案。


環球AI能力評測基準認證考試 ACE, AI證照 @ ExtranAI
AI資訊

METR 研究:AI Agents 能獨立完成的任務長度,大約每 7 個月就會翻倍一次

人工智慧研究機構 METR(Model Evaluation and Testing Research)最新研究揭示一項關鍵趨勢:AI 代理(Agents)能獨立完成的任務時長,自 2018 年以來平均每 7 個月翻倍一次。這項以「任務長度」為核心的評估框架,為理解 AI 自主能力提供突破性視角,預示著未來五年內 AI 可能接管人類需耗時數週的複雜專案。

研究背景:從學術測試到真實世界指標

傳統 AI 能力評估多聚焦於特定領域的基準測試(如語言理解、圖像識別),但 METR 提出全新指標——以人類專業人員耗時為單位的任務長度。研究團隊發現,AI 在短任務(4 分鐘內)成功率接近 100%,但隨著任務時長增加至 4 小時以上,成功率驟降至 10% 以下。

此現象催生出「50% 可靠完成閾值」概念:當 AI 能以 50% 成功率處理某時長任務時,即標誌其具備對應層級的自主能力。透過對數十年歷史數據的擬合,研究顯示該閾值呈現穩定指數成長曲線。

關鍵發現:指數增長曲線的實證

  1. 7 個月倍增定律

    • 2018 年頂尖 AI 僅能處理人類專家 5 分鐘內的任務

    • 2025 年最新模型(如 Claude 3.7 Sonnet)已可處理 1 小時級任務

    • 若趨勢持續,預計 2028-2029 年將突破「月級」任務處理能力

  2. 跨數據集驗證

    • SWE-Bench Verified:基於真實軟體工程任務的數據集顯示更快的 3 個月倍增週期

    • HCAST 多領域任務組:涵蓋客服、研究、行政等領域,均呈現相似趨勢

    • 即使考量 10 倍測量誤差,預測時間軸僅偏移約 2 年

技術影響:AI 研發的自動化加速

METR 開發的 RE-Bench 基準測試顯示,前沿 AI 在機器學習工程任務上已展現驚人潛力:

  • GPU 核心優化:AI 代理可將運算加速效果提升 15 倍

  • 研究工程任務:在 2 小時限制下,AI 表現超越人類工程師;8 小時條件下仍具競爭力

  • 自動化風險:當 AI 能自主執行 AI 研發時,技術迭代速度可能失控

社會衝擊:勞動力市場的重構

  1. 產業轉型時間表

    • 2026-2027:周級軟體開發、市場分析報告生成自動化

    • 2028-2030:月級專案管理、跨部門協作流程由 AI 主導

    • 行政支援、基礎研究、客戶服務等領域首當其衝

  2. 政策挑戰

    • 現有勞動法規缺乏 AI 代理責任歸屬框架

    • 需建立「能力閾值監測系統」預警關鍵產業轉折點

    • 企業需重新設計「人機協作」工作流程

研究爭議與限制

儘管趨勢顯著,METR 強調需注意:

  • 任務選擇偏差:測試集中軟體工程任務比例較高

  • 人類基準變異:不同專業人員耗時差異影響閾值計算

  • 現實複雜性:實驗室環境未能完全模擬組織政治、模糊需求等真實挑戰

未來展望:能力監測的新範式

METR 正與 Google DeepMind、Anthropic 等企業合作,將此框架整合至 AI 風險管理系統。其開源評估平台 Vivaria 已成為多國 AI 安全研究所的基礎設施,目標在 2026 年前建立全球統一的「自主能力分級制度」。

這項研究不僅是技術預測,更是對社會適應力的考驗。當 AI 開始以「月」為單位規劃執行,人類需重新定義自身在決策鏈中的角色——是監督者、協作者,還是逐步退場的參與者?答案或許將決定下個世代的經濟型態。