人工智慧研究機構 METR(Model Evaluation and Testing Research)最新研究揭示一項關鍵趨勢:AI 代理(Agents)能獨立完成的任務時長,自 2018 年以來平均每 7 個月翻倍一次。這項以「任務長度」為核心的評估框架,為理解 AI 自主能力提供突破性視角,預示著未來五年內 AI 可能接管人類需耗時數週的複雜專案。
傳統 AI 能力評估多聚焦於特定領域的基準測試(如語言理解、圖像識別),但 METR 提出全新指標——以人類專業人員耗時為單位的任務長度。研究團隊發現,AI 在短任務(4 分鐘內)成功率接近 100%,但隨著任務時長增加至 4 小時以上,成功率驟降至 10% 以下。
此現象催生出「50% 可靠完成閾值」概念:當 AI 能以 50% 成功率處理某時長任務時,即標誌其具備對應層級的自主能力。透過對數十年歷史數據的擬合,研究顯示該閾值呈現穩定指數成長曲線。
7 個月倍增定律
2018 年頂尖 AI 僅能處理人類專家 5 分鐘內的任務
2025 年最新模型(如 Claude 3.7 Sonnet)已可處理 1 小時級任務
若趨勢持續,預計 2028-2029 年將突破「月級」任務處理能力
跨數據集驗證
SWE-Bench Verified:基於真實軟體工程任務的數據集顯示更快的 3 個月倍增週期
HCAST 多領域任務組:涵蓋客服、研究、行政等領域,均呈現相似趨勢
即使考量 10 倍測量誤差,預測時間軸僅偏移約 2 年
METR 開發的 RE-Bench 基準測試顯示,前沿 AI 在機器學習工程任務上已展現驚人潛力:
GPU 核心優化:AI 代理可將運算加速效果提升 15 倍
研究工程任務:在 2 小時限制下,AI 表現超越人類工程師;8 小時條件下仍具競爭力
自動化風險:當 AI 能自主執行 AI 研發時,技術迭代速度可能失控
產業轉型時間表
2026-2027:周級軟體開發、市場分析報告生成自動化
2028-2030:月級專案管理、跨部門協作流程由 AI 主導
行政支援、基礎研究、客戶服務等領域首當其衝
政策挑戰
現有勞動法規缺乏 AI 代理責任歸屬框架
需建立「能力閾值監測系統」預警關鍵產業轉折點
企業需重新設計「人機協作」工作流程
儘管趨勢顯著,METR 強調需注意:
任務選擇偏差:測試集中軟體工程任務比例較高
人類基準變異:不同專業人員耗時差異影響閾值計算
現實複雜性:實驗室環境未能完全模擬組織政治、模糊需求等真實挑戰
METR 正與 Google DeepMind、Anthropic 等企業合作,將此框架整合至 AI 風險管理系統。其開源評估平台 Vivaria 已成為多國 AI 安全研究所的基礎設施,目標在 2026 年前建立全球統一的「自主能力分級制度」。
這項研究不僅是技術預測,更是對社會適應力的考驗。當 AI 開始以「月」為單位規劃執行,人類需重新定義自身在決策鏈中的角色——是監督者、協作者,還是逐步退場的參與者?答案或許將決定下個世代的經濟型態。