AI工具有那些? @ 香港AI工具平台
Anthropic 推出 Think 工具,讓 Claude 在處理複雜任務時能先停下來思考:人工智能公司 Anthropic 近期推出了一項名為


環球AI能力評測基準認證考試 ACE, AI證照 @ ExtranAI
AI資訊

Anthropic 推出 Think 工具,讓 Claude 在處理複雜任務時能先停下來思考

Anthropic 推出 Think 工具,讓 Claude 在處理複雜任務時能先停下來思考

人工智能公司 Anthropic 近期推出了一項名為 "Think" 的創新工具,旨在大幅提升 Claude 在處理複雜任務時的問題解決能力。這項工具賦予 Claude 一個獨立的思考空間,使其在執行任務過程中,能夠有意識地停下來,審視自身是否掌握足夠的資訊,從而做出更明智的決策。

1. Think 工具的設計理念

"Think" 工具的核心概念是讓 AI 在複雜情境下,能夠進行結構化的「停頓與反思」。不同於以往的 AI 模型,Claude 現在能夠在執行任務的過程中,主動評估自身是否需要更多資訊,或者是否需要重新審視當前的策略。這種能力對於需要多步驟、多工具協作的任務尤其重要。

2. Think 工具與延伸思考的區別

Anthropic 先前已推出「延伸思考」功能,但 "Think" 工具與其有所不同。「延伸思考」是指 Claude 在產生回應「前」的深思熟慮;而 "Think" 工具則是在產生回應「過程」中,停下來思考是否掌握足夠資訊的工具。簡單來說,「延伸思考」是事前準備,而 "Think" 工具則是臨場應變。

3. Think 工具的運作方式

"Think" 工具的實作非常簡單,只需透過提示詞和工具呼叫即可完成。以下是一個 "Think" 工具的撰寫範例:

json:

{
"name": "think",
"description": "使用此工具來思考某件事。它不會獲取新資訊或對儲存庫進行任何更改,只會記錄想法。在需要複雜推理或腦力激盪時使用。例如,如果您探索了儲存庫並發現了錯誤的根源,請調用此工具來集思廣益幾種獨特的修復錯誤的方法,並評估哪些更改可能最簡單、最有效。或者,如果您收到一些測試結果,請調用此工具來集思廣益修復失敗測試的方法。",
"input_schema": {
"type": "object",
"properties": {
"thought": {
"type": "string",
"description": "Your thoughts."
}
},
"required": ["thought"]
}
}

 

當 Claude 遇到需要複雜推理或腦力激盪的情境時,便會調用 "Think" 工具,記錄下其思考過程,並據此調整策略。

4. 實際應用效果

為了驗證 "Think" 工具的有效性,Anthropic 在 τ-Bench 測試(模擬客服情境)和 SWE-Bench(軟體工程)測試中進行了實驗。

客服情境

  • 航空客服:搭配優化提示,Claude 3.7 Sonnet 的成功率提升 54%!

  • 零售客服:即使沒有額外提示,成功率也明顯提升。

軟體工程

加入類似的 "Think" 工具,也讓 Claude 3.7 Sonnet 在 SWE-Bench 測試中獲得了頂尖成績。

5. 何時該使用 Think 工具?

根據實驗結果,"Think" 工具在以下情境下表現最佳:

  • 工具輸出分析:當 Claude 需要仔細處理工具調用的結果,確保其合理性。

  • 策略密集型環境:當 AI 需要嚴格遵循某些規則,例如法律合規性、企業規定等。

  • 順序決策任務:當任務需要多個步驟,每一步都依賴於之前的操作時(如程式碼除錯、複雜客戶服務問題)。

相對地,"Think" 工具不適用於簡單的任務或非順序性的工具呼叫。

6. 最佳實作建議

  1. 搭配情境範例提示:提供明確指示與範例,效果更佳。

  2. 複雜指引放系統提示:長篇或複雜的指示放在系統提示中,效果更好。

結論

Anthropic 推出的 "Think" 工具,為 AI 的問題解決能力帶來了革命性的進展。透過賦予 AI 獨立思考的空間,使其在處理複雜任務時能夠更加可靠和聰明。隨著 "Think" 工具的普及,我們有理由期待 AI 在客戶服務、程式設計等領域,能夠展現出更卓越的表現。