Webwright 是微軟研究院推出的一個終端原生網頁智能體框架,它不再走傳統「截圖看畫面、再點擊操作」的路線,而是讓 AI 直接在終端裡寫 Playwright 程式碼、執行 bash 命令、讀取日誌,透過程式化方式完成網頁任務。
簡單說,Webwright 不是把瀏覽器當成一個只能「手動點」的介面,而是把它當成一個可以被程式控制的執行端點。
這代表 AI 不只是臨時模仿人類操作,而是把任務轉成可重複、可除錯、可維護的腳本流程。
這個思路很像開發者做自動化測試或 RPA,只是 Webwright 讓大模型自己負責產生、修正與執行腳本。
因此,它的核心價值不在「模仿點擊」,而在「把網頁任務程式化」。
Webwright 主要由三個部分組成:Runner、Model Endpoint 和終端環境(Environment)。
Runner 負責代理迴圈與任務管理,Model Endpoint 負責連接不同模型後端,終端環境則提供執行 Playwright 與 bash 指令的空間。
它的架構刻意做得很簡潔,整體約 1000 行程式碼,沒有複雜的多智能體編排。
這種做法反映出一個明確判斷:對網頁任務來說,與其堆疊大量抽象層,不如讓模型直接產生可執行程式。
傳統網頁智能體多半依賴「看截圖或 DOM 狀態,然後預測下一步要點哪裡、輸入什麼、怎麼滾動」。
這種模式直觀,但在長流程任務中常會遇到狀態維持困難、步驟脆弱、除錯不易等問題。
Webwright 改成讓模型直接寫 Playwright 程式,這樣每一步都能留下明確代碼與執行結果。
好處是,流程更容易重跑,也更容易在失敗後定位問題並修正,像是「寫—跑—報錯—改寫」的工程迴圈。
Webwright 最大的意義,是把 AI 網頁操作從「互動式控制」推向「可程式化控制」。
對開發者來說,這不只是效率提升,而是工作成果可以沉澱成腳本、模組和可維護資產。
它也特別適合複雜任務,例如跨頁面跳轉、表單填寫、條件判斷、重試機制,這些任務用程式邏輯表達會比單純點擊序列更穩定。
所以 Webwright 不只是「更聰明的瀏覽器操作」,而是更接近「AI 協助寫自動化工具」。
公開資料顯示,Webwright 在多個基準上表現亮眼。
在 Online-Mind2Web 測試中,由 GPT-5.4 驅動的版本可達 86.67%;在 Odysseys 基準中則達到 60.1%。
另一個值得注意的點是成本與模型彈性。
資料指出,它支援 OpenAI、Anthropic 等後端,也能透過 CLI 執行任務,甚至搭配較小模型與工具腳本運作。
如果你是開發者、AI 工程師或自動化工作流程設計者,Webwright 的吸引力會特別高。
因為它不是一個單純的「聊天式助手」,而是一個能把任務落成腳本、反覆修正並交付成果的框架。
對內容製作、SEO、營運自動化或測試流程來說,它也有很強的想像空間。
尤其是那些需要長鏈路操作、且希望結果可追蹤可重現的場景,Webwright 的優勢會更加明顯。
Webwright 代表了一個值得注意的趨勢:AI 智能體正從「看畫面做動作」,走向「以程式描述行為」。
這種轉向意味著,未來的瀏覽器智能體可能不再只是模仿人類,而是像工程師一樣產生可維護的工作流程。
換句話說,Webwright 的重點不只是能不能點對按鈕,而是能不能把一次任務變成可重用的程式資產。
這也是它被視為網頁智能體新方向的重要原因。