AI工具有那些? @ 香港AI工具平台
OpenAI 推出 3 款最新 AI 語音模型:OpenAI 於 2025 年 3 月 20 日凌晨發布了三款全新的語音模型,旨在提升語音轉文字(STT)和文字轉語音(TTS)的能力。這些模型包括 gpt-4o-transcribe、gpt-4o-mini-transcribe 和 gpt-4o-mini-tts,為開發者提供了更強大、更具個性化的語音智能體工具。


環球AI能力評測基準認證考試 ACE, AI證照 @ ExtranAI
AI資訊

OpenAI 推出 3 款最新 AI 語音模型

OpenAI 推出 3 款最新 AI 語音模型

OpenAI 於 2025 年 3 月 20 日凌晨發布了三款全新的語音模型,旨在提升語音轉文字(STT)和文字轉語音(TTS)的能力。這些模型包括 gpt-4o-transcribe、gpt-4o-mini-transcribe 和 gpt-4o-mini-tts,為開發者提供了更強大、更具個性化的語音智能體工具。

1. 全新語音模型

  • gpt-4o-transcribe 和 gpt-4o-mini-transcribe: 這兩款模型取代了先前的 Whisper 系統,在語音轉文字方面有顯著提升,能夠更準確地捕捉不同口音和語速。它們支援超過 100 種語言,透過強化學習和多樣化高品質音訊數據集進行訓練,即使在嘈雜環境中也能更好地捕捉細微的語音特徵,減少誤識別。與 Whisper 模型相比,新模型在多種語言中實現了更低的詞錯誤率(WER)。

  • gpt-4o-mini-tts: 這款模型是新一代的文字轉語音模型,能夠生成更自然、更細膩的語音。開發者可以通過指令控制語氣與風格,例如模擬耐心客服或生動故事敘述。這使得語音生成更加多樣化和可控,讓 AI 智能體能夠提供更具溫度和表現力的交流。

2. 技術優勢

OpenAI 這次語音模型的提升主要來自於數個重要改進:

  • 特化預訓練: OpenAI 採用了針對語音資料的特化預訓練,使模型能夠更精確地學習語音中的細微變化與語境關係。

  • 模型蒸餾技術: 較小的模型 gpt-4o-mini-transcribe 和 gpt-4o-mini-tts 得以從更大型的模型學習語音轉錄與語音合成的能力,確保運算效率與準確率。

  • 強化學習機制: 語音轉文字模型採用強化學習機制,以進一步降低轉錄錯誤與語音錯誤辨識的發生率,特別是在低資源語言與非標準語音的處理穩定有所提升。

3. 應用場景

這些新模型在多個領域具有廣泛的應用前景:

  • 客戶服務: 合成更具同理心的語音,提升使用者體驗。

  • 會議記錄: 更準確地轉錄會議內容,方便後續整理和回顧。

  • 有聲書和遊戲角色: 為有聲書或遊戲角色設計個性化聲音。

  • AI 智能體: 讓 AI 智能體的語音表達更自然,交互方式更直觀。

4. 價格

OpenAI 也公布了這三款模型的價格:

  • gpt-4o-transcribe: 音訊輸入每 100 萬 tokens 費用 6 美元、文字輸入每 100 萬 tokens 費用 2.5 美元,輸出每 100 萬 tokens 費用 10 美元,每分鐘成本 0.6 美分。

  • gpt-4o-mini-transcribe: 音訊輸入每 100 萬 tokens 費用 3 美元、文字輸入每 100 萬 tokens 費用 1.25 美元,輸出每 100 萬 tokens 費用 5 美元,每分鐘成本 0.3 美分。

  • gpt-4o-mini-tts: 每 100 萬 tokens 輸入費用為 0.60 美元,每 100 萬 tokens 輸出費用為 12 美元,每分鐘成本 1.5 美分。

5. 對 AI 語音智能體的影響

OpenAI 的產品負責人 Olivier Godemont 表示,這些新模型是為了實現其「代理」(agentic)願景而設計的,意味著 AI 系統將能夠獨立地代表用戶完成各種任務。要讓 agent 真正發揮作用,交互方式必須更加直觀,超越純文本輸入,支持自然語音交流。

結論

OpenAI 推出的這三款全新語音模型,不僅提升了語音轉文字和文字轉語音的準確性和自然度,也為開發者提供了更多的自定義選擇。這些升級將推動人工智能語音技術的商業化應用,為各行各業帶來更多可能性。隨著語音交互變得更加自然和便捷,我們有理由期待一個更加智能、更加人性化的未來。