AI News HubLIVE
站內改寫2 分鐘閱讀

OpenAI新API語音模型將改變你使用AI的方式

OpenAI發佈了三個新的實時語音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在讓開發者構建能夠實時聽、推理、翻譯、轉錄和執行操作的語音應用。這些模型支持更自然的對話、處理中斷和糾正、128K上下文窗口、70+種語言的實時翻譯等特性,適用於客户支持、會議翻譯、實時字幕、旅行助手、醫療和職場助理等場景。

來源Analytics Vidhya作者: Sarthak Dogra

OpenAI近日發佈了三款全新的實時語音模型——GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在通過API幫助開發者打造能夠實時傾聽、思考、翻譯、轉錄和執行操作的語音應用。這些模型標誌着語音AI從簡單的指令響應向自然、連續的對話邁出了重要一步。

傳統語音AI通常需要分步處理:先錄製音頻,將語音轉為文本,再由另一模型生成回覆,最後將文本轉回語音。這種流水線方式延遲明顯,對話體驗不夠自然。而OpenAI的新模型專為實時設計,能夠在用户説話的同時理解並回應,使人機對話更像是與真人助理交流。

GPT-Realtime-2是核心對話模型,適用於需要自然對話、理解上下文、處理打斷和實時採取行動的語音代理。例如,基於該模型構建的客服系統可以在通話中理解用户問題、追問細節、查詢訂單信息並即時反饋。該模型還支持更強的糾錯能力和中斷恢復,上下文窗口從之前的32K擴展至128K,能夠處理更長時間、更復雜的對話。開發者還可以控制模型的語調和推理強度,使其在支持場景中保持冷靜,在用户沮喪時展現同理心。

GPT-Realtime-Translate專注於實時語音翻譯,支持70種以上輸入語言,並可輸出13種目標語言。OpenAI的演示顯示,該模型能夠在説話者講話的同時進行翻譯,速度幾乎同步。這對跨國會議、旅行交流、多語種客服、教育平台和現場活動具有革命性意義。其定價為每分鐘0.034美元。

GPT-Realtime-Whisper則專為實時轉錄設計,能在人説話的同時將語音轉為文字,特別適合直播字幕、會議記錄、課堂筆記和採訪轉錄。該模型每分鐘收費0.017美元。

這三個模型現已通過OpenAI的Realtime API提供,開發者也可以在Playground中先行測試。GPT-Realtime-2的定價為:每百萬音頻輸入tokens 32美元,緩存輸入tokens 0.40美元,輸出tokens 64美元。

在應用場景上,這些模型不僅限於客服和翻譯。企業可以構建內部語音助理幫助員工查找文件、總結會議、創建任務列表;醫療機構可用於預約掛號、患者初篩;旅遊應用可通過自然語音對話完成航班搜索和酒店比價。

儘管前景廣闊,OpenAI也指出開發者需要在敏感領域(如醫療、金融和法律)設置強護欄、明確用户告知、保障隱私並保留人工審核。但總體而言,實時語音模型正從被動響應走向主動協助,而OpenAI正站在這一變革的前沿。