OpenAI新API語音模型將改變你使用AI的方式
OpenAI釋出了三個新的即時語音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在讓開發者構建能夠即時聽、推理、翻譯、轉錄和執行操作的語音應用。這些模型支援更自然的對話、處理中斷和糾正、128K上下文視窗、70+種語言的即時翻譯等特性,適用於客戶支援、會議翻譯、即時字幕、旅行助手、醫療和職場助理等場景。
OpenAI近日釋出了三款全新的即時語音模型——GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在透過API幫助開發者打造能夠即時傾聽、思考、翻譯、轉錄和執行操作的語音應用。這些模型標誌著語音AI從簡單的指令響應向自然、連續的對話邁出了重要一步。
傳統語音AI通常需要分步處理:先錄製音訊,將語音轉為文本,再由另一模型生成回覆,最後將文本轉回語音。這種流水線方式延遲明顯,對話體驗不夠自然。而OpenAI的新模型專為即時設計,能夠在使用者說話的同時理解並回應,使人機對話更像是與真人助理交流。
GPT-Realtime-2是核心對話模型,適用於需要自然對話、理解上下文、處理打斷和即時採取行動的語音代理。例如,基於該模型構建的客服系統可以在通話中理解使用者問題、追問細節、查詢訂單資訊並即時反饋。該模型還支援更強的糾錯能力和中斷恢復,上下文視窗從之前的32K擴充套件至128K,能夠處理更長時間、更復雜的對話。開發者還可以控制模型的語調和推理強度,使其在支援場景中保持冷靜,在使用者沮喪時展現同理心。
GPT-Realtime-Translate專注於即時語音翻譯,支援70種以上輸入語言,並可輸出13種目標語言。OpenAI的演示顯示,該模型能夠在說話者講話的同時進行翻譯,速度幾乎同步。這對跨國會議、旅行交流、多語種客服、教育平臺和現場活動具有革命性意義。其定價為每分鐘0.034美元。
GPT-Realtime-Whisper則專為即時轉錄設計,能在人說話的同時將語音轉為文字,特別適合直播字幕、會議記錄、課堂筆記和採訪轉錄。該模型每分鐘收費0.017美元。
這三個模型現已透過OpenAI的Realtime API提供,開發者也可以在Playground中先行測試。GPT-Realtime-2的定價為:每百萬音訊輸入tokens 32美元,快取輸入tokens 0.40美元,輸出tokens 64美元。
在應用場景上,這些模型不僅限於客服和翻譯。企業可以構建內部語音助理幫助員工查詢檔案、總結會議、建立任務列表;醫療機構可用於預約掛號、患者初篩;旅遊應用可透過自然語音對話完成航班搜尋和酒店比價。
儘管前景廣闊,OpenAI也指出開發者需要在敏感領域(如醫療、金融和法律)設定強護欄、明確使用者告知、保障隱私並保留人工稽核。但總體而言,即時語音模型正從被動響應走向主動協助,而OpenAI正站在這一變革的前沿。