Open AI 發佈兩款新模型:GPT-transcribe 和 GPT-live-transcribe
Open AI 推出了 GPT-transcribe 和 GPT-live-transcribe 兩款新模型,專注於語音轉文字任務。GPT-transcribe 已正式發佈,支持文件和實時轉錄,定價為每分鐘 0.0045 美元。模型支持非結構化上下文、關鍵詞提示和多語言提示,可用於多種端點和流式輸出,但不支持函數調用和微調。
Open AI 近日宣佈推出兩款全新的語音轉文字模型:GPT-transcribe 和 GPT-live-transcribe。目前,GPT-transcribe 已正式向開發者開放,而 GPT-live-transcribe 的詳細信息尚未完全公開,預計將在後續發佈。這兩款模型旨在為開發者提供高精度的語音識別能力,適用於多種場景。
GPT-transcribe 被描述為一種高精度的語音轉文字模型,能夠處理已完成的音頻文件轉錄、流式文件轉錄以及通過 WebSocket 實時會話中的連續交互。它支持非結構化上下文(unstructured context),這意味着開發者可以自由提供額外的上下文信息,幫助模型更好地理解特定領域的術語或對話背景。此外,模型還支持關鍵詞提示(keyword hints)和多語言提示(language hints),這對於多語言音頻、代碼切換(code-switching)以及包含專業術語的場景尤為有用,能顯著提升轉錄的準確性。
在定價方面,GPT-transcribe 採用基於使用時長的計費方式,按每分鐘音頻收費,價格為每分鐘 0.0045 美元。需要注意的是,對於其他工具特定模型(如搜索和計算機使用),每次工具調用會產生額外費用,但 GPT-transcribe 本身不涉及工具調用。定價模式透明,開發者可以便捷地預估成本。
在輸入輸出模態方面,GPT-transcribe 支持音頻和文本作為輸入,輸出僅為文本。圖像和視頻輸入不被支持,音頻也只能作為輸入,不能作為輸出。這意味着模型專注於從語音到文字的轉換,不涉及其他多模態功能。
Open AI 提供了豐富的端點(endpoints)供開發者集成,包括 Chat Completions(v1/chat/completions)、Responses(v1/responses)、Realtime(v1/realtime)、實時翻譯(v1/realtime/translations)、實時轉錄(v1/realtime/transcription_sessions)、Assistants(v1/assistants)、Batch(v1/batch)等。這些端點覆蓋了從批量處理到實時交互的多種需求。此外,模型支持流式輸出(streaming),這對於需要低延遲的實時應用非常有價值。但值得注意的是,GPT-transcribe 不支持函數調用(function calling)、結構化輸出(structured outputs)、微調(fine-tuning)和預測輸出(predicted outputs),這限制了其在需要這些高級功能的場景下的使用。
為了保持模型的穩定性和一致性,Open AI 提供了快照(snapshots)功能。開發者可以鎖定特定版本的模型,確保性能和行為不會因模型更新而變化。目前,GPT-transcribe 有一個名為“gpt-transcribe”的快照可供使用。
隨着 GPT-transcribe 的發佈,Open AI 進一步擴展了其在語音識別領域的產品線,為開發者提供了一個高精度且經濟實惠的轉錄解決方案。對於需要處理多語言音頻或專業術語的應用,GPT-transcribe 的上下文和提示功能將帶來顯著優勢。未來,GPT-live-transcribe 的推出有望進一步豐富實時語音交互的能力。