AI News HubLIVE
站內改寫2 分鐘閱讀

Open AI 釋出兩款新模型:GPT-transcribe 和 GPT-live-transcribe

Open AI 推出了 GPT-transcribe 和 GPT-live-transcribe 兩款新模型,專注於語音轉文字任務。GPT-transcribe 已正式釋出,支援檔案和即時轉錄,定價為每分鐘 0.0045 美元。模型支援非結構化上下文、關鍵詞提示和多語言提示,可用於多種端點和流式輸出,但不支援函式呼叫和微調。

來源Hacker News AI作者: rochansinha

Open AI 近日宣佈推出兩款全新的語音轉文字模型:GPT-transcribe 和 GPT-live-transcribe。目前,GPT-transcribe 已正式向開發者開放,而 GPT-live-transcribe 的詳細資訊尚未完全公開,預計將在後續釋出。這兩款模型旨在為開發者提供高精度的語音識別能力,適用於多種場景。

GPT-transcribe 被描述為一種高精度的語音轉文字模型,能夠處理已完成的音訊檔案轉錄、流式檔案轉錄以及透過 WebSocket 即時會話中的連續互動。它支援非結構化上下文(unstructured context),這意味著開發者可以自由提供額外的上下文資訊,幫助模型更好地理解特定領域的術語或對話背景。此外,模型還支援關鍵詞提示(keyword hints)和多語言提示(language hints),這對於多語言音訊、程式碼切換(code-switching)以及包含專業術語的場景尤為有用,能顯著提升轉錄的準確性。

在定價方面,GPT-transcribe 採用基於使用時長的計費方式,按每分鐘音訊收費,價格為每分鐘 0.0045 美元。需要注意的是,對於其他工具特定模型(如搜尋和計算機使用),每次工具呼叫會產生額外費用,但 GPT-transcribe 本身不涉及工具呼叫。定價模式透明,開發者可以便捷地預估成本。

在輸入輸出模態方面,GPT-transcribe 支援音訊和文本作為輸入,輸出僅為文本。影像和影片輸入不被支援,音訊也只能作為輸入,不能作為輸出。這意味著模型專注於從語音到文字的轉換,不涉及其他多模態功能。

Open AI 提供了豐富的端點(endpoints)供開發者整合,包括 Chat Completions(v1/chat/completions)、Responses(v1/responses)、Realtime(v1/realtime)、即時翻譯(v1/realtime/translations)、即時轉錄(v1/realtime/transcription_sessions)、Assistants(v1/assistants)、Batch(v1/batch)等。這些端點覆蓋了從批次處理到即時互動的多種需求。此外,模型支援流式輸出(streaming),這對於需要低延遲的即時應用非常有價值。但值得注意的是,GPT-transcribe 不支援函式呼叫(function calling)、結構化輸出(structured outputs)、微調(fine-tuning)和預測輸出(predicted outputs),這限制了其在需要這些高階功能的場景下的使用。

為了保持模型的穩定性和一致性,Open AI 提供了快照(snapshots)功能。開發者可以鎖定特定版本的模型,確保效能和行為不會因模型更新而變化。目前,GPT-transcribe 有一個名為“gpt-transcribe”的快照可供使用。

隨著 GPT-transcribe 的釋出,Open AI 進一步擴充套件了其在語音識別領域的產品線,為開發者提供了一個高精度且經濟實惠的轉錄解決方案。對於需要處理多語言音訊或專業術語的應用,GPT-transcribe 的上下文和提示功能將帶來顯著優勢。未來,GPT-live-transcribe 的推出有望進一步豐富即時語音互動的能力。