AI News HubLIVE
サイト内リライト2 分で読了

Open AI、2つの新モデル「GPT-transcribe」と「GPT-live-transcribe」を発表

Open AIは、音声認識モデルであるGPT-transcribeとGPT-live-transcribeを発表しました。GPT-transcribeは既に利用可能で、ファイル文字起こしとリアルタイム文字起こしに対応し、価格は1分あたり0.0045ドルです。音声とテキストの入力を受け付け、テキストを出力します。非構造化コンテキスト、キーワードヒント、言語ヒントをサポートし、専門用語や多言語音声の認識精度を向上させます。

ソースHacker News AI著者: rochansinha

Open AIは、2つの新しい音声認識モデル「GPT-transcribe」と「GPT-live-transcribe」を発表しました。現在、GPT-transcribeが正式にリリースされており、GPT-live-transcribeの詳細はまだ完全には公開されていません。

GPT-transcribeは、ファイルベースの音声認識、ストリーミングファイルの文字起こし、WebSocketを介したリアルタイムセッションでの連続的なやり取りに対応する高精度な音声認識モデルです。このモデルは、非構造化コンテキスト、キーワードヒント、複数言語ヒントをサポートしており、専門用語、多言語音声、コードスイッチングの認識精度を向上させることができます。

価格設定は使用量ベースで、音声時間1分あたり0.0045ドルです。また、検索やコンピュータ使用などのツール固有モデルに対しては、ツール呼び出しごとに追加料金が発生しますが、GPT-transcribe自体はツール呼び出しを必要としません。

入力および出力のモダリティに関して、GPT-transcribeは音声とテキストの入力を受け付け、テキストのみを出力します。画像や動画の入力はサポートされておらず、音声は入力のみ可能で出力はテキストに限定されます。

Open AIは、Chat Completions(v1/chat/completions)、Responses(v1/responses)、Realtime(v1/realtime)、リアルタイム翻訳(v1/realtime/translations)、リアルタイム文字起こし(v1/realtime/transcription_sessions)、Assistants(v1/assistants)、Batch(v1/batch)など、さまざまなエンドポイントを提供しています。ストリーミング出力に対応していますが、関数呼び出し、構造化出力、ファインチューニング、予測出力はサポートしていません。

モデルの安定性を保つため、スナップショット機能が用意されています。開発者は特定のバージョンのモデルを固定し、パフォーマンスや動作の一貫性を維持できます。現在、GPT-transcribeには「gpt-transcribe」というスナップショットが利用可能です。

GPT-transcribeのリリースにより、Open AIは音声認識分野での製品ラインを拡充し、高精度で手頃な価格の文字起こしソリューションを提供します。多言語音声や専門用語を含むアプリケーションには、コンテキストおよびヒント機能が大きな利点をもたらすでしょう。今後のGPT-live-transcribeの登場により、リアルタイム音声対話の能力がさらに強化されることが期待されます。