AI News HubLIVE
サイト内リライト2 分で読了

OpenAIの新API音声モデルがAIの使い方を変える

OpenAIは、リアルタイムで聞き、推論し、翻訳し、書き起こし、アクションを実行できる3つの新しい音声モデル(GPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisper)をAPIで公開しました。これらのモデルは、自然な会話、割り込み処理、128Kコンテキストウィンドウ、70以上の言語から13の出力言語へのリアルタイム翻訳、トーンと推論の制御をサポートし、カスタマーサポート、会議翻訳、ライブキャプション、旅行予約、医療、職場アシスタントなどのユースケースに対応します。

ソースAnalytics Vidhya著者: Sarthak Dogra

OpenAIは、開発者がリアルタイムで音声を聞き、理解し、翻訳し、書き起こし、さらにアクションを実行できるアプリを構築するための3つの新しい音声モデルをAPIで公開しました。これらは、GPT-Realtime-2(対話型)、GPT-Realtime-Translate(ライブ翻訳)、GPT-Realtime-Whisper(ライブ書き起こし)です。

従来の音声AIは、音声を録音してテキストに変換し、別のモデルで応答を生成し、再び音声に変換するという段階的な処理が必要でした。そのため、応答に遅延が生じ、不自然な体験になりがちでした。新しいモデルは話しながら処理を行うため、より人間らしい会話が可能になります。

GPT-Realtime-2は、自然な対話、コンテキストの理解、割り込みや言い間違えへの対応、ツールの呼び出しなどを特徴とします。例えば、カスタマーサポートエージェントは、通話中にユーザーの問題を理解し、追加質問をし、注文情報を確認しながら応答できます。また、コンテキストウィンドウは32Kから128Kに拡張され、長時間の複雑な会話にも対応します。さらに、トーン(落ち着いた、共感的など)や推論の深さ(最小から超高まで)を開発者が制御できます。

GPT-Realtime-Translateは、70以上の入力言語を13の出力言語にリアルタイム翻訳します。デモでは、話者が話すと同時に翻訳が行われる様子が示され、多言語会議、旅行アプリ、多言語カスタマーサポート、教育プラットフォーム、ライブイベントでの活用が期待されます。価格は1分あたり0.034ドルです。

GPT-Realtime-Whisperは、話しながら音声をテキストに書き起こすモデルです。ライブキャプション、会議の文字起こし、通話記録、授業メモ、インタビューなどに最適で、価格は1分あたり0.017ドルです。

3つのモデルはOpenAIのRealtime APIで利用可能で、Playgroundでもテストできます。GPT-Realtime-2の価格は、音声入力トークン100万あたり32ドル、キャッシュ入力トークン100万あたり0.40ドル、音声出力トークン100万あたり64ドルです。

ユースケースとしては、カスタマーサポート、ライブ会議翻訳、ライブキャプション、旅行予約アシスタント、医療コールアシスタント、社内音声アシスタントなどが考えられます。医療、金融、法務などの分野では、強力なガードレールと人間のレビューが引き続き重要ですが、OpenAIは音声AIを次のレベルへと引き上げようとしています。