AI News HubLIVE
站内改写2 分钟阅读

Open AI 发布两款新模型:GPT-transcribe 和 GPT-live-transcribe

Open AI 推出了 GPT-transcribe 和 GPT-live-transcribe 两款新模型,专注于语音转文字任务。GPT-transcribe 已正式发布,支持文件和实时转录,定价为每分钟 0.0045 美元。模型支持非结构化上下文、关键词提示和多语言提示,可用于多种端点和流式输出,但不支持函数调用和微调。

来源Hacker News AI作者: rochansinha

Open AI 近日宣布推出两款全新的语音转文字模型:GPT-transcribe 和 GPT-live-transcribe。目前,GPT-transcribe 已正式向开发者开放,而 GPT-live-transcribe 的详细信息尚未完全公开,预计将在后续发布。这两款模型旨在为开发者提供高精度的语音识别能力,适用于多种场景。

GPT-transcribe 被描述为一种高精度的语音转文字模型,能够处理已完成的音频文件转录、流式文件转录以及通过 WebSocket 实时会话中的连续交互。它支持非结构化上下文(unstructured context),这意味着开发者可以自由提供额外的上下文信息,帮助模型更好地理解特定领域的术语或对话背景。此外,模型还支持关键词提示(keyword hints)和多语言提示(language hints),这对于多语言音频、代码切换(code-switching)以及包含专业术语的场景尤为有用,能显著提升转录的准确性。

在定价方面,GPT-transcribe 采用基于使用时长的计费方式,按每分钟音频收费,价格为每分钟 0.0045 美元。需要注意的是,对于其他工具特定模型(如搜索和计算机使用),每次工具调用会产生额外费用,但 GPT-transcribe 本身不涉及工具调用。定价模式透明,开发者可以便捷地预估成本。

在输入输出模态方面,GPT-transcribe 支持音频和文本作为输入,输出仅为文本。图像和视频输入不被支持,音频也只能作为输入,不能作为输出。这意味着模型专注于从语音到文字的转换,不涉及其他多模态功能。

Open AI 提供了丰富的端点(endpoints)供开发者集成,包括 Chat Completions(v1/chat/completions)、Responses(v1/responses)、Realtime(v1/realtime)、实时翻译(v1/realtime/translations)、实时转录(v1/realtime/transcription_sessions)、Assistants(v1/assistants)、Batch(v1/batch)等。这些端点覆盖了从批量处理到实时交互的多种需求。此外,模型支持流式输出(streaming),这对于需要低延迟的实时应用非常有价值。但值得注意的是,GPT-transcribe 不支持函数调用(function calling)、结构化输出(structured outputs)、微调(fine-tuning)和预测输出(predicted outputs),这限制了其在需要这些高级功能的场景下的使用。

为了保持模型的稳定性和一致性,Open AI 提供了快照(snapshots)功能。开发者可以锁定特定版本的模型,确保性能和行为不会因模型更新而变化。目前,GPT-transcribe 有一个名为“gpt-transcribe”的快照可供使用。

随着 GPT-transcribe 的发布,Open AI 进一步扩展了其在语音识别领域的产品线,为开发者提供了一个高精度且经济实惠的转录解决方案。对于需要处理多语言音频或专业术语的应用,GPT-transcribe 的上下文和提示功能将带来显著优势。未来,GPT-live-transcribe 的推出有望进一步丰富实时语音交互的能力。