OpenAI新API语音模型将改变你使用AI的方式
OpenAI发布了三个新的实时语音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在让开发者构建能够实时听、推理、翻译、转录和执行操作的语音应用。这些模型支持更自然的对话、处理中断和纠正、128K上下文窗口、70+种语言的实时翻译等特性,适用于客户支持、会议翻译、实时字幕、旅行助手、医疗和职场助理等场景。
OpenAI近日发布了三款全新的实时语音模型——GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,旨在通过API帮助开发者打造能够实时倾听、思考、翻译、转录和执行操作的语音应用。这些模型标志着语音AI从简单的指令响应向自然、连续的对话迈出了重要一步。
传统语音AI通常需要分步处理:先录制音频,将语音转为文本,再由另一模型生成回复,最后将文本转回语音。这种流水线方式延迟明显,对话体验不够自然。而OpenAI的新模型专为实时设计,能够在用户说话的同时理解并回应,使人机对话更像是与真人助理交流。
GPT-Realtime-2是核心对话模型,适用于需要自然对话、理解上下文、处理打断和实时采取行动的语音代理。例如,基于该模型构建的客服系统可以在通话中理解用户问题、追问细节、查询订单信息并即时反馈。该模型还支持更强的纠错能力和中断恢复,上下文窗口从之前的32K扩展至128K,能够处理更长时间、更复杂的对话。开发者还可以控制模型的语调和推理强度,使其在支持场景中保持冷静,在用户沮丧时展现同理心。
GPT-Realtime-Translate专注于实时语音翻译,支持70种以上输入语言,并可输出13种目标语言。OpenAI的演示显示,该模型能够在说话者讲话的同时进行翻译,速度几乎同步。这对跨国会议、旅行交流、多语种客服、教育平台和现场活动具有革命性意义。其定价为每分钟0.034美元。
GPT-Realtime-Whisper则专为实时转录设计,能在人说话的同时将语音转为文字,特别适合直播字幕、会议记录、课堂笔记和采访转录。该模型每分钟收费0.017美元。
这三个模型现已通过OpenAI的Realtime API提供,开发者也可以在Playground中先行测试。GPT-Realtime-2的定价为:每百万音频输入tokens 32美元,缓存输入tokens 0.40美元,输出tokens 64美元。
在应用场景上,这些模型不仅限于客服和翻译。企业可以构建内部语音助理帮助员工查找文件、总结会议、创建任务列表;医疗机构可用于预约挂号、患者初筛;旅游应用可通过自然语音对话完成航班搜索和酒店比价。
尽管前景广阔,OpenAI也指出开发者需要在敏感领域(如医疗、金融和法律)设置强护栏、明确用户告知、保障隐私并保留人工审核。但总体而言,实时语音模型正从被动响应走向主动协助,而OpenAI正站在这一变革的前沿。