OpenAI 推出 GPT-5 级实时语音模型:多场景高效交互新选择

OpenAI近日推出三款实时语音模型,旨在解决语音交互的响应延迟、打断处理和多语言支持等问题。GPT-Realtime-2具备GPT-5级别推理能力,GPT-Realtime-Translate支持70种语言实时转换,GPT-Realtime-Whisper则专注于低延迟转录,为开发者提供高效解决方案。

10效率工具实时语音模型OpenAI语音交互效率工具

OpenAI 推出全新实时语音模型

5月8日,OpenAI在Realtime API中集成了三款新的实时语音模型,针对逻辑推理、多语种翻译和流式转录场景提供技术支持。这些模型旨在解决语音交互领域存在的响应延迟、打断处理困难以及多语言支持不足等核心痛点。

GPT-Realtime-2:具备GPT-5级推理能力

作为此次更新的亮点,GPT-Realtime-2是全球首款展现出GPT-5级别推理能力的实时语音模型。它能在保持对话流畅度的同时,同步进行复杂推理和调用外部工具,并能精准识别用户的即时打断或纠正。

OpenAI 发布三款实时语音模型:首推 GPT-5 级推理能力与流式交互技术插图

GPT-Realtime-Translate:多语种实时转换

针对特定应用场景,GPT-Realtime-Translate支持将70种输入语言即时转化为13种输出语言,适用于跨国会议等实时沟通环境,按分钟计费,价格为每分钟0.034美元。

GPT-Realtime-Whisper:低延迟流式转录

专注于低延迟流式转录的GPT-Realtime-Whisper实现了“随说随转”,能够实时生成字幕和会议记录,显著减少等待感,计费标准为每分钟0.017美元。