中文翻译

摘要: OpenAI 于 2026 年 5 月推出三款实时音频 API 模型,赋能开发者构建语音优先产品。GPT-Realtime-2 具备 GPT-5 级推理能力,支持复杂对话与工具调用;GPT-Realtime-Translate 支持超 70 种语言互译,优化口音与术语处理;GPT-Realtime-Whisper 实现流式语音转写。三者均通过 Realtime API 提供

正文

ChatGPT 新闻

OpenAI 推出全新实时语音与翻译 AI 模型

OpenAI 为开发者推出三款先进的实时音频模型,支持通过 API 实现实时语音助手、即时翻译和流式语音转写功能。

作者:Alexey Shabanov

发布日期:2026 年 5 月 8 日

阅读时长:约 2 分钟

OpenAI 正在其 API 平台中进一步拓展语音 AI 能力,推出了三款专为开发者设计的全新实时音频模型,适用于构建实时语音助手、翻译工具及流式语音转写产品。此次发布包括 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,均可通过 Realtime API 访问。

GPT-Realtime-2

该模型是本次系列中的核心智能语音代理模型。OpenAI 表示,它具备 GPT-5 级别的推理能力,可应用于口语对话场景,使语音助手能够处理更复杂的请求、管理上下文、调用外部工具、响应修正指令,并在对话中保持连贯性,避免退化为简单的“一问一答”模式。该模型支持并行工具调用、简短的口语前缀(如“让我查一下”)、任务失败时的恢复机制,并将上下文窗口从上一代的 32K 扩展至 128K。

在 API 中引入 GPT-Realtime-2:迄今为止最智能的语音模型,将 GPT-5 级别的推理能力带入语音助手。
语音助手现已成为真正的实时协作者,能够在对话进行中倾听、推理并解决复杂问题。
现可通过 API 使用……
pic.twitter.com/2DY1LU2vO8
—— OpenAI (@OpenAI)
2026 年 5 月 7 日

开发者现在可以更多控制模型的推理强度,设置范围从“最低”到“极高”。默认设置为“低”,而更高设置则适用于对推理深度要求高于延迟敏感性的复杂语音任务。OpenAI 报告称,GPT-Realtime-2 在音频理解、指令遵循、上下文管理及实时对话控制方面均优于前代模型 GPT-Realtime-1.5。

GPT-Realtime-Translate

该模型专为多语言实时语音产品设计。它支持超过 70 种语言的语音输入,并可输出至 13 种语言,助力开发者构建面向客户服务、跨境销售、教育、活动管理、创作者平台及媒体本地化等场景的工具。该模型经过优化,能够紧跟说话者节奏,同时有效处理地域口音、语境转换及专业领域术语。

GPT-Realtime-Whisper

该模型为 API 提供流式语音转文本(Speech-to-Text)能力。它能在用户说话的同时实时转录音频,适用于实时字幕、会议记录、教学工具、广播、客服工作流、医疗文档、招聘流程及销售通话等场景——即需要在对话过程中将语音即时转化为结构化文本,而非事后处理。

目标用户主要为开发者和致力于构建“语音优先”产品的企业,而非普通 ChatGPT 用户。OpenAI 早期识别的应用案例包括:Zillow 用于房地产领域的语音助手、Deutsche Telekom 的多语言客服支持、Priceline 的……


来源: Brave/testingcatalog.com

采集时间: 2026-05-08 20:17:58

AIGPTChatGPTOpenAIAPI人工智能