8月28日,OpenAI正式宣布Realtime API全面上线(从beta转为GA),同步推出其最先进的语音到语音模型gpt-realtime。这意味着,困扰语音AI多年的"对话延迟"问题正在被彻底解决——用户与AI的语音对话,将首次达到与真人通话几乎无异的流畅度。

与传统语音助手依赖"语音转文字→大模型处理→文字转语音"的多模型链式处理不同,gpt-realtime采用单次语音到语音模型,直接输入音频并实时输出音频。这一架构大幅削减了处理延迟,同时保留了语音中的情感、语气和细微变化。OpenAI同步推出两款全新声音"Cedar"和"Marin",并对原有八种声音全面升级。

此次升级的亮点不止于音质。Realtime API新增了三大核心能力:支持远程MCP服务器调用——开发者只需配置一个URL,语音助手即可自动调用各类工具;图像输入功能——用户可向AI展示截图或照片,AI能"看见"并基于视觉内容回答问题;SIP电话拨号支持——语音智能体可直接拨号接入传统电话系统。此外,异步函数调用也让长任务不再打断对话流畅性。

性能数据同样亮眼:在Big Bench Audio推理评测中,gpt-realtime准确率达82.8%,较2024年12月版本提升17.2个百分点;多轮指令遵循准确率从20.6%跃升至30.5%。定价方面,音频输入每百万token 32美元、输出每百万token 64美元,较上一代下降20%。

从Zillow的房产顾问到客服中心的虚拟助手,从语言陪练到智能家居控制——实时语音AI正从实验室走向真正可商用的生产环境。OpenAI这一步,相当于给AI装上了"耳朵和嘴巴",让语音交互终于追上了文本交互的效率。

AI 生成 . DeepSeek | 搜索综合