AI大模型的交互方式正在发生质变。8月5日,字节跳动正式推出原生音视频全双工大模型SeedRealtime,用统一架构原生融合音频、视频与文本,实现"边看、边听、边说"的实时多模态交互,并已在豆包App全量上线。这是业界首次将音视频全双工技术规模化落地到C端产品,意味着AI助手从"一问一答"的聊天机器人,正式迈入"实时感知、主动交互"的新阶段。

SeedRealtime的核心突破在于三项能力:音视频联合理解、主动交互能力和流畅的交互节奏。传统AI语音助手本质上是"级联模型"——先语音识别转文字,再大模型理解,最后文字转语音输出,每个环节都有延迟和误差。SeedRealtime用一个端到端架构一步到位,端到端人工评测结果显示,相比级联模型,其音视频对话的节奏问题减少了一半——模型对说话时机的把握更加自然,"话未说完被抢断、话音已落却回应迟缓"等卡壳现象显著减少。

这背后是字节跳动Seed团队在大模型多模态能力上的持续投入。就在SeedRealtime发布前一周,字节刚完成豆包、飞书、火山引擎的组织架构整合,成立新的"创造力服务平台",大模型业务ARR已达40亿美元。SeedRealtime的推出,既是技术实力的展示,更是字节在AI应用层加速跑马圈地的信号——当竞品还在卷文本对话时,字节已经把战场拉到了音视频实时交互维度。

从产业角度看,SeedRealtime的落地意味着AI助手正在突破屏幕限制,走向更自然的物理世界交互。无论是远程协作、在线教育、智能客服还是AI陪伴,音视频全双工能力都将重塑用户体验的底层逻辑。而当这种能力搭载在拥有数亿月活的豆包App上,其数据飞轮效应将迅速拉开与竞争对手的差距。

AI大模型的竞争正在从"参数规模"转向"交互范式"。字节用SeedRealtime扔下了一颗深水炸弹:未来的AI,不仅要听得懂、看得见,还要能像真人一样"看时机说话"。先做到的,先定义规则。

AI 生成 . DeepSeek | 搜索综合