9月1日,国内大模型六小虎之一的阶跃星辰发布并开源Step-Audio 2 mini端到端语音大模型,多项基准测试超越GPT-4o-audio。

该模型采用真正的端到端多模态架构,将语音理解、音频推理与生成统一建模,首创在端到端语音模型中引入链式思维推理和强化学习联合优化,并率先支持语音原生Tool Calling。

在通用多模态音频理解测试集MMAU上,Step-Audio 2 mini以73.2分位列开源端到端语音模型榜首;在中英互译任务上大幅领先GPT-4o-audio。语音识别任务开源中文测试集平均字错误率3.19,开源英语测试集平均词错误率3.50,领先其他开源模型超过15%。

吉利银河M9已搭载阶跃端到端语音大模型,是行业内端到端语音大模型首次实现量产上车。