阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一
9月15日消息,阶跃今日公开了StepAudio 3系列模型,涵盖StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music。其中多款模型在Artificial Analysis榜单上取得全球领先地位。这五款模型现已全部在阶跃星辰开放平台上线。
官方介绍指出,StepAudio 3系列针对几个关键应用场景设计:真实感语音合成、完整音频内容创造、实时语音对话、复杂语音解析及音乐制作。
以下是IT之家提供的模型详细说明:
StepAudio 3 Realtime:不仅能“中断对话”,还能理解、思考并执行
目前,许多Realtime语音产品已具备全双工、中断处理及低延迟交互功能。真正的体验差异不仅在于“能否同时听和说”,更在于模型能否在持续对话中边听边理解、判断介入时机,同时完成推理和任务执行。
StepAudio 3 Realtime针对这一目标进行了优化,提升了实时交互能力,支持原生全双工实时对话。
在Artificial Analysis的Conversational Dynamics榜单中,StepAudio 3 Realtime以98.9%的综合得分位居全球第一,展示了其领先的实时语音交互能力。这意味着模型不仅能“听懂”和“回应”,还能像真人交流一样判断对话节奏——知道何时回应、何时等待,以及处理用户的突发中断和连续反馈。
同时,StepAudio 3 Realtime在Artificial Analysis的Speech Reasoning榜单中以99.7%的语音推理准确率夺得全球第一。该榜单重点评估模型直接理解音频并完成复杂推理任务的能力,是业内评估“原生语音模型”的权威基准之一。
模型还能同步理解语义、语气、情绪、副语言表达及环境音,使实时交互不仅依赖文字内容,而是利用更全面的音频信息来把握用户意图。
面对复杂问题,StepAudio 3 Realtime支持推理与语音生成并行进行,在快速响应的同时继续组织和深化后续答案。
此外,Tool Call和长任务可异步执行,不会阻塞当前语音会话。任务进行中,用户仍能继续交流,结果完成后自然回归当前上下文。
这使Realtime语音模型不仅仅是“更自然地聊天”,而是能在同一场持续对话中完成听、说、想、做。
StepAudio 3 ASR:从听清到听懂
传统语音识别主要解决“听到了什么”,但真实语音常包含方言、口音、专业术语、同音词及复杂上下文。一个可用的ASR模型不仅需要准确转写声音,还需理解说话者的含义。
StepAudio 3 ASR将高精度语音识别与大型语言模型的上下文理解、知识及推理能力结合,使语音识别从“辨别声音”向“理解语境”迈进。
它支持中文、英文、方言、中英文混合、长音频及专业领域等多种场景识别,适应不同语言环境和表达方式。同时,凭借大语言模型的知识理解能力,StepAudio 3 ASR能更准确地识别姓名、地名、专业术语等复杂内容,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。
模型还能处理低音量、快速语速、含糊连读、歌声及背景音乐等复杂输入,使真实环境中的语音被更准确地识别和使用。
这意味着ASR模型不再只是一个声音转写工具,而是能更准确地理解、检索和应用每段语音内容。在会议记录、视频字幕、直播理解、智能客服、车载交互、医疗记录、金融及专业内容生产等场景中,都能精准完成任务。
StepAudio 3 ASR在Artificial Analysis的非流式语音识别准确性榜单中,WER(词错误率)仅为1.7%,与全球最佳水平并列。
StepAudio 3 TTS:不止是朗读,更像真人表达
声音不仅承载文字信息,还包含语气、节奏、停顿及情绪等丰富表达细节。如何让AI生成的语音更接近真实交流,一直是语音生成模型的重要方向。
StepAudio 3 TTS是一款面向实时交互场景的真实感语音生成模型,旨在让AI语音从“准确发声”走向“自然表达”。
模型在音色基础、语调层次、节奏律动及气口停顿等方面高度模仿人类自然口语模式,不仅能生成文字对应的语音,还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,使合成语音更接近真人说话。
同时,StepAudio 3 TTS能结合语义内容理解表达意图,自主调整情绪与语气变化,使声音表达更符合具体场景。在实时交互方面,模型基于流式生成架构,实现生成与播放同步,满足实时语音应用需求。
StepAudio 3 Gen:人声、音效、环境、音乐,一次性生成
传统音频内容生产通常是一条长链路。角色配音、环境音、音效、背景音乐需分别制作,再经过剪辑、对齐和混音,才能形成最终作品。
StepAudio 3 Gen尝试将这些分散环节统一到一个模型中。
它基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐。用户只需描述角色、场景和剧情,无需针对特定角色或场景进行额外训练,即可直接生成具有完整声音层次的音频内容。
更重要的是,这些声音并非简单叠加。
StepAudio 3 Gen支持对多个角色的音色、说话方式、语气、情绪、方言口音,以及笑声、喘息、停顿等副语言特征进行精细控制,还能指定对白、音效、环境声和背景音乐出现的时间与顺序。
这意味着模型不仅在“生成声音”,也开始参与整段内容的声音设计和时序编排。
对于影视、动画、游戏、广播剧、有声书及短视频创作者而言,原本需要素材搜集、多工具协作和大量后期处理的声音制作流程,有望被压缩到一次生成和持续迭代中。
StepAudio 3 Music:不止生成,更参与创作
音乐生成模型已越来越擅长“一句话生成一首歌”。但真正的音乐创作不应是简单的“抽卡”。创作者可能已有歌词、清唱、旋律、乐谱或Demo,希望AI接着完成编曲、改编和制作。
StepAudio 3 Music因此不仅支持从零生成,还支持基于ABC记谱法控制的多轮交互创作。
模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可提供歌词、清唱、参考歌曲、ABC记谱法等多种输入,让模型围绕已有创作继续生成和完善作品。
同时,用户可通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落及制作质感。
模型还对主歌、副歌、桥段、间奏等歌曲结构,以及跨段落的旋律发展、能量变化和演唱表达进行建模,使生成目标不仅是“一段好听的音乐”,而是一首结构完整、表达连贯的作品。
尤其在清唱配乐场景中,用户只需提供一段清唱,模型就能理解其中的旋律、节奏和情绪,并进一步补充和声、节奏、乐器和完整编曲。
一首温暖柔和的City Pop男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫。
这让音乐大模型开始更深入地进入真实音乐生产流程,而不仅仅是一个“一键生成歌曲”的工具。爱游戏体育认为,这种技术突破将推动行业创新。