证券日报微信

证券日报微博

您所在的位置: 网站首页 > 公司产业 > 企业信息 > 正文

阶跃全新发布StepAudio 3语音大模型 进入“听说想做”阶段

2026-09-16 13:07  来源:证券日报网 

    本报讯 (记者袁传玺)9月15日,上海阶跃星辰智能科技股份有限公司(以下简称“阶跃”)发布新一代语音大模型StepAudio 3系列,一次性推出StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music五款模型,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。

    相比过去主要围绕语音识别或语音生成等单项能力展开竞争,StepAudio 3将能力进一步延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈能力,让AI不仅能够“听”和“说”,也能够理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。

    其中,面向实时语音交互场景的StepAudio 3 Realtime支持原生全双工对话,可以在持续交流过程中判断何时回应、何时等待,并处理临时打断和连续反馈。

    与传统实时语音模型主要追求低延迟和自然对话不同,StepAudio 3 Realtime还进一步加入了语音推理和任务执行能力。模型能够同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行;ToolCall和长任务则可以异步执行,在任务运行期间不打断当前对话。

    在语音识别方面,StepAudio 3 ASR将高精度识别与大语言模型的上下文理解和知识能力结合,不仅要解决“听清楚”,也进一步提升对专业术语、人名、地名、方言及复杂上下文的理解能力。

    该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行优化。

    除实时交互和语音识别外,此次发布也进一步拓展了语音生成模型的能力边界。

    StepAudio 3 TTS面向真人级语音生成,在音色、语调、节奏、停顿和情绪表达之外,还能够生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用需求。

    StepAudio 3 Gen则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合在一起。用户可以通过自然语言描述角色、场景和剧情,一次生成包含多种声音元素的完整音频,并控制角色音色、情绪以及不同声音出现的时间与顺序,广泛适用于影视、动画、游戏、广播剧、有声书和短视频等内容生产场景。

    面向音乐创作的StepAudio 3 Music不再局限于“一句话生成一首歌”,而是支持歌曲创作、清唱配乐、歌曲翻唱以及基于ABC记谱法的多轮交互创作。用户可以通过歌词、清唱、参考歌曲等不同形式与模型共同完成编曲和作品迭代,使AI更深入参与实际音乐生产流程。

    过去一年,语音大模型正从单项的语音识别和生成能力,逐渐走向实时交互、声音理解与内容创作的融合竞争。随着StepAudio 3系列发布,阶跃音频模型的产品版图,已经全面覆盖了听、说、理解、推理和创作。

(编辑 张伟)

-证券日报网

版权所有《证券日报》社有限责任公司

互联网新闻信息服务许可证 10120240020增值电信业务经营许可证 京B2-20250455

京公网安备 11010602201377号京ICP备19002521号

证券日报网所载文章、数据仅供参考,使用前务请仔细阅读法律申明,风险自负。

证券日报社电话:010-83251700网站电话:010-83251800

网站传真:010-83251801电子邮件:xmtzx@zqrb.net

官方客户端

安卓

IOS

官方微信

扫一扫,加关注

官方微博

扫一扫,加关注