近日,上海市北国际科创区企业喜马拉雅携新一代音频大模型、全新音频智能创作平台“音剪AI”,以及多款智能硬件产品亮相世界人工智能大会市北高新展台。
作为全国首个通过国家网信办备案的音频生成类大模型,喜马拉雅音频大模型的自研TTS技术已经过七代迭代,累计产出音频超1000万小时。此次展出的全新版本“Audiobook-A2”,在“理解内容、生成声音、控制演绎”方面实现显著跃升。
“传统的有声内容创作依赖人工全流程落地,过程烦琐、操作门槛较高。而在喜马拉雅音频大模型的赋能下,一键生成多角色、有情感的高质量演播作品,速度能提升几十倍。”喜马拉雅珠峰实验室音色产品负责人徐昊表示。
同时进行展出的“音剪AI”,正是以喜马拉雅音频大模型为底层模型的音频智能创作平台。相较此前版本,新增“智能后期”与“音色分配”功能。前者可围绕文本内容自动识别场景氛围与情绪变化,智能匹配音效、背景音乐及表演提示。后者则可基于文本内容辅助梳理不同角色的性格特征与叙事身份,为旁白与各种角色推荐合适音色,帮助创作者省去前期反复筛选与试音的时间。截至目前,“音剪AI”已累计上线超1万种覆盖多年龄、多角色类型的有声角色音。
上海市北高新集团党委书记、董事长孙中峰表示:“从音剪AI到智能硬件产品,喜马拉雅正构建覆盖多元场景的音频智能服务生态,软硬件协同的创新成果充分彰显了音频AI赛道的发展潜力。市北国际科创区将持续深耕科技产业培育,助力科技产业高质量发展。”