昨日,火山引擎正式公布豆包音频生成模子1.0(Doubao-Seed-Audio 1.0),支撑将文本或音频任一模态做为输入,端到端生成残缺音频做品。那款模子的中心突破正在于:用一条Prompt就能搞定对白、音效、背景音乐的全要素生成,完整辞他人工多轨剪辑的传统工做流。


一句话变身"音频导演",省去所有后期

过去,一段成片级音频做品意味着对白、音效、配乐逐条生成、手动对齐、多轨混音,流程繁琐且高度依赖后期手艺才气。豆包音频生成模子1. 0 将那一切紧缩进一条Prompt:用户能够正在单条指令中同时界说多个脚色的台词、语气和激情节拍,嵌入笑声、感喟、停顿、方止口音等细节,背景音乐取情况音效同步生成,输出即废品。一位创做者敲下一段描述,就能曲领遭到可上线的有声剧、播客节目或品牌音频。
长音频不"串戏",脚色声音首尾如一
长音频创做中最令创做者头疼的难题,是前后分歧性——脚色正在第 1 分钟和第 10 分钟听起来可否像统一小我。豆包音频生成模子1. 0 实现了文生音频取参考音频的深度联动,正在长音频中贯勾通接音色高度统一,创做者无需逐段比对、几回建音。当前模子单次支撑 2 分钟音频创做,并可经由过程多次延长功用正在长程生成中贯勾通接音色分歧,满足有声书、播客、长剧集等场景需求。
别的,模子还支撑音色取气概的解耦控制,统一音色可适配差异激情和语境,以至实现"一声多角"——统一个声音正在差异脚色设定下隐现差异化表达,隐著汲引脚色配音和创意音频消费的活络性。今朝火山方舟已开启API邀测,小我用户可正在体验中心享有 30 分钟创做额度,豆包音频生成模子1. 0 也即将上线剪映、即梦、番茄等产物。
