要实现文本对画面的精准干预,模型必须先跨过一道技术门槛:如何不让强势的视觉信息带偏节奏?视频画面天生携带海量数据,传统多模态模型在融合信息时,视觉信号极易压制文本指令。过去的AI配音就像个只会看图猜声的旁观者,画面里一出现挥剑动作就本能配上金属碰撞声,哪怕用户明确要求生成科幻激光音效,模型也容易被画面牵着鼻子走。
为此,小米团队自研了时空音视频编码器CAV-MAE-ST(一种专门用于对齐视频动作与声音时间轴的AI组件)。与擅长理解通用图文语义的CLIP不同,该编码器针对配音场景重新训练,核心只盯一件事:动作起落的瞬间,声音该在几毫秒精准出现。它通过视频帧与音频特征的联合建模,直接提取动作节奏与同步线索。当文本意图与画面内容发生冲突时,这套架构能有效抑制画面的强干扰,确保指令优先执行
解决了视觉与文本的冲突,当引入参考音频作为风格标尺时,新的干扰又出现了。参考音频里其实天然捆绑着两套信息:一是音色和质感,二是声音出现的时间点和节奏。如果模型直接照单全收,很容易“抄作业抄偏了”,连参考音频里的快慢节拍一起生搬硬套。结果往往是,视频里的人明明在慢走,生成的脚步声却跟着参考音频的快节奏乱踩,音画同步瞬间崩盘。
为此,ControlFoley 引入了时间与音色解耦架构(一种将声音的质感特征和时间序列拆分开处理的算法设计)。模型会在底层自动过滤掉参考音频中冗余的节奏信息,只提取全局音色特征。这就好比你去定制家具,只把木材样板交给师傅定材质,但打磨上漆的工序节奏完全按照你自家的装修进度来走。在这个机制下,参考音频只负责把控声音的听感风格,视频画面则继续充当精准的节拍器。
实测数据显示,这种分工让模型在复杂场景下表现稳定。例如用户输入一段带有老旧磁带底噪的参考音,视频内容却是现代车辆行驶画面,模型能精准剥离出底噪的粗粝质感,并严格按画面中轮胎滚动的毫秒级节点生成音效,既保留了复古氛围,又丝毫不拖沓画面节奏。
说白了,就是把声音像什么和声音什么时候响拆成两条独立流水线。AI 不再因为顾此失彼而手忙脚乱,创作者只需提供风格参考,剩下的踩点对齐工作全部交给模型自动完成,直接打破了传统生成模型风格与同步不可兼得的技术瓶颈。
架构上的单点突破只是基础,真正考验工程落地能力的,是能否把多种控制能力揉进同一个模型底座。真实创作场景中,用户给出的条件往往很随机。有时只有一段无声视频,有时想加文字提示,偶尔还会附带参考音频。如果为每种输入组合单独训练模型,不仅算力成本高,效果也容易割裂。ControlFoley 采用了随机模态丢弃训练(一种在训练时故意随机隐藏部分输入数据,强迫模型不依赖单一信号的技术)与统一表示对齐策略。这就像给AI做抗干扰特训,让它学会看菜下饭,无论输入条件怎么排列组合,输出都能保持稳定。
这种统一架构直接推高了性能天花板。在 VGGSound-Test、Kling-Audio-Eval 和 MovieGen-Audio-Bench 等多个权威评测集上,ControlFoley 均拿下开源 SOTA(State of the Art,指当前开源领域的最高水平)成绩。更值得关注的是它对标商业闭源系统的实测表现。面对 Kling-Foley 等闭源产品,ControlFoley 在语义对齐度、时间同步精度和声音质量三大核心指标上均展现出稳定优势。频谱对比直观显示,在乐器演奏或体育对抗等复杂场景里,它能精准卡住动作节点生成高频细节,彻底告别了过去常见的音画错位或声音漏配现象。
小米此次将代码、模型权重、技术报告及在线 Demo 全部开放,等于把原本锁在商业服务器里的专业级音频生成能力,直接搬到了开源社区的工作台上。这意味着,过去只有大型影视团队才能调用的意图控制级音效工具,现在个人创作者和中小开发者也能免费部署、按需定制。说白了,开源不只是技术秀肌肉,更是通过降低接入门槛,把声音的精细控制权真正交还给每一位内容创作者,加速多模态音频工具从实验室走向大众工作台。告别“AI盲猜”,视频配音进入意图控制时代
大模型动态
视频音效生成
多模态AI
可控生成
开源模型
小米大模型
给视频自动配音效早已不稀奇,但过去模型只能“看图猜声”,创作者往往被随机生成的结果牵着走。小米近日开源的ControlFoley模型,直接把“可控性”作为核心突破口。它通过自研时空编码器与时间-音色解耦策略,统一支持文本引导、文本强控和参考音频控制三大场景,在保持音画严格同步的同时,让声音真正服从创作意图。实测数据显示,该模型在多项基准测试中拿下开源SOTA,关键指标甚至超越部分商业闭源系统。本文将拆解ControlFoley的技术架构与开源策略,看它如何把视频声音的控制权交还给内容创作者,并降
既然核心是可控,ControlFoley具体是怎么把用户的模糊想法翻译成精准声音的?它把创作需求拆成了三档控制旋钮,统一整合进同一个底层框架里。
第一档是文本引导视频配音。你给无声视频配上文字提示,比如补充远处有海浪拍打礁石,
要实现文本对画面的精准干预,模型必须先跨过一道技术门槛:如何不让强势的视觉信息带偏节奏?视频画面天生携带海量数据,传统多模态模型在融合信息时,视觉信号极易压制文本指令。过去的AI配音就像个只会看图猜声的旁观者,画面里一出现挥剑动作就本能配上金属碰撞声,哪怕用户明确要求生成科幻激光音效,模型也容易被画面牵着鼻子走。
为此,小米团队自研了时空音视频编码器CAV-MAE-ST(一种专门用于对齐视频动作与声音时间轴的AI组件)。与擅长理解通用图文语义的CLIP不同,该编码器针对配音场景重新训练,核心只盯一件事:动作起落的瞬间,声音该在几毫秒精准出现。它通过视频帧与音频特征的联合建模,直接提取动作节奏与同步线索。当文本意图与画面内容发生冲突时,这套架构能有效抑制画面的强干扰,确保指令优先执行
解决了视觉与文本的冲突,当引入参考音频作为风格标尺时,新的干扰又出现了。参考音频里其实天然捆绑着两套信息:一是音色和质感,二是声音出现的时间点和节奏。如果模型直接照单全收,很容易“抄作业抄偏了”,连参考音频里的快慢节拍一起生搬硬套。结果往往是,视频里的人明明在慢走,生成的脚步声却跟着参考音频的快节奏乱踩,音画同步瞬间崩盘。
为此,ControlFoley 引入了时间与音色解耦架构(一种将声音的质感特征和时间序列拆分开处理的算法设计)。模型会在底层自动过滤掉参考音频中冗余的节奏信息,只提取全局音色特征。这就好比你去定制家具,只把木材样板交给师傅定材质,但打磨上漆的工序节奏完全按照你自家的装修进度来走。在这个机制下,参考音频只负责把控声音的听感风格,视频画面则继续充当精准的节拍器。
实测数据显示,这种分工让模型在复杂场景下表现稳定。例如用户输入一段带有老旧磁带底噪的参考音,视频内容却是现代车辆行驶画面,模型能精准剥离出底噪的粗粝质感,并严格按画面中轮胎滚动的毫秒级节点生成音效,既保留了复古氛围,又丝毫不拖沓画面节奏。
说白了,就是把声音像什么和声音什么时候响拆成两条独立流水线。AI 不再因为顾此失彼而手忙脚乱,创作者只需提供风格参考,剩下的踩点对齐工作全部交给模型自动完成,直接打破了传统生成模型风格与同步不可兼得的技术瓶颈。
架构上的单点突破只是基础,真正考验工程落地能力的,是能否把多种控制能力揉进同一个模型底座。真实创作场景中,用户给出的条件往往很随机。有时只有一段无声视频,有时想加文字提示,偶尔还会附带参考音频。如果为每种输入组合单独训练模型,不仅算力成本高,效果也容易割裂。ControlFoley 采用了随机模态丢弃训练(一种在训练时故意随机隐藏部分输入数据,强迫模型不依赖单一信号的技术)与统一表示对齐策略。这就像给AI做抗干扰特训,让它学会看菜下饭,无论输入条件怎么排列组合,输出都能保持稳定。
这种统一架构直接推高了性能天花板。在 VGGSound-Test、Kling-Audio-Eval 和 MovieGen-Audio-Bench 等多个权威评测集上,ControlFoley 均拿下开源 SOTA(State of the Art,指当前开源领域的最高水平)成绩。更值得关注的是它对标商业闭源系统的实测表现。面对 Kling-Foley 等闭源产品,ControlFoley 在语义对齐度、时间同步精度和声音质量三大核心指标上均展现出稳定优势。频谱对比直观显示,在乐器演奏或体育对抗等复杂场景里,它能精准卡住动作节点生成高频细节,彻底告别了过去常见的音画错位或声音漏配现象。
小米此次将代码、模型权重、技术报告及在线 Demo 全部开放,等于把原本锁在商业服务器里的专业级音频生成能力,直接搬到了开源社区的工作台上。这意味着,过去只有大型影视团队才能调用的意图控制级音效工具,现在个人创作者和中小开发者也能免费部署、按需定制。说白了,开源不只是技术秀肌肉,更是通过降低接入门槛,把声音的精细控制权真正交还给每一位内容创作者,加速多模态音频工具从实验室走向大众工作台。
要实现文本对画面的精准干预,模型必须先跨过一道技术门槛:如何不让强势的视觉信息带偏节奏?视频画面天生携带海量数据,传统多模态模型在融合信息时,视觉信号极易压制文本指令。过去的AI配音就像个只会看图猜声的旁观者,画面里一出现挥剑动作就本能配上金属碰撞声,哪怕用户明确要求生成科幻激光音效,模型也容易被画面牵着鼻子走。
为此,小米团队自研了时空音视频编码器CAV-MAE-ST(一种专门用于对齐视频动作与声音时间轴的AI组件)。与擅长理解通用图文语义的CLIP不同,该编码器针对配音场景重新训练,核心只盯一件事:动作起落的瞬间,声音该在几毫秒精准出现。它通过视频帧与音频特征的联合建模,直接提取动作节奏与同步线索。当文本意图与画面内容发生冲突时,这套架构能有效抑制画面的强干扰,确保指令优先执行
解决了视觉与文本的冲突,当引入参考音频作为风格标尺时,新的干扰又出现了。参考音频里其实天然捆绑着两套信息:一是音色和质感,二是声音出现的时间点和节奏。如果模型直接照单全收,很容易“抄作业抄偏了”,连参考音频里的快慢节拍一起生搬硬套。结果往往是,视频里的人明明在慢走,生成的脚步声却跟着参考音频的快节奏乱踩,音画同步瞬间崩盘。
为此,ControlFoley 引入了时间与音色解耦架构(一种将声音的质感特征和时间序列拆分开处理的算法设计)。模型会在底层自动过滤掉参考音频中冗余的节奏信息,只提取全局音色特征。这就好比你去定制家具,只把木材样板交给师傅定材质,但打磨上漆的工序节奏完全按照你自家的装修进度来走。在这个机制下,参考音频只负责把控声音的听感风格,视频画面则继续充当精准的节拍器。
实测数据显示,这种分工让模型在复杂场景下表现稳定。例如用户输入一段带有老旧磁带底噪的参考音,视频内容却是现代车辆行驶画面,模型能精准剥离出底噪的粗粝质感,并严格按画面中轮胎滚动的毫秒级节点生成音效,既保留了复古氛围,又丝毫不拖沓画面节奏。
说白了,就是把声音像什么和声音什么时候响拆成两条独立流水线。AI 不再因为顾此失彼而手忙脚乱,创作者只需提供风格参考,剩下的踩点对齐工作全部交给模型自动完成,直接打破了传统生成模型风格与同步不可兼得的技术瓶颈。
架构上的单点突破只是基础,真正考验工程落地能力的,是能否把多种控制能力揉进同一个模型底座。真实创作场景中,用户给出的条件往往很随机。有时只有一段无声视频,有时想加文字提示,偶尔还会附带参考音频。如果为每种输入组合单独训练模型,不仅算力成本高,效果也容易割裂。ControlFoley 采用了随机模态丢弃训练(一种在训练时故意随机隐藏部分输入数据,强迫模型不依赖单一信号的技术)与统一表示对齐策略。这就像给AI做抗干扰特训,让它学会看菜下饭,无论输入条件怎么排列组合,输出都能保持稳定。
这种统一架构直接推高了性能天花板。在 VGGSound-Test、Kling-Audio-Eval 和 MovieGen-Audio-Bench 等多个权威评测集上,ControlFoley 均拿下开源 SOTA(State of the Art,指当前开源领域的最高水平)成绩。更值得关注的是它对标商业闭源系统的实测表现。面对 Kling-Foley 等闭源产品,ControlFoley 在语义对齐度、时间同步精度和声音质量三大核心指标上均展现出稳定优势。频谱对比直观显示,在乐器演奏或体育对抗等复杂场景里,它能精准卡住动作节点生成高频细节,彻底告别了过去常见的音画错位或声音漏配现象。
小米此次将代码、模型权重、技术报告及在线 Demo 全部开放,等于把原本锁在商业服务器里的专业级音频生成能力,直接搬到了开源社区的工作台上。这意味着,过去只有大型影视团队才能调用的意图控制级音效工具,现在个人创作者和中小开发者也能免费部署、按需定制。说白了,开源不只是技术秀肌肉,更是通过降低接入门槛,把声音的精细控制权真正交还给每一位内容创作者,加速多模态音频工具从实验室走向大众工作台。