剥离赛事排名的表层光环,高效超分赛道的冠军方案 SPANV2 直接切中了移动端影像管线的算力痛点。该方案以 4.43 的综合评分登顶,其核心并非堆砌参数,而是对底层计算范式的工程化重构。传统超分模型多采用全局统一的特征处理策略,导致平滑区域算力冗余而高频纹理区域修复不足。SPANV2 引入内容自适应精修机制,网络在特征提取阶段即对局部退化程度与纹理复杂度进行动态评估,据此分配计算权重。模型能够自动识别边缘、文字或复杂结构等高敏感区域并集中算力介入,在剔除无效计算的同时锁定关键细节的重建精度。
算力调度优化的另一重抓手直指显存带宽瓶颈。在标准注意力机制中,特征矩阵的聚合通常伴随三次独立的显存读写操作,频繁的数据搬运在端侧芯片上会直接阻塞推理管线。SPANV2 通过底层算子融合与内存布局重写,将注意力计算的访存步骤合并为单次完成。这一改动大幅削减了重复的数据搬运开销,使计算单元能够更长时间驻留数据,直接拉升内存带宽利用率。自适应路由与单次读写双管齐下,使模型在画质保真度几乎无损的前提下,推理延迟与计算量实现同步压降。该架构演进证明,超分任务完全可以通过访存优化与动态调度,在脱离暴力堆参的路径下达成端侧可用的效率跃升。
超分赛道解决的是“看得清”的效率问题,而人像修复则需直面“修得准”的身份保真挑战。真实场景中的老照片往往叠加了模糊、压缩伪影、噪声与低分辨率等复合退化,若依赖传统端到端生成模型直接一步输出,极易在特征对齐过程中引发五官拓扑结构漂移,甚至导致身份特征丢失。小米大模型应用团队给出的工程解法是结构解耦与推理压缩:采用双阶段级联框架叠加单步扩散细化机制,将修复任务拆解为骨相重建与皮相精修两条独立计算管线。
第一阶段依托OSDFace网络执行粗修复与结构锚定。该模块不追求像素级的高频渲染,而是专注于面部关键点的空间布局恢复与严重退化区域的几何校正。通过强制约束面部结构先验,模型在强噪声干扰下仍能输出稳定的五官骨架,从根本上切断特征发散与结构漂移的传播路径。第二阶段接入Z-Image单步扩散模型进行高频细节注入。传统扩散模型为逼近真实数据分布需执行数十步迭代采样,推理延迟极高且长链条容易累积生成误差。团队将多步扩散过程压缩至单步推理,在锁定第一阶段几何输出的前提下,仅针对皮肤肌理、发丝走向与边缘轮廓进行高频补偿。这一架构改动将生成模型的算力开销呈指数级压降,同时规避了多步采样带来的身份失真风险。
在无参考图像质量与身份一致性综合评测中,该方案以结构稳定性与细节真实度的双优表现拿下赛道冠军。双阶段级联并非简单的模块拼接,而是通过解耦结构生成与纹理渲染的计算图,使大模型摆脱了对全局暴力计算的依赖。单步扩散的引入直接打通了生成质量与端侧推理效率的壁垒,证明复杂人像修复任务完全可以通过架构级调度优化,在严控五官拓扑约束的前提下实现低延迟响应,为移动端影像管线提供了可规模部署的工程路径。
解决人脸内部的复合退化后,算法还需直面拍摄环境中高频出现的光学干扰,反光消除赛道的技术攻坚正是对这一物理层难题的直接回应。小米团队摒弃了传统去反射算法依赖局部滤波或固定先验的局限,对XReflection框架中的RDNet架构进行骨干扩容,将基础网络由FocalNet-L升级至FocalNet-XL。参数规模的扩张并非盲目堆叠,其工程意图在于激活更强的多尺度特征表征与全局上下文建模能力,使网络在复杂光照叠加镜面反射的混合场景中,能够精准剥离反射层并完整保留底层高频纹理。
面对强反光、多重折射等模型极易失效的困难样本,团队引入扩散模型知识蒸馏策略构建数据闭环。技术路径严格遵循工程对齐逻辑:首先调用WindowSeat与DAI等扩散模型SOTA方案处理海量开源图像,生成1000对高质量反光消除伪标签;其次执行域对齐,将每张含反射图像送入与教师模型一致的VAE编解码器,以重建图像作为学生网络输入,彻底抹平生成域与判别域的特征偏差;最后将扩散模型的输出作为教师信号,对已完成基线训练的模型执行额外蒸馏训练。该流程将生成模型的强泛化能力高效迁移至判别网络,显著压低了困难样本的预测方差。
高分辨率图像训练常伴随梯度震荡与收敛困难,为此方案采用384×384至512×512再到768×768的三阶段渐进式分辨率训练。模型先在低分辨率下捕获局部反射先验,再逐步扩大感受野以理解全局光照结构,有效规避了直接大分辨率端到端训练的不稳定性。该架构在CVPR 2026主观评测中斩获4.31分位列第二,多项客观指标登顶。骨干扩容、蒸馏迁移与渐进式优化的组合拳再次印证,大模型影像管线无需依赖冗余算力堆砌,仅通过数据蒸馏与训练范式的工程化重组,即可在强干扰场景下输出稳定可靠的端侧可用结果。
超分、人像与反光消除三条技术路径的交叉验证,清晰勾勒出大模型影像算法从实验室指标向端侧可用迁移的底层逻辑。传统生成式管线长期依赖参数量堆砌与多步迭代采样换取画质上限,却在移动端遭遇显存带宽、热功耗与推理延迟的物理墙。此次架构演进的核心价值,在于用工程化调度替代了暴力计算。无论是SPANV2将注意力访存压缩至单次读写、双阶段级联将数十步马尔可夫采样坍缩为单步前向传播,还是RDNet-XL通过蒸馏与渐进训练将复杂求解前置,均指向同一目标:在脱离算力无限扩张的前提下,重构画质保真与推理效率的平衡方程。
实验室榜单的客观分数与主观评测仅是验证起点,芯片端的可用边界由内存带宽利用率、单帧延迟与功耗曲线共同划定。当自适应网络实现局部算力动态分配,当知识蒸馏完成特征对齐的降维迁移,大模型影像技术正式摆脱重训轻部署的路径依赖。玄戒多媒体算法与大模型团队的联合方案证明,移动端影像管线无需等待制程红利或外挂独立NPU,仅通过算子融合、架构解耦与训练范式压缩,即可在现有SoC算力池内实现高画质响应。从学术刷榜到端侧落地,影像大模型的竞争维度已实质性切换至访存效率、单步生成与轻量化蒸馏,高效部署正在成为算法演进的硬性工程指标。小米连夺CVPR三项大奖,大模型影像算法突破效率瓶颈
大模型动态
CVPR 2026
图像超分
人像修复
大模型应用
端侧AI
本文直击小米在CVPR 2026 NTIRE赛事中斩获三项技术奖项的核心突破。文章将跳出常规的奖项通报模式,深入拆解SPANV2自适应超分、双阶段级联人像修复及RDNet-XL反光消除背后的技术路径。行文将穿插“一键修复压缩模糊的家族老照片”与“自动剥离旅行橱窗强反光”两个具体操作场景,让读者直观感知算法如何应对复合退化与身份漂移。通过剖析芯片软硬协同、单步扩散与知识蒸馏策略,客观评估大模型影像技术如何摆脱参数堆砌,转向兼顾画质与推理效率的端侧实战,为计算摄影的下一代演进提供技术注脚。
小米在CVPR 2026 NTIRE赛事中斩获高效超分赛道冠军、人像修复赛道冠军与反光消除赛道亚军,三项技术成果由玄戒多媒体算法团队与大模型应用团队联合交付。此次技术突破并非学术榜单的常规刷榜,而是面向端侧部署的算力瓶颈攻坚。面对移动终端严苛的功耗与显存带宽限制,团队将芯片级多媒体优化逻辑与大模型生成范式深度耦合,在推理延迟、计算开销与画质保真度之间重建工程平衡。
超分方案摒弃全局固定处理策略,引入内容自适应精修机制,并将注意力计算的显存读写频次由三次合并为一次,直接削减底层数据搬运开销;人像修复采用双阶段级联架构叠加单步扩散细化,将传统多步采样压缩至单步推理,在修复复合退化的同时锁定五官拓扑结构;反光消除方案依托RDNet-XL骨干网络升级与扩散模型知识蒸馏,配合渐进式多分辨率训练稳定强反射场景的优化梯度。三条技术路线共享同一底层逻辑:通过自适应网络调度、单步扩散生成与知识蒸馏压缩,验证大模型影像算法可在脱离暴力堆参的前提下,实现端侧可用的效率跃升与鲁棒性重构。相关技术权重与架构设计已同步释放,直接指向移动端影像管线的轻量化部署路径。
剥离赛事排名的表层光环,高效超分赛道的冠军方案 SPANV2 直接切中了移动端影像管线的算力痛点。该方案以 4.43 的综合评分登顶,其核心并非堆砌参数,而是对底层计算范式的工程化重构。传统超分模型多采用全局统一的特征处理策略,导致平滑区域算力冗余而高频纹理区域修复不足。SPANV2 引入内容自适应精修机制,网络在特征提取阶段即对局部退化程度与纹理复杂度进行动态评估,据此分配计算权重。模型能够自动识别边缘、文字或复杂结构等高敏感区域并集中算力介入,在剔除无效计算的同时锁定关键细节的重建精度。
算力调度优化的另一重抓手直指显存带宽瓶颈。在标准注意力机制中,特征矩阵的聚合通常伴随三次独立的显存读写操作,频繁的数据搬运在端侧芯片上会直接阻塞推理管线。SPANV2 通过底层算子融合与内存布局重写,将注意力计算的访存步骤合并为单次完成。这一改动大幅削减了重复的数据搬运开销,使计算单元能够更长时间驻留数据,直接拉升内存带宽利用率。自适应路由与单次读写双管齐下,使模型在画质保真度几乎无损的前提下,推理延迟与计算量实现同步压降。该架构演进证明,超分任务完全可以通过访存优化与动态调度,在脱离暴力堆参的路径下达成端侧可用的效率跃升。
超分赛道解决的是“看得清”的效率问题,而人像修复则需直面“修得准”的身份保真挑战。真实场景中的老照片往往叠加了模糊、压缩伪影、噪声与低分辨率等复合退化,若依赖传统端到端生成模型直接一步输出,极易在特征对齐过程中引发五官拓扑结构漂移,甚至导致身份特征丢失。小米大模型应用团队给出的工程解法是结构解耦与推理压缩:采用双阶段级联框架叠加单步扩散细化机制,将修复任务拆解为骨相重建与皮相精修两条独立计算管线。
第一阶段依托OSDFace网络执行粗修复与结构锚定。该模块不追求像素级的高频渲染,而是专注于面部关键点的空间布局恢复与严重退化区域的几何校正。通过强制约束面部结构先验,模型在强噪声干扰下仍能输出稳定的五官骨架,从根本上切断特征发散与结构漂移的传播路径。第二阶段接入Z-Image单步扩散模型进行高频细节注入。传统扩散模型为逼近真实数据分布需执行数十步迭代采样,推理延迟极高且长链条容易累积生成误差。团队将多步扩散过程压缩至单步推理,在锁定第一阶段几何输出的前提下,仅针对皮肤肌理、发丝走向与边缘轮廓进行高频补偿。这一架构改动将生成模型的算力开销呈指数级压降,同时规避了多步采样带来的身份失真风险。
在无参考图像质量与身份一致性综合评测中,该方案以结构稳定性与细节真实度的双优表现拿下赛道冠军。双阶段级联并非简单的模块拼接,而是通过解耦结构生成与纹理渲染的计算图,使大模型摆脱了对全局暴力计算的依赖。单步扩散的引入直接打通了生成质量与端侧推理效率的壁垒,证明复杂人像修复任务完全可以通过架构级调度优化,在严控五官拓扑约束的前提下实现低延迟响应,为移动端影像管线提供了可规模部署的工程路径。
解决人脸内部的复合退化后,算法还需直面拍摄环境中高频出现的光学干扰,反光消除赛道的技术攻坚正是对这一物理层难题的直接回应。小米团队摒弃了传统去反射算法依赖局部滤波或固定先验的局限,对XReflection框架中的RDNet架构进行骨干扩容,将基础网络由FocalNet-L升级至FocalNet-XL。参数规模的扩张并非盲目堆叠,其工程意图在于激活更强的多尺度特征表征与全局上下文建模能力,使网络在复杂光照叠加镜面反射的混合场景中,能够精准剥离反射层并完整保留底层高频纹理。
面对强反光、多重折射等模型极易失效的困难样本,团队引入扩散模型知识蒸馏策略构建数据闭环。技术路径严格遵循工程对齐逻辑:首先调用WindowSeat与DAI等扩散模型SOTA方案处理海量开源图像,生成1000对高质量反光消除伪标签;其次执行域对齐,将每张含反射图像送入与教师模型一致的VAE编解码器,以重建图像作为学生网络输入,彻底抹平生成域与判别域的特征偏差;最后将扩散模型的输出作为教师信号,对已完成基线训练的模型执行额外蒸馏训练。该流程将生成模型的强泛化能力高效迁移至判别网络,显著压低了困难样本的预测方差。
高分辨率图像训练常伴随梯度震荡与收敛困难,为此方案采用384×384至512×512再到768×768的三阶段渐进式分辨率训练。模型先在低分辨率下捕获局部反射先验,再逐步扩大感受野以理解全局光照结构,有效规避了直接大分辨率端到端训练的不稳定性。该架构在CVPR 2026主观评测中斩获4.31分位列第二,多项客观指标登顶。骨干扩容、蒸馏迁移与渐进式优化的组合拳再次印证,大模型影像管线无需依赖冗余算力堆砌,仅通过数据蒸馏与训练范式的工程化重组,即可在强干扰场景下输出稳定可靠的端侧可用结果。
超分、人像与反光消除三条技术路径的交叉验证,清晰勾勒出大模型影像算法从实验室指标向端侧可用迁移的底层逻辑。传统生成式管线长期依赖参数量堆砌与多步迭代采样换取画质上限,却在移动端遭遇显存带宽、热功耗与推理延迟的物理墙。此次架构演进的核心价值,在于用工程化调度替代了暴力计算。无论是SPANV2将注意力访存压缩至单次读写、双阶段级联将数十步马尔可夫采样坍缩为单步前向传播,还是RDNet-XL通过蒸馏与渐进训练将复杂求解前置,均指向同一目标:在脱离算力无限扩张的前提下,重构画质保真与推理效率的平衡方程。
实验室榜单的客观分数与主观评测仅是验证起点,芯片端的可用边界由内存带宽利用率、单帧延迟与功耗曲线共同划定。当自适应网络实现局部算力动态分配,当知识蒸馏完成特征对齐的降维迁移,大模型影像技术正式摆脱重训轻部署的路径依赖。玄戒多媒体算法与大模型团队的联合方案证明,移动端影像管线无需等待制程红利或外挂独立NPU,仅通过算子融合、架构解耦与训练范式压缩,即可在现有SoC算力池内实现高画质响应。从学术刷榜到端侧落地,影像大模型的竞争维度已实质性切换至访存效率、单步生成与轻量化蒸馏,高效部署正在成为算法演进的硬性工程指标。
剥离赛事排名的表层光环,高效超分赛道的冠军方案 SPANV2 直接切中了移动端影像管线的算力痛点。该方案以 4.43 的综合评分登顶,其核心并非堆砌参数,而是对底层计算范式的工程化重构。传统超分模型多采用全局统一的特征处理策略,导致平滑区域算力冗余而高频纹理区域修复不足。SPANV2 引入内容自适应精修机制,网络在特征提取阶段即对局部退化程度与纹理复杂度进行动态评估,据此分配计算权重。模型能够自动识别边缘、文字或复杂结构等高敏感区域并集中算力介入,在剔除无效计算的同时锁定关键细节的重建精度。
算力调度优化的另一重抓手直指显存带宽瓶颈。在标准注意力机制中,特征矩阵的聚合通常伴随三次独立的显存读写操作,频繁的数据搬运在端侧芯片上会直接阻塞推理管线。SPANV2 通过底层算子融合与内存布局重写,将注意力计算的访存步骤合并为单次完成。这一改动大幅削减了重复的数据搬运开销,使计算单元能够更长时间驻留数据,直接拉升内存带宽利用率。自适应路由与单次读写双管齐下,使模型在画质保真度几乎无损的前提下,推理延迟与计算量实现同步压降。该架构演进证明,超分任务完全可以通过访存优化与动态调度,在脱离暴力堆参的路径下达成端侧可用的效率跃升。
超分赛道解决的是“看得清”的效率问题,而人像修复则需直面“修得准”的身份保真挑战。真实场景中的老照片往往叠加了模糊、压缩伪影、噪声与低分辨率等复合退化,若依赖传统端到端生成模型直接一步输出,极易在特征对齐过程中引发五官拓扑结构漂移,甚至导致身份特征丢失。小米大模型应用团队给出的工程解法是结构解耦与推理压缩:采用双阶段级联框架叠加单步扩散细化机制,将修复任务拆解为骨相重建与皮相精修两条独立计算管线。
第一阶段依托OSDFace网络执行粗修复与结构锚定。该模块不追求像素级的高频渲染,而是专注于面部关键点的空间布局恢复与严重退化区域的几何校正。通过强制约束面部结构先验,模型在强噪声干扰下仍能输出稳定的五官骨架,从根本上切断特征发散与结构漂移的传播路径。第二阶段接入Z-Image单步扩散模型进行高频细节注入。传统扩散模型为逼近真实数据分布需执行数十步迭代采样,推理延迟极高且长链条容易累积生成误差。团队将多步扩散过程压缩至单步推理,在锁定第一阶段几何输出的前提下,仅针对皮肤肌理、发丝走向与边缘轮廓进行高频补偿。这一架构改动将生成模型的算力开销呈指数级压降,同时规避了多步采样带来的身份失真风险。
在无参考图像质量与身份一致性综合评测中,该方案以结构稳定性与细节真实度的双优表现拿下赛道冠军。双阶段级联并非简单的模块拼接,而是通过解耦结构生成与纹理渲染的计算图,使大模型摆脱了对全局暴力计算的依赖。单步扩散的引入直接打通了生成质量与端侧推理效率的壁垒,证明复杂人像修复任务完全可以通过架构级调度优化,在严控五官拓扑约束的前提下实现低延迟响应,为移动端影像管线提供了可规模部署的工程路径。
解决人脸内部的复合退化后,算法还需直面拍摄环境中高频出现的光学干扰,反光消除赛道的技术攻坚正是对这一物理层难题的直接回应。小米团队摒弃了传统去反射算法依赖局部滤波或固定先验的局限,对XReflection框架中的RDNet架构进行骨干扩容,将基础网络由FocalNet-L升级至FocalNet-XL。参数规模的扩张并非盲目堆叠,其工程意图在于激活更强的多尺度特征表征与全局上下文建模能力,使网络在复杂光照叠加镜面反射的混合场景中,能够精准剥离反射层并完整保留底层高频纹理。
面对强反光、多重折射等模型极易失效的困难样本,团队引入扩散模型知识蒸馏策略构建数据闭环。技术路径严格遵循工程对齐逻辑:首先调用WindowSeat与DAI等扩散模型SOTA方案处理海量开源图像,生成1000对高质量反光消除伪标签;其次执行域对齐,将每张含反射图像送入与教师模型一致的VAE编解码器,以重建图像作为学生网络输入,彻底抹平生成域与判别域的特征偏差;最后将扩散模型的输出作为教师信号,对已完成基线训练的模型执行额外蒸馏训练。该流程将生成模型的强泛化能力高效迁移至判别网络,显著压低了困难样本的预测方差。
高分辨率图像训练常伴随梯度震荡与收敛困难,为此方案采用384×384至512×512再到768×768的三阶段渐进式分辨率训练。模型先在低分辨率下捕获局部反射先验,再逐步扩大感受野以理解全局光照结构,有效规避了直接大分辨率端到端训练的不稳定性。该架构在CVPR 2026主观评测中斩获4.31分位列第二,多项客观指标登顶。骨干扩容、蒸馏迁移与渐进式优化的组合拳再次印证,大模型影像管线无需依赖冗余算力堆砌,仅通过数据蒸馏与训练范式的工程化重组,即可在强干扰场景下输出稳定可靠的端侧可用结果。
超分、人像与反光消除三条技术路径的交叉验证,清晰勾勒出大模型影像算法从实验室指标向端侧可用迁移的底层逻辑。传统生成式管线长期依赖参数量堆砌与多步迭代采样换取画质上限,却在移动端遭遇显存带宽、热功耗与推理延迟的物理墙。此次架构演进的核心价值,在于用工程化调度替代了暴力计算。无论是SPANV2将注意力访存压缩至单次读写、双阶段级联将数十步马尔可夫采样坍缩为单步前向传播,还是RDNet-XL通过蒸馏与渐进训练将复杂求解前置,均指向同一目标:在脱离算力无限扩张的前提下,重构画质保真与推理效率的平衡方程。
实验室榜单的客观分数与主观评测仅是验证起点,芯片端的可用边界由内存带宽利用率、单帧延迟与功耗曲线共同划定。当自适应网络实现局部算力动态分配,当知识蒸馏完成特征对齐的降维迁移,大模型影像技术正式摆脱重训轻部署的路径依赖。玄戒多媒体算法与大模型团队的联合方案证明,移动端影像管线无需等待制程红利或外挂独立NPU,仅通过算子融合、架构解耦与训练范式压缩,即可在现有SoC算力池内实现高画质响应。从学术刷榜到端侧落地,影像大模型的竞争维度已实质性切换至访存效率、单步生成与轻量化蒸馏,高效部署正在成为算法演进的硬性工程指标。