小米MiLM Plus发布PROVE:感知对齐物体移除评估指标RC-S与RC-T及真实世界视频基准
小米MiLM Plus团队推出PROVE评估框架,包含RC-S和RC-T两个感知对齐指标及PROVE-Bench视频基准,解决物体移除模型评估难题。无需参考视频,RC-S在人类排序相关性上远超ReMOVE和CFD,Apache 2.0开源,适合模型对比和CI门控。
一句话看懂
小米MiLM Plus团队发布PROVE评估框架,用RC-S和RC-T两个指标解决物体移除模型“效果越好越难评”的问题,并附带真实世界视频基准PROVE-Bench。
详细发生了什么
物体移除模型(比如扩散模型擦除器)进步很快,但评估指标没跟上。PSNR、SSIM、LPIPS、ReMOVE和CFD这些传统指标经常给出错误排序。原因在于擦除是个“一对多”的病态任务,不存在唯一正确答案。
为此,小米MiLM Plus团队在ACM MM 2026上发布了PROVE(Perceptual RemOVal cohErence)。它包含两个感知对齐指标:RC-S(空间一致性)和RC-T(时间一致性),外加一个双层真实世界视频基准PROVE-Bench。
RC-S和RC-T的核心思路是在DINOv2特征空间里做局部分布匹配,而不是全局聚合。RC-S用连通组件分析把掩码拆成独立目标,在扩展的边界框内滑动窗口计算MMD(最大均值差异)。RC-T则联合裁剪相邻帧,只在掩码交集区域算MMD。两者都不需要参考视频。
在20名参与者的人类排序对比中,RC-S的平均Kendall’s τ达到0.59,Spearman’s ρ为0.66,远超ReMOVE(0.26/0.29)和CFD(0.16/0.18)。RC-S在六个基准中的五个排名第一,而且对模糊扰动呈单调下降,ReMOVE和CFD反而会奖励模糊。PROVE-Bench包含80个成对视频(PROVE-M)和100个无真实值的困难视频(PROVE-H),都是1080p真实场景。代码以Apache 2.0协议开源,RC-S在RTX 4090上跑134.6毫秒/帧,比CFD快13.7倍。
中文圈视角
对国内AI开发者来说,这个工具很实用。它完全开源,而且不需要参考视频,任何有GPU的团队都能快速上手。短视频编辑、电商图片清理、地图隐私脱敏这些场景都能用。国内类似工具,比如美图、字节的编辑模型,可以借此建立更可靠的评估流程。
RC-S和RC-T的设计对中文内容生态也有直接价值。比如在抖音、快手的视频编辑里,时间一致性指标RC-T能有效检测闪烁伪影,提升用户体验。不过要注意,DINOv2权重和Hugging Face数据集可能需要特殊网络环境,但GitHub代码可以直接访问。相比国内常用的PSNR等指标,PROVE更贴近人类感知,有助于国产模型在效果对比中脱颖而出。
几条值得记住的细节
- RC-S在人类排序相关性上达到0.59平均Kendall’s τ,ReMOVE只有0.26,CFD只有0.16。
- RC-S在RORD-Val上100%偏好干净图像,而ReMOVE在模糊下只有60.06%,CFD为49.27%。
- PROVE-Bench包含80个运动增强的成对视频和100个无真实值的困难视频,全部为1080p。
- 代码以Apache 2.0协议开源,需要Python 3.10+、PyTorch 2.6+、Transformers 4.51+和DINOv2-giant权重。
- RC-S运行速度134.6毫秒/帧,比CFD快13.7倍,适合夜间CI门控。
一句话总结
小米开源的PROVE让物体移除效果评估更贴近人眼,国内开发者可以低成本接入,提升模型迭代效率。