AI 快讯 编译自 marktechpost #模型评估#视频编辑#开源工具

小米MiLM Plus发布PROVE:感知对齐物体移除评估指标RC-S与RC-T及真实世界视频基准

小米MiLM Plus团队推出PROVE评估框架,包含RC-S和RC-T两个感知对齐指标及PROVE-Bench视频基准,解决物体移除模型评估难题。无需参考视频,RC-S在人类排序相关性上远超ReMOVE和CFD,Apache 2.0开源,适合模型对比和CI门控。

编译发布 2026/08/12 原文发布 2026/08/12

一句话看懂

小米MiLM Plus团队发布PROVE评估框架,用RC-S和RC-T两个指标解决物体移除模型“效果越好越难评”的问题,并附带真实世界视频基准PROVE-Bench。

详细发生了什么

物体移除模型(比如扩散模型擦除器)进步很快,但评估指标没跟上。PSNR、SSIM、LPIPS、ReMOVE和CFD这些传统指标经常给出错误排序。原因在于擦除是个“一对多”的病态任务,不存在唯一正确答案。

为此,小米MiLM Plus团队在ACM MM 2026上发布了PROVE(Perceptual RemOVal cohErence)。它包含两个感知对齐指标:RC-S(空间一致性)和RC-T(时间一致性),外加一个双层真实世界视频基准PROVE-Bench。

RC-S和RC-T的核心思路是在DINOv2特征空间里做局部分布匹配,而不是全局聚合。RC-S用连通组件分析把掩码拆成独立目标,在扩展的边界框内滑动窗口计算MMD(最大均值差异)。RC-T则联合裁剪相邻帧,只在掩码交集区域算MMD。两者都不需要参考视频。

在20名参与者的人类排序对比中,RC-S的平均Kendall’s τ达到0.59,Spearman’s ρ为0.66,远超ReMOVE(0.26/0.29)和CFD(0.16/0.18)。RC-S在六个基准中的五个排名第一,而且对模糊扰动呈单调下降,ReMOVE和CFD反而会奖励模糊。PROVE-Bench包含80个成对视频(PROVE-M)和100个无真实值的困难视频(PROVE-H),都是1080p真实场景。代码以Apache 2.0协议开源,RC-S在RTX 4090上跑134.6毫秒/帧,比CFD快13.7倍。

中文圈视角

对国内AI开发者来说,这个工具很实用。它完全开源,而且不需要参考视频,任何有GPU的团队都能快速上手。短视频编辑、电商图片清理、地图隐私脱敏这些场景都能用。国内类似工具,比如美图、字节的编辑模型,可以借此建立更可靠的评估流程。

RC-S和RC-T的设计对中文内容生态也有直接价值。比如在抖音、快手的视频编辑里,时间一致性指标RC-T能有效检测闪烁伪影,提升用户体验。不过要注意,DINOv2权重和Hugging Face数据集可能需要特殊网络环境,但GitHub代码可以直接访问。相比国内常用的PSNR等指标,PROVE更贴近人类感知,有助于国产模型在效果对比中脱颖而出。

几条值得记住的细节

  • RC-S在人类排序相关性上达到0.59平均Kendall’s τ,ReMOVE只有0.26,CFD只有0.16。
  • RC-S在RORD-Val上100%偏好干净图像,而ReMOVE在模糊下只有60.06%,CFD为49.27%。
  • PROVE-Bench包含80个运动增强的成对视频和100个无真实值的困难视频,全部为1080p。
  • 代码以Apache 2.0协议开源,需要Python 3.10+、PyTorch 2.6+、Transformers 4.51+和DINOv2-giant权重。
  • RC-S运行速度134.6毫秒/帧,比CFD快13.7倍,适合夜间CI门控。

一句话总结

小米开源的PROVE让物体移除效果评估更贴近人眼,国内开发者可以低成本接入,提升模型迭代效率。