MiniMax-H3 Ref2VA 的 zero-shot 边界

同一个模型、同一条 image 参考通道,在两个任务上都能造出真实细节, 但失败的方式完全不同:视频超分的问题是不稳定,黑白电影着色的问题是代价。 本页把每组的全部输入(参考视频 / 参考图 / 文本 prompt)和输出并排放在一起,可逐帧对比。

MiniMax-H3 33.1B DiTRef2VA partition 单卡 H20050 steps · flow_shift 12zero-shot,无微调

一句话结论

⚠ 超分感知质量 7/10 明显更好,最好的几条 DISTS 优于专用模型均值;但 2/10 失败且不可预判
✓ 着色彩度 0 → 38,代价是亮度相关 0.999 → 0.93
缺的那一步超分离可用只差失败检测 / 多 seed 取优

超分不是没效果。十条 UDM10 里七条的感知指标明显优于双三次插值, 其中 udm10_003 / 006 的 DISTS(0.0876 / 0.0811)比专用 VSR 模型 SparkVSR api_ref 的均值(0.171)还好,肉眼看也确实清晰自然。真正的问题是 同一套配置、同一个 seed,另外两条会失败,而且事前无从判断会落在哪一边—— PSNR 全线下降是重绘内容的必然代价,不是画质判据。

两个任务的表现差异则来自「目标信息在输入中存不存在」:超分要补的高频本就藏在输入的模糊里, 模型容易把模糊当成内容去复现;着色要补的颜色在黑白输入中根本不存在,"复制输入"这条捷径不成立, Ref2VA 的生成倾向于是从缺陷变成了正需求。

方法与口径

说明
参考视频的固有限制_resolve_reference_video_shape 把任何 video 参考强制缩到短边 768 / 面积 ≤768×1344,所以它不可能承载高分辨率信息;实测它的作用是提供运动(运动保持 31% → 79%)
参考图的通道image 参考保留到短边 2048,且会同时被 Qwen3-VL(语义)和 video VAE(空间 token)编码两次
着色任务的评测没有彩色 GT,但亮度通道天然是 GT:PSNR-Y 对 gray(bicubic 输入) 算。已做两步去混淆——把输出降采样回原分辨率消掉超分惩罚、逐帧匹配亮度均值/标准差分离色调偏移
时序adj=相邻帧平均绝对差,drift=末帧相对首帧偏离。只用无参考指标会给出方向性错误的排序:某变体 NIQE/MUSIQ 全场最佳,实为把参考帧复制 32 遍的静止画面
样本量超分结论基于 UDM10 全 10 条;着色仅 2 条,只能作待验假设。本项目已有三次从 n≤2 外推被推翻的记录