同一个模型、同一条 image 参考通道,在两个任务上都能造出真实细节,
但失败的方式完全不同:视频超分的问题是不稳定,黑白电影着色的问题是代价。
本页把每组的全部输入(参考视频 / 参考图 / 文本 prompt)和输出并排放在一起,可逐帧对比。
超分不是没效果。十条 UDM10 里七条的感知指标明显优于双三次插值,
其中 udm10_003 / 006 的 DISTS(0.0876 / 0.0811)比专用 VSR 模型
SparkVSR api_ref 的均值(0.171)还好,肉眼看也确实清晰自然。真正的问题是
同一套配置、同一个 seed,另外两条会失败,而且事前无从判断会落在哪一边——
PSNR 全线下降是重绘内容的必然代价,不是画质判据。
两个任务的表现差异则来自「目标信息在输入中存不存在」:超分要补的高频本就藏在输入的模糊里,
模型容易把模糊当成内容去复现;着色要补的颜色在黑白输入中根本不存在,"复制输入"这条捷径不成立,
Ref2VA 的生成倾向于是从缺陷变成了正需求。
| 项 | 说明 |
|---|---|
| 参考视频的固有限制 | _resolve_reference_video_shape 把任何 video 参考强制缩到短边 768 / 面积 ≤768×1344,所以它不可能承载高分辨率信息;实测它的作用是提供运动(运动保持 31% → 79%) |
| 参考图的通道 | image 参考保留到短边 2048,且会同时被 Qwen3-VL(语义)和 video VAE(空间 token)编码两次 |
| 着色任务的评测 | 没有彩色 GT,但亮度通道天然是 GT:PSNR-Y 对 gray(bicubic 输入) 算。已做两步去混淆——把输出降采样回原分辨率消掉超分惩罚、逐帧匹配亮度均值/标准差分离色调偏移 |
| 时序 | adj=相邻帧平均绝对差,drift=末帧相对首帧偏离。只用无参考指标会给出方向性错误的排序:某变体 NIQE/MUSIQ 全场最佳,实为把参考帧复制 32 遍的静止画面 |
| 样本量 | 超分结论基于 UDM10 全 10 条;着色仅 2 条,只能作待验假设。本项目已有三次从 n≤2 外推被推翻的记录 |