MiniMax-H3 Ref2VA 的 zero-shot 边界

同一个模型、同一条 image 参考通道,在两个任务上都能造出真实细节, 但失败的方式完全不同:视频超分的问题是不稳定,黑白电影着色的问题是代价。 本页把每组的全部输入(参考视频 / 参考图 / 文本 prompt)和输出并排放在一起,可逐帧对比。

MiniMax-H3 33.1B DiTRef2VA partition 单卡 H20050 steps · flow_shift 12zero-shot,无微调

一句话结论

⚠ 超分感知质量 7/10 明显更好,最好的几条 DISTS 优于专用模型均值;但 2/10 失败且不可预判
✓ 着色彩度 0 → 38,代价是亮度相关 0.999 → 0.93
⚠ 风格迁移能改光和色(赛博朋克两臂皆成),改不动笔触和媒材(水墨零反应)
共同的缺口三个任务都卡在同一处:成败不可预判,缺失败检测 / 多 seed 取优

超分不是没效果。十条 UDM10 里七条的感知指标明显优于双三次插值, 其中 udm10_003 / 006 的 DISTS(0.0876 / 0.0811)比专用 VSR 模型 SparkVSR api_ref 的均值(0.171)还好,肉眼看也确实清晰自然。真正的问题是 同一套配置、同一个 seed,另外两条会失败,而且事前无从判断会落在哪一边—— PSNR 全线下降是重绘内容的必然代价,不是画质判据。

两个任务的表现差异则来自「目标信息在输入中存不存在」:超分要补的高频本就藏在输入的模糊里, 模型容易把模糊当成内容去复现;着色要补的颜色在黑白输入中根本不存在,"复制输入"这条捷径不成立, Ref2VA 的生成倾向于是从缺陷变成了正需求。

方法与口径

说明
参考视频的固有限制_resolve_reference_video_shape 把任何 video 参考强制缩到短边 768 / 面积 ≤768×1344,所以它不可能承载高分辨率信息;实测它的作用是提供运动(运动保持 31% → 79%)
参考图的通道image 参考保留到短边 2048,且会同时被 Qwen3-VL(语义)和 video VAE(空间 token)编码两次
着色任务的评测没有彩色 GT,但亮度通道天然是 GT:PSNR-Y 对 gray(bicubic 输入) 算。已做两步去混淆——把输出降采样回原分辨率消掉超分惩罚、逐帧匹配亮度均值/标准差分离色调偏移
时序adj=相邻帧平均绝对差,drift=末帧相对首帧偏离。只用无参考指标会给出方向性错误的排序:某变体 NIQE/MUSIQ 全场最佳,实为把参考帧复制 32 遍的静止画面
样本量超分结论基于 UDM10 全 10 条;着色仅 2 条,只能作待验假设。本项目已有三次从 n≤2 外推被推翻的记录

模型与版本

所有实验的权重、代码与依赖版本。2026-05 那批 SparkVSR 结果原本没有留下 checkpoint 记录, 本次用确定性模式逐帧比对(47.7 dB)才确认出处 —— 此后新产出一律附 run_config.json

组件版本 / 出处用途
MiniMax-H3 MiniMax/MiniMax-H3(ModelScope,269 GB 本地)
两个 partition:Ref2VA/FL2VA/,各含 DiT 33.12B + text encoder 25.75B + video VAE 2.60B + audio VAE 0.151B
全量 bf16,无量化
本站全部生成结果
H3 · Ref2VADiT 与 FL2VA 不同;text encoder / VAE / processor 与 FL2VA 逐片段完全相同(实测,与上游文档描述不符) 超分 / 着色 / 风格 / 人脸的全部臂
H3 · FL2VA同上;keyframe_indices 仅接受 0 或 −1综合评测的区域生成与首尾关键帧任务
DiffSynth-Studio 上游 3f3df52(2026-08-25)+ 本项目两个 patch,共 +56/−10
denoising_strength 开放 v2v 入口(原被一行 training gate 挡住)
inpaint_mask_video 空间 mask 入口 —— H3 官方只有时间维 retake,没有 in/outpainting 接口
两处均验证 =None 时与原版逐比特等价
推理框架
nano-banana-profal-ai/nano-banana-pro/edit(fal.ai,付费 API) 生成全部 image 参考帧。产物不可复现(随机采样)
SparkVSR checkpoints/sparkvsr-s2/ckpt-500-sft(S2)
出处已验证:用 --ref_mode no_ref 确定性模式重跑并与 2026-05 那批逐帧比对,PSNR 47.7 dB(同 ckpt 的量级;不同 ckpt 会在 30 dB 以下)
专用 VSR 模型对照
Qwen3-VL-4B-Instruct本地权重生成场景描述与逐人脸 <Subject N> 描述
指标模型pyiqa 0.1.15(LPIPS / DISTS / NIQE / MUSIQ / CLIPIQA)· CLIP ViT-B/32(风格贴合度)· facexlib 0.3.0 RetinaFace-R50(人脸检测)评测
运行环境Python 3.11.15 · torch 2.12.1+cu130 · transformers 5.15.1(生成)
torch 2.5.0+cu124(评测环境)
硬件单卡 NVIDIA H200(143 GB)。峰值显存 63–77 GB,无需多卡、无需量化;两个 pipeline 均不支持多卡并行推理,多卡只用于并行跑不同实验
采样参数除特别标注外:50 步 · flow_shift 12 · seed 0 · cfg 1.0。约束:height/width 须为 32 的倍数,num_frames 须为 17n+5