DVD-Quant 论文解读:无需校准数据的视频 DiT 低比特量化

Date 2026-10-05 · Category blog · Status finished · Confidence likely
论文解读, 模型量化, 视频生成

视频扩散 Transformer 从噪声出发,经过多轮去噪生成视频。每一步都需要处理大量空间与时间特征,模型参数和中间激活也需要显存。把数值压缩成低比特格式,有机会减少存储和计算成本,但过于粗糙的近似可能破坏最终画面。

DVD-Quant 将这个问题拆成三部分:用 BGR 改善权重的量化刻度,用 ARQ 根据当前激活调整数值分布,用 δ-GBS 决定哪些去噪步骤使用更高精度。本文沿着图 1 的问题、图 2 的框架、三个模块和实验消融展开。文中的教学算例用于解释机制,实验数字均来自原论文报告,未经独立复现。

论文信息与关键术语

项目 信息
题目 DVD-Quant: Data-free Video Diffusion Transformers Quantization
作者 Zhiteng Li、Hanxuan Li、Junyi Wu、Kai Liu、Haotong Qin、Linghe Kong、Guihai Chen、Yulun Zhang、Xiaokang Yang
单位 上海交通大学、浙江大学、苏黎世联邦理工学院
本文依据 arXiv:2505.18663v4,2026 年 3 月 6 日版本,PDF 共 13 页
论文状态 该版本 PDF 标注 Published as a conference paper at ICLR 2026
主要实验模型 HunyuanVideo;正文还提到 Wan2.1,详细结果指向补充材料
原文 固定版本 PDF
术语 含义
Video DiT 视频扩散 Transformer,在多个去噪步骤中处理视频特征
PTQ Post-Training Quantization,训练后量化
W4A4 权重与激活均使用 4 bit 量化格式;具体保留精度的算子仍需以实现为准
W4A6 本文的混合精度配置:不同步骤使用 A4 或 A8,平均激活位宽约为 6 bit
Data-free 不需要预先准备离线校准数据集;推理时仍使用当前输入和激活统计
BGR Bounded-init Grid Refinement,边界搜索初始化与量化网格细化
ARQ Auto-scaling Rotated Quantization,自动缩放的旋转量化
δ-GBS δ-Guided Bit Switching,根据累计特征变化切换激活位宽

1. 目标与动机:低比特为何容易破坏视频

视频生成的成本来自两个因素叠加。首先,视频包含多个帧,空间分辨率与帧数增加会扩大特征序列。其次,扩散生成反复运行模型,即使一次前向只节省部分计算,多个去噪步骤也可能累积成可观收益。

PTQ 可以在已有模型上进行压缩,但既有视频量化方法存在两个问题。离线校准需要先运行样例、收集激活统计,准备成本较高;激活分布又随去噪步骤变化,固定缩放参数不一定适合当前步骤。另一方面,把激活进一步压到 4 bit 后,生成质量可能明显下降。

4 bit 只有 16 种编码。量化要用这些有限的档位近似连续数值,因此数值范围、档位间距、异常大值及时间变化都很重要。

原论文图 1:BF16 与不同量化方法在雪山视频上的比较

原论文图 1,PDF 第 1 页。上方是 BF16 参考,下方三列分别为 MinMax、ViDiT-Q 和 DVD-Quant。量化结果第一行为 W4A8 对照与 DVD-Quant 的平均 W4A6,第二行统一为 W4A4。

第一行的对照还能保留山体,但纹理有所损失;到了 W4A4,MinMax 出现杂乱色块,ViDiT-Q 也有明显结构扭曲。DVD-Quant 保留了较清楚的山体与纹理。图中的成像质量分数如下:

方法 较高激活精度配置 成像质量 W4A4 成像质量
MinMax W4A8 60.62 24.78
ViDiT-Q W4A8 59.72 40.10
DVD-Quant 平均 W4A6 64.22 61.82

图 1 展示整体方法的视觉优势,但没有独立分离三个模块的贡献,也没有展示速度。模块作用需要结合后面的消融,效率则看表 5。

2. 图 2:权重、激活和步骤精度分别处理

原论文图 2:DVD-Quant 的三个模块

原论文图 2,PDF 第 3 页。左栏处理权重分布,中栏处理随时间变化的激活,右栏分配各去噪步骤的位宽。

模块 观察到的问题 操作 主要作用时间
BGR 大量权重集中在中间,少量极端值拉宽量化范围 搜索较好的范围,交替细化刻度与编码 权重量化准备阶段
ARQ 激活有大值和通道尺度差异,而且随去噪步骤变化 旋转、在线缩放、量化与尺度补偿 当前层与当前去噪步骤的推理
δ-GBS 不同步骤的特征变化幅度不同 根据累计变化选择 A4 或 A8 推理过程中的步骤调度

可以把量化想成使用一把刻度很少的尺子。BGR 为已有权重调整尺子;ARQ 让当前激活更适合这把尺子;δ-GBS 决定某个步骤值得使用多少精度。

3. BGR:先选范围,再交替调整刻度和编码

3.1 量化网格是什么

对于一个权重 ,整数编码为 ,还原值为:

是刻度间距, 是零点编码,决定哪个整数档位对应真实数值 0。4 bit 的 取 0 到 15。编码通过缩放、四舍五入和截断得到:

例如, 时,。如果编码和零点保持不变,把间距改成 0.094,还原值就变成 0.188。调整网格改变的是整数编码所代表的真实数值。

论文使用按通道的量化参数,同一通道内的一组权重共享 。原始权重始终作为优化的参照。

3.2 为什么需要边界搜索初始化

MinMax 直接根据最大、最小值设置间距:

对于近似高斯分布的权重,多数数值集中在中间,少量极端值位于两端。端点拉得越开,有限档位之间的间距越大,中间的大量权重就更难精细表示。

图 2 左上方的 表示向内收缩上下边界。收紧范围让刻度更密,但范围外的权重会产生更大的裁剪误差。因此,作者尝试多个候选范围,并根据原始权重的重建误差选择结果。

裁剪后的 用于构造初始参数;后续误差仍相对于原始 计算。这样才能同时考虑范围内的舍入误差与范围外的裁剪损失。

3.3 图 2 左下:为什么误差曲线会下降

图 2 左栏:边界搜索初始化与迭代网格细化

图 2 左栏局部。左下的横轴是量化参数优化步骤,右栏的时间轴才是视频去噪步骤。红、绿虚线是 MinMax 与 Bounded-init 的误差参考,蓝线表示迭代网格细化的趋势。

论文目标写为 Frobenius 范数,求最优解时可以等价使用误差平方和:

相互影响。BGR 采用交替调整:

  1. 固定 ,更新刻度间距 。
  2. 固定 ,更新零点 。
  3. 使用新的 ,重新计算整数编码 。
  4. 重复这一过程,在改善足够小时停止;对不同候选初始化比较最终误差。

固定 后,令 ,目标就是让 尽量接近 。最小二乘直接给出:

固定 后,零点的连续最优位置为:

再按正文说明处理整数与范围约束。网格改变后,重新取整会让一些权重换到更近的档位。

图上的 Grid Refinement 对应刻度参数调整,Weight Rounding 对应重新分配整数编码。蓝线从红线附近开始绘制,图中没有逐点注明实验条件,因此应把它作为优化机制概览。橙色虚线标注误差参考水平,不能直接把线的高度当作算法的停止参数;停止判断关注相邻迭代的改善。

3.4 一组完整的教学算例

手工设置初始网格 ,原始权重为:

最初得到 ,还原为 ,总平方误差为 0.0042。

固定编码时,,因此:

还原值变成 ,总误差下降到 0.00312。此时 0.24 的误差反而从 0.04 增加到 0.052,但另外三个权重改善更多,整组总误差仍然下降。

零点连续解约为 7.926,取整后仍为 8。接着重新选择档位:对于 0.24,编码 10 对应 0.188,距离为 0.052;编码 11 对应 0.282,距离为 0.042,因此改选编码 11。

状态 间距 整数编码 总平方误差
初始网格 0.10000 [7,10,11,12] 0.004200
更新间距 0.09400 [7,10,11,12] 0.003120
更新零点,本例仍为 8 0.09400 [7,10,11,12] 0.003120
重新取整 0.09400 [7,11,11,12] 0.002180
下一轮更新间距 0.08743 [7,11,11,12] 0.000669

编码变化后,上一轮最合适的间距可能不再合适,因此继续求解。参数也可能保持不变,曲线逐渐进入平台。该算例说明交替优化的机制,不是论文实验数据,也不表示算法保证找到所有可能网格中的全局最优解。

原论文图 3:不同层组的 BGR 与 MinMax 权重量化误差

原论文图 3,PDF 第 5 页。各小图横轴为层索引,纵轴为量化误差;红线为 BGR,青色线为 MinMax。它与图 2 的优化步骤曲线具有不同横轴。

图 3 展示的层组中,权重量化误差降低约 86%~92%。这些比例支持 BGR 的重建误差收益,不能直接解释为视频质量提高了同样比例。BGR 的优化发生在权重量化准备阶段,不需要生成样例作为校准数据。原文 §3.1、算法 1

4. ARQ:旋转后在线缩放,再补偿原来的尺度

4.1 激活为什么需要动态处理

激活是当前层运行时产生的特征。它既可能有个别极端值,也可能有整列通道偏大的情况,而且会随去噪步骤变化。图 2 中间的 、 对照,以及不同的 ,强调了这种时间变化。

ARQ 先采用 Hadamard 旋转,重新混合通道,分散过于集中的大值。教学例子中:

这是一个归一化四维 Hadamard 变换的结果,变换前后的平方和均为 64.06。数值被重新分配,变换可逆,原来的大值没有被直接裁掉。

采用统一的矩阵维度约定,设激活 、权重 ,线性层为 。匹配地旋转激活与权重:

其中 。在尚未量化时,这种变换保持计算等价。旋转后的权重 由 BGR 量化并保存;激活在实际运行时进行快速 Hadamard 变换。

4.2 为什么旋转后还要缩放

原论文图 4:激活旋转前后的分布

原论文图 4,PDF 第 6 页。两组示例分别来自不同层;每组从左向右表示旋转前后。

旋转可以降低部分尖峰,但也可能把高值分布到更广的区域,或留下新的通道尺度差异。图 4 因此支持继续处理旋转后的数值范围。

令 。把激活看成表格,每行对应一个 token,每列对应一个通道。作者按当前通道的最大绝对值计算:

例如,一列 除以 10 后得到 ;另一列 除以 0.2 后也得到 。各通道被调整到更可比较的尺度。

这里使用的是当前激活的统计,下一去噪步骤可以重新计算。没有预先固定一批校准样例得到的缩放系数。

4.3 缩放补偿究竟是什么

缩放改变了数值大小,后续计算需要把尺度带回来。假设两个通道的激活为 ,对应权重为 ,缩放系数分别为 10 和 0.2。

原来的输出:

缩放后激活为 。如果只使用缩放后的值,输出会变成 5。补偿尺度后:

每个通道的系数不同,因此要补偿各通道的乘积贡献,再相加,通常不能在最终输出上统一乘一个最大值。

将系数写成对角矩阵:

量化后的近似计算可以理解为:

为方便解释,这里把量化后还原的近似值记为 。缩放与补偿之间插入了低比特量化,因此不是一次没有作用的除法与乘法。

例如,5 除以 10 得到 0.5,如果量化近似为 0.47,补偿后是 4.7。补偿恢复数值尺度,不能消除离散化误差。

论文公式按通道缩放描述机制,实际加速内核采用与 Tensor Core 矩阵乘法粒度匹配的分块缩放。所有正文速度和精度结果来自这种硬件对齐配置,不能把理论按通道写法直接等同于具体内核操作。原文 §3.2

5. δ-GBS:累计特征变化,决定下一步使用多少精度

去噪过程中的特征变化幅度不均匀。作者使用相邻模型输出的变化作为精度分配指标:变化较小时尝试 A4,累计变化较大时使用 A8。

将第 步的输出特征记为 ,相对变化量为:

分子计算所有分量绝对变化之和,分母用上一步特征的大小归一化。例如 、 时,变化总量为 0.2,原特征总量为 4,因此 。

这衡量的是模型输出特征的相对变化。没有额外运行全精度模型作参考,因此它不是直接测得的量化误差。

作者累加上次重置以来的变化:

若 ,下一步骤使用低位宽;达到阈值时使用高位宽并重置计数器。实验采用 、。

假设 ,从已经能够计算变化量的阶段开始:

已完成步骤的变化量 累计变化 下一步的激活位宽 处理
0.02 0.02 4 bit 继续累计
0.03 0.05 4 bit 继续累计
0.04 0.09 4 bit 继续累计
0.025 0.115 8 bit 计数器重置为 0
0.02 0.02 4 bit 重新累计

这些是教学数字。每一步变化可能都不大,但连续的小变化也会触发高精度。决定当前待执行步骤位宽时使用的是此前已经产生的输出,符合正文公式(11)的求和上限。

重置的是变化计数器,使用一次 A8 并不自动修复之前的量化误差。该指标是作者提出的调度依据,不能直接视为每一步量化敏感性的精确测量。

较小,更容易触发 A8; 较大,更多步骤使用 A4。如果 50 步中 25 步使用 A4、25 步使用 A8,平均激活位宽为:

这就是 W4A6 的含义。它使用已有 A4、A8 内核,不要求每一步执行固定 6 bit 算子。实际分配随特征变化和阈值改变,不必每次都各占一半。原文 §3.3、§4.4

6. 主实验:低比特视频质量与视觉对比

正文使用 HunyuanVideo、50 步 flow matching 调度器,embedded CFG scale 为 6.0、flow shift factor 为 7.0,硬件为单张 RTX 4090。评价采用 VBench 的八个维度。

下表摘录表 1 的美学质量、成像质量与动态程度。其他一致性与运动平滑指标见原表。动态程度衡量视频是否呈现运动表现,应与画质和一致性联合阅读,数值较大不自动代表运动更正确。

方法 精度 W/A 美学质量 成像质量 动态程度
原始 HunyuanVideo 16/16 62.53 64.78 51.39
MinMax 4/8 59.44 60.62 52.78
SmoothQuant 4/8 60.50 64.47 51.39
QuaRot 4/8 58.80 56.86 55.56
ViDiT-Q 4/8 57.01 59.74 48.61
DVD-Quant 4/6 62.27 64.22 58.33
MinMax 4/4 24.20 24.78 0.00
SmoothQuant 4/4 48.41 59.46 1.39
QuaRot 4/4 44.85 54.30 87.50
ViDiT-Q 4/4 45.36 40.10 0.00
DVD-Quant 4/4 61.96 61.82 56.94

数据来自原论文表 1,PDF 第 7 页。

DVD-Quant 的平均 W4A6 美学与成像质量接近 BF16,同时使用更少的激活比特。但它没有在所有指标上超过所有 W4A8 对照:SmoothQuant 的成像质量为 64.47,略高于 DVD-Quant 的 64.22。

在统一 W4A4 时,DVD-Quant 的美学质量比最好的 W4A4 对照 SmoothQuant 高 13.55 分,成像质量高 2.36 分。SmoothQuant 的成像分数并不很低,但动态程度只有 1.39,说明单看清晰度会遗漏运动表现的问题。

“接近原模型”有具体指标范围。DVD-Quant W4A6 的场景一致性为 33.07,低于 BF16 的 42.81;W4A4 为 29.94。实验不能证明所有维度无损。

原论文图 5:火箭发射视频的量化结果对比

原论文图 5,PDF 第 7 页。左侧 W4A 对照使用 A8,DVD-Quant 使用平均 A6;右侧统一为 W4A4。*

火箭示例中,部分方法丢失细纹理或产生结构扭曲,MinMax W4A4 出现杂乱噪声。DVD-Quant 保留了较完整的火箭与发射场景。这里展示的是抽帧外观,不能只通过静态截图判断完整运动轨迹或时间一致性。原文表 1、图 5

7. 消融:分别检验三个模块的作用

7.1 BGR 与 ARQ 的模块移除

表 3 比较只保留一个模块,以及两者一起使用。以下数字只在表 3 内部比较:

精度 保留的模块 美学质量 成像质量 主体一致性 运动平滑度 背景一致性
W4A6 仅 ARQ 58.15 58.68 98.04 98.49 98.21
W4A6 仅 BGR 57.85 57.72 98.23 97.86 98.10
W4A6 BGR+ARQ 60.46 61.93 98.91 98.95 98.40
W4A4 仅 ARQ 53.95 52.67 97.92 98.71 97.89
W4A4 仅 BGR 43.26 58.31 95.36 96.08 97.35
W4A4 BGR+ARQ 59.57 58.93 98.67 99.00 98.47

数据来自原论文表 3,PDF 第 8 页。

以 W4A4 为例,拿掉 BGR 后,成像质量从 58.93 降到 52.67,下降 6.26 分。拿掉 ARQ 后,美学质量从 59.57 降到 43.26,下降 16.31 分。两者一起使用时,表中的五个指标都更好。

这支持权重量化与激活处理的互补作用。单项指标也可能掩盖差异:仅 BGR 的成像质量为 58.31,距完整组合只差 0.62 分,但美学质量差距很大。

表 3 没有“两者都不用”的行,也没有把 BGR 的边界搜索与网格细化、ARQ 的旋转与在线缩放分别拆开。因此,它支持模块整体贡献,不能精确分离每个内部操作或计算完整交互效应。

7.2 δ-GBS 与固定分配策略

表 2 在平均激活位宽约为 6 bit 的预算下比较不同分配方式:

策略 位宽分配方式 成像质量
STP 前 25 步 A4,后 25 步 A8 61.33
ITP 前 25 步 A8,后 25 步 A4 61.40
ABS A4、A8 交替使用 61.03
SBA 随机分配 A4、A8,维持匹配预算 61.26
δ-GBS 根据累计特征变化决定 61.93

数据来自原论文表 2,PDF 第 8 页。

这组实验比较的是高精度用在哪些步骤。δ-GBS 比最好的固定策略高 0.53 分,说明按实际特征变化分配精度具有一定收益。表中没有多次重复实验的方差或误差条,不能进一步判断这点差距的统计稳定性。原文 §4.3

7.3 阈值 δ 的敏感性

原论文图 6:不同阈值下的视频与成像质量

原论文图 6,PDF 第 9 页。逐步增大阈值,标注的平均成像质量逐渐下降。

δ 图中标注的成像质量
0.06 62.11
0.09 61.93
0.12 61.43
0.15 61.19
0.18 61.00

作者解释,较大的 δ 会减少高精度步骤,降低平均位宽,并带来一定质量下降。图 6 直接展示画质趋势,没有为每个 δ 同时列出平均位宽、显存与实际耗时,所以完整的质量—成本曲线仍需要更多数值。原文图 6

8. 效率与缓存组合实验

表 5 报告相对于 BF16 的显存和延迟优化:

配置 显存节省倍数 延迟加速倍数
BF16 1.00× 1.00×
W4A8 3.68× 1.75×
平均 W4A6 3.68× 1.93×
W4A4 3.68× 2.12×

数据来自原论文表 5,PDF 第 9 页。

按报告倍数换算,显存用量约为原来的 27%,W4A4 的耗时约为原来的 47%。三种配置显存收益相同,激活位宽降低后速度继续提高。表中提供相对倍数,没有列出绝对秒数或 GB。

作者还将量化与 TeaCache 缓存机制配合。缓存通过复用部分中间特征减少计算,与降低数值精度属于不同方向。

组合方案 美学质量 成像质量 加速倍数
DVD-Quant+TeaCache,W4A8 61.39 62.96 4.01×
DVD-Quant+TeaCache,W4A4 58.78 58.20 4.85×

数据来自原论文表 4,PDF 第 9 页。

4.85× 是组合方案的结果,DVD-Quant 单独使用的最高报告加速为 2.12×。组合仍应同时考虑质量:表 4 的 W4A4 成像质量为 58.20。该表没有列出仅 TeaCache 的对照,不能单独据此精确拆分两种加速的贡献。原文 §4.4—4.5

9. 结论边界与原文数据核对

主结果、权重量化误差和模块消融共同支持:BGR 与 ARQ 的组合能在报告配置下维持较好的低比特生成效果。δ-GBS 支持更灵活的步骤精度分配,但它相对于固定策略的提升较小,需要重复评测判断稳定性。

阅读和复现时还应保留以下边界:

  1. Data-free 的含义是无需离线校准集。 ARQ 仍读取当前激活统计,δ-GBS 仍使用运行时输出特征;推理开销也不因此为零。
  2. W4A6 是平均位宽。 实际使用 A4 与 A8 的步骤组合,不能理解为所有激活始终按固定 6 bit 算子执行。
  3. 质量不是所有维度无损。 场景一致性仍低于 BF16,动态程度和运动平滑也需要与画质联合判断。
  4. 实验条件影响收益。 正文数字来自作者报告的模型、50 步调度器和 RTX 4090 配置,不自动推广到所有硬件、视频长度或分辨率。
  5. 评测统计信息有限。 相关段落没有充分列出样例数量、多种子方差和各模块的独立运行开销;当前 PDF 也未附正文所指向的 Wan2.1 补充结果。
  6. 模块内操作尚未完全拆分。 现有消融检验 BGR、ARQ 整体,以及不同位宽策略,没有完成所有内部因素的独立对照。

当前 v4 还有需要核对的数据差异:

位置 W4A4 美学质量 W4A4 成像质量
表 1 的 DVD-Quant 61.96 61.82
§4.2 正文举例 58.94 60.38
表 3 的 BGR+ARQ 59.57 58.93

表 1 与 §4.2 对同类主结果的描述不一致;表 3 完整配置也与主表不同,相关正文没有充分解释差异。本文主性能比较采用表 1,模块移除比较只使用表 3 内部数据。复现或正式引用前,应进一步核对作者配置与结果,而不是将这些数值混成一组。

原始来源

文中图 1—图 6 均裁自上述固定版本论文,并在相应位置保留图号、页码与解释。局部图来自图 2;教学算例由本文构造,未作为论文实验结果使用。


See also