通过自我批判推理框架扩展视觉语言模型的测试时鲁棒性 Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework
1同济大学 2中国科学院计算机网络信息中心 3中国科学院大学 4中国科学院大学 HIAS *通讯作者
SCI 是什么?
自我批判推理(Self-Critical Inference, SCI)是一种作用于解码阶段的大型视觉语言模型(LVLM)推理框架。它用扰动后的提示词和扰动后的图像对同一问题进行多轮反事实推理,再对各轮的下一 token logits 进行比较与聚合,用同一个公式同时缓解语言偏见(含物体幻觉)与语言敏感性;反事实轮数越多,鲁棒性越高。
DRBench 是什么?
动态鲁棒性基准(Dynamic Robustness Benchmark, DRBench)是一个针对具体模型的评测基准。给定任意 LVLM 与任意现有数据集,它自动筛选出该模型自身存在偏见或提示词敏感的样本。原因在于不同模型的失败样本差异显著,固定的鲁棒性基准无法反映模型的真实可靠性。
LLaVA-NeXT-8B 在其自身非鲁棒样本(BS 子集)上的准确率(%),基座模型 → SCI7
Qwen2-VL-7B 在其自身 BS 子集上的准确率(%),基座模型 → SCI7
的测试样本对两个模型同时非鲁棒,而对 LLaVA-NeXT 非鲁棒的样本共有 24.68%:失败样本因模型而异
SCI5 在批量推理下相对基座模型的推理时间
引用本文 · BibTeX
@inproceedings{tang2026scaling,
title={Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework},
author={Tang, Kaihua and Qi, Jiaxin and Ou, Jinli and Zheng, Yuhua and Huang, Jianqiang},
booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2026}
}
摘要
(以下为论文英文摘要的中文翻译,原文见 arXiv:2603.07659。)
大语言模型(LLM)的出现推动了多模态学习的快速发展,尤其是大型视觉语言模型(LVLM)。然而,现有 LVLM 的训练范式过度依赖 LLM 部分,由此带来两个关键的鲁棒性挑战:语言偏见与语言敏感性。为同时解决这两个问题,我们提出自我批判推理(SCI)框架,它扩展了视觉对比解码(Visual Contrastive Decoding),通过文本与视觉两类扰动进行多轮反事实推理。这一过程也带来了一种提升鲁棒性的新策略:扩展反事实推理的轮数。此外,我们观察到不同 LVLM 的失败样本差异显著,说明固定的鲁棒性基准可能无法反映 LVLM 的真实可靠性。为此,我们提出动态鲁棒性基准(DRBench),一个同时针对语言偏见与语言敏感性的、模型相关的评测框架。大量实验表明,SCI 在 DRBench 上持续优于基线方法,并且增加推理轮数能够进一步提升鲁棒性,超越现有的单步反事实推理方法。
LVLM 从 LLM 继承的两个鲁棒性问题
语言偏见
模型依赖语言先验作答而忽视视觉输入。这是传统 VQA 模型长期存在的问题,在 LVLM 中依然存在,并可能导致模型生成图像中不存在的内容,即物体幻觉。
语言敏感性
在不改变问题本身的前提下改写提示词(例如只是要求模型检查图像细节),模型就会给出不同答案。这损害了一致性与可靠性,是引入 LLM 之后新出现的问题。
方法:从对比解码到自我批判推理
VCD 本质上是带温度系数的 TIE
视觉对比解码(VCD)用加噪图像做第二次推理,并用对比后的 logits 解码。把它的 softmax 展开可以看到:VCD 其实是用 exp(TIE/τ) 对原始 token 概率做重加权,其中 TIE 是反事实 VQA(CF-VQA)与无偏场景图生成中提出的总间接效应,即真实图像下的 logits 减去加噪图像下的 logits;VCD 多出来的参数 α 起的是温度系数的作用(τ = 1/α)。
SCI 的统一形式
- 文本反事实(TC):对原始提示词与 N 个“语义等价、措辞不同”的提示词的 logits 逐维取最大值,得到对提示词一致的 logits。
- 视觉反事实(VC):原始 logits 减去 M 张“去除内容的图像”下 logits 的均值,比单次 TIE 估计更稳定,用于去除语言先验。
- 沿用 VCD 的自适应合理性约束(Adaptive Plausibility Constraint),但改用经温度缩放的 TC logits 作为掩码依据。
- 特例:VCD 即 N=0、M=1 的 SCI;CF-VQA 即 TC 为常数、M=1 的 SCI。
- SCI3 / SCI5 / SCI7 表示总推理轮数 M+N+1 = 3 / 5 / 7,即 M=N=1 / 2 / 3。
| 名称 | 类型 | 构造方式 | 使用者 |
|---|---|---|---|
| VC-Color0 | 视觉 | 所有像素置为 RGB (0, 0, 0),即全黑图像 | SCI3 / 5 / 7 |
| VC-Noise500 | 视觉 | 扩散前向过程加噪 500 步(沿用 VCD 的加噪函数) | SCI5 / 7,TIE / VCD / M3ID 基线 |
| VC-Noise400 | 视觉 | 扩散前向过程加噪 400 步 | SCI7 |
| TC-V1 | 文本 | 增加一句指令,要求模型关注图像细节 | SCI3 / 5 / 7 |
| TC-V2 | 文本 | 在 TC-V1 的基础上切换指令语言(英文 ↔ 中文) | SCI5 / 7 |
| TC-V3 | 文本 | 注入身份信息(“你是一名擅长回答选择题的聪明学生”) | SCI7 |
超参数:τ1 = 1.5 / 2.0 / 2.5(SCI3 / 5 / 7,代码参数 gamma),τ2 = 0.2(beta),合理性约束阈值 β = 0.3(DRBench)或 0.8(原始数据集)(theta)。超参数在 Qwen2-VL 的 BS 子集验证集上选定,并直接用于 LLaVA-NeXT。
反事实轮数越多,鲁棒性越高
已有的测试时扩展(test-time scaling)大多是在单次推理中增加中间思考 token 的长度。SCI 扩展的是另一个维度:参与 logit 聚合的反事实推理轮数。从基座模型(1 轮)到 SCI3、SCI5、SCI7,DRBench 三个子集上的总体准确率持续上升。
Qwen2-VL-7B
在其自身 DRBench 上的总体 top-1 准确率(%)
LLaVA-NeXT-8B
在其自身 DRBench 上的总体 top-1 准确率(%)
数据来自论文表 2 的 Overall 列(80% 测试集)。
额外轮数的开销
论文表 7:MMStar 数据集、Qwen2-VL、单张 NVIDIA A800 GPU 上每个样本的平均推理时间。基座模型 540.47 ms;批量推理下 SCI3 / SCI5 / SCI7 为 697.24 / 978.14 / 1342.86 ms,顺序执行时为 1599.65 / 2707.16 / 3611.18 ms。各轮反事实推理互相独立,可以放进同一个 batch;论文还指出,共享未改变的视觉或文本 token 的 KV cache 是进一步加速的方向。
DRBench:跟随模型变化的鲁棒性基准
13,251 个测试样本中落入各模型 BS 子集的比例(表 1),以及两个模型共有的 7.34%。
非鲁棒样本并不是固定的:测试集中有 24.68% 的样本对 LLaVA-NeXT 是困难样本,其中与 Qwen2-VL 共享的只有 7.34%。因此 DRBench 针对每个模型分两步构建:
- 评测:用原始输入、两种视觉反事实输入和两种文本反事实输入(M=N=2)在现有数据集上运行该模型。
- 筛选:偏见子集(Bias Subset)收集在原始图像与去除内容的图像下给出相同错误预测的样本,说明模型依赖了虚假的语言先验;敏感性子集(Sensitivity Subset)收集预测随细微、非因果的提示词变化而改变的样本;BS 子集为二者的并集。
论文使用 6 个常用基准构建 DRBench:MME、MMStar、CCBench、ViLP、MMBench-DEV-EN-V11、MMBench-DEV-CN-V11,随机划分为 20% 验证集(3,315 个样本)和 80% 测试集(13,251 个样本,其中选择题 MCQ 10,632 个,其他类型 2,619 个)。
| 构建所用模型 | 偏见子集 B | 敏感性子集 S | BS 子集 | 重叠 |
|---|---|---|---|---|
| LLaVA-NeXT(总体) | 2155 | 1587 | 3270 | 472 |
| Qwen2-VL(总体) | 1407 | 563 | 1756 | 214 |
| BS 子集的构建模型 | 被评测方法 | MCQ | Others | Overall |
|---|---|---|---|---|
| LLaVA-NeXT | LLaVA-NeXT-Original | 15.91 | 27.58 | 18.75 |
| LLaVA-NeXT | LLaVA-NeXT-SCI5 | 28.80 | 51.01 | 34.19 |
| LLaVA-NeXT | Qwen2-VL-Original | 59.29 | 63.48 | 60.31 |
| LLaVA-NeXT | Qwen2-VL-SCI5 | 61.15 | 67.88 | 62.78 |
| Qwen2-VL | Qwen2-VL-Original | 10.78 | 23.59 | 14.52 |
| Qwen2-VL | Qwen2-VL-SCI5 | 28.00 | 33.14 | 29.50 |
| Qwen2-VL | LLaVA-NeXT-Original | 30.25 | 39.18 | 32.86 |
| Qwen2-VL | LLaVA-NeXT-SCI5 | 34.59 | 41.33 | 36.56 |
实验结果
基座模型为 Hugging Face 版本的 Qwen2-VL-7B-Instruct(bfloat16,默认 top-k 采样)与 Llama3-LLaVA-NeXT-8B(float16,贪心解码);对比方法为 TIE(改编自 CF-VQA)、VCD 与 M3ID。所有实验基于 VLMEvalKit,在单张 NVIDIA A800 80GB GPU 上完成,指标为 top-1 准确率(%)。
BS 子集(各模型偏见子集与敏感性子集的并集)上的总体 top-1 准确率(%),数据来自论文表 2。展开下方表格可查看各子集与原始数据集上的结果。
表 2. DRBench(80% 测试集)。B = 偏见子集,S = 敏感性子集,BS = 并集。此处列出 Overall 列,含 MCQ / Others 的完整表格见英文页。
| 方法 | B 子集 | S 子集 | BS 子集 |
|---|---|---|---|
| LLaVA-NeXT | 0.0 | 38.63 | 18.75 |
| LLaVA-NeXT-TIE | 14.66 | 45.81 | 27.31 |
| LLaVA-NeXT-VCD | 14.71 | 46.38 | 27.89 |
| LLaVA-NeXT-M3ID | 18.24 | 45.94 | 29.05 |
| LLaVA-NeXT-SCI3(本文) | 23.48 | 47.20 | 32.72 |
| LLaVA-NeXT-SCI5(本文) | 26.08 | 47.95 | 34.19 |
| LLaVA-NeXT-SCI7(本文) | 27.01 | 47.64 | 34.92 |
| Qwen2-VL | 6.11 | 36.06 | 14.52 |
| Qwen2-VL-TIE | 16.35 | 40.67 | 22.32 |
| Qwen2-VL-VCD | 17.13 | 43.52 | 23.12 |
| Qwen2-VL-M3ID | 20.26 | 43.87 | 25.68 |
| Qwen2-VL-SCI3(本文) | 22.74 | 43.16 | 26.94 |
| Qwen2-VL-SCI5(本文) | 25.09 | 44.58 | 29.50 |
| Qwen2-VL-SCI7(本文) | 27.65 | 46.54 | 31.72 |
表 4. 6 个原始数据集(80% 测试集)上的总体准确率。SCI5 在两类题型上均有提升,而 TIE、VCD、M3ID 会降低 Others 题型的准确率。
| 方法 | MCQ | Others | Overall |
|---|---|---|---|
| LLaVA-NeXT | 70.12 | 71.86 | 70.46 |
| LLaVA-NeXT-TIE | 70.36 | 70.68 | 70.42 |
| LLaVA-NeXT-VCD | 70.44 | 71.55 | 70.66 |
| LLaVA-NeXT-M3ID | 70.36 | 71.86 | 70.66 |
| LLaVA-NeXT-SCI5(本文) | 70.32 | 72.70 | 70.79 |
| Qwen2-VL | 80.91 | 79.27 | 80.58 |
| Qwen2-VL-TIE | 81.30 | 78.43 | 80.73 |
| Qwen2-VL-VCD | 81.42 | 78.58 | 80.86 |
| Qwen2-VL-M3ID | 81.25 | 78.31 | 80.67 |
| Qwen2-VL-SCI5(本文) | 81.39 | 79.31 | 80.98 |
论文回答的几个问题
为什么基座模型在偏见子集上的准确率接近 0?
DRBench 有意筛选最脆弱的困难样本。按定义,偏见子集收集的是基座模型持续预测错误的样本,因此理论准确率为 0.0。LLaVA-NeXT 使用贪心解码,结果是确定性的,所以恰好为 0.0;Qwen2-VL 默认使用 top-k 采样,所以为 6.11% 而不是 0。
SCI 的计算开销有多大?如何加速?
各轮反事实推理互相独立,可以放进同一个 batch。批量推理下 SCI3 / SCI5 / SCI7 的开销约为基座模型的 1.29× / 1.81× / 2.48×,顺序执行时为 2.96× / 5.01× / 6.68×。论文还提出可以共享未改变的视觉或文本 token 的 KV cache。
SCI 与以往的测试时扩展研究有何不同?
以往的测试时扩展大多增加中间思考 token 的长度,只能从最终答案判断对错。SCI 不停留在离散 token 输出上,而是通过比较和聚合反事实 logits 来分析连续的 logit 分布,信息量远大于最终预测的 token。
SCI 的提升是否只是针对自身 DRBench 的“刷榜”?
论文用跨模型评测(表 3)回答了这一点:在由另一个模型构建的脆弱样本集上,SCI 仍带来一致提升(Qwen2-VL 在 LLaVA-NeXT 子集上 60.31 → 62.78,LLaVA-NeXT 在 Qwen2-VL 子集上 32.86 → 36.56),只是相对提升幅度变小。同时 SCI 在 6 个原始数据集上保持或提升了准确率。
代码与复现
代码仓库基于 VLMEvalKit v0.2 修改,在 Qwen2-VL 与 LLaVA-NeXT 的 forward 内部于 logit 层面实现了 SCI、TIE、VCD 与 M3ID,每种变体都是 vlmeval/config.py 中注册的一个模型名,例如 Qwen2-VL-7B-SCI5-b02a1g2t03。
- 运行基座模型及其反事实变体
bash step0_run_basemodel.sh - 构建该模型专属的 DRBench
bash step1_generate_data.sh,生成偏见(_VCF_)、敏感性(_TCF_)与 BS(_Biased_)子集的验证 / 测试划分 - 在子集上重新运行基座模型并评测
bash step2_test_basemodel_a.sh、step2_test_basemodel_b.sh,再用tools/evaluate_dataset.py计算准确率 - 在验证集上选择超参数
bash step3_validation_a.sh、step3_validation_b.sh,再运行tools/validation.py - 运行 TIE、VCD、M3ID 与 SCI
bash step4_test_algorithm_a.sh、step4_test_algorithm_b.sh
完整说明见仓库 README。