note
- 核心结论:VITAL 让多模态大模型在回答视频问题前,先判断“要不要回看、回看哪一段”,再通过视频裁剪工具获取关键时间段的密集帧,形成“文本推理 + 视觉证据”的多模态思维链。该方法主要解决长视频理解中的跨模态交互不足和幻觉,在 11 个视频理解基准上取得领先,尤其擅长长视频问答和时间定位。
- VITAL 的本质,是教会多模态大模型在视频推理中“不懂就回看”:模型先形成时间假设,再调用视频裁剪工具密集观察关键片段,最后依据真实画面作答;
- 通过 SFT 冷启动与 DGRPO 强化学习,将时间定位、视频问答和 grounded QA 联合训练,从而显著改善长视频理解并抑制幻觉。
- 其最具启发性的设计不是某一个网络模块,而是三种机制的闭环:工具提供证据 → 时间定位指导工具 → 问答验证定位价值。
文章目录
- note
- 一、研究动机
- 1. 长视频理解难在哪里?
- 2. 现有方法的两个缺陷
- 3. 核心洞察
- 二、论文核心
- 1. VITAL 是什么?
- 2. 多轮工具调用机制
- 每一轮模型要做什么?
- 是“多轮 agent”,但实验主要限制为一次调用
- 典型轨迹
- 3. 工具有哪些?
- 为什么最终选择视频裁剪?
- 4. 多任务训练设计
- (1)时间定位(Temporal Grounding)
- (2)视频问答(Video QA)
- (3)基于定位的问答(Grounded QA)
- 5. 数据集:MTVR-CoT-72k 与 MTVR-RL-110k
- 数据筛选策略
- 两个数据集的分工
- 6. 两阶段训练
- 第一阶段:SFT 冷启动
- 第二阶段:DGRPO 强化学习
- 三、实验结果
- 1. 总体结论
- 最值得关注的趋势
- 2. 工具到底有没有用?
- 四、结果分析
- 1. 为什么多模态 CoT 优于文本 CoT?
- 文本 CoT 的失败模式
- 多模态 CoT 的修正机制
- 2. 时间定位为什么能帮助视频问答?
- 3. DGRPO 解决了什么?
- 五、优势、局限与后续方向
- 1. 主要优势
- 2. 主要局限
- 3. 值得继续研究的方向
一、研究动机
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
CVPR 2026
https://github.com/tongjingqi/Thinking-with-Video
1. 长视频理解难在哪里?
视频推理要求模型从动态画面中识别对象、关系、事件及其因果关系,典型任务包括:
- 视频问答(Video QA)
- 时间定位(Temporal Grounding)
- 时空定位(Spatial-Temporal Grounding)
- 视频字幕生成
长视频的难点不只是“帧数多”,而是:
- 关键信息稀疏:答案往往只依赖几秒;
- 时间依赖强:事件原因可能出现在很久之前;
- 视觉计算昂贵:不能无差别地把所有帧送入模型;
- 容易遗忘与幻觉:模型可能凭语言先验“编答案”。
2. 现有方法的两个缺陷
此前许多视频多模态大模型主要使用基于文本的思维链(text-based CoT):模型先看少量采样帧,然后在文字中逐步推理。
这种方法存在两个问题:
- 跨模态交互不足:后续推理主要操作文字,不再主动查看视频;
- 幻觉随链条增长而累积:推理步骤越多、视频越长,越容易偏离画面事实。
3. 核心洞察
人在不确定视频内容时,不会只凭第一眼印象硬猜,而会:
暂停、回放、放大关键片段,再下结论。
VITAL 要把这种“按需回看”能力教给模型:
- 模型先形成初步假设;
- 主动调用视觉工具;
- 密集观察疑似时间段;
- 根据真实画面修正答案。
因此,论文标题中的“Thinking with Videos”不是简单“看图后推理”,而是:在推理过程中持续引入新的视频证据。
二、论文核心
1. VITAL 是什么?
VITAL(Video Intelligence via Tool-Augmented Learning)是一个端到端的 agentic 视频推理框架,由两部分组成:
- 多模态大模型(MLLM):负责理解、推理、决策和作答;
- 视觉工具箱(Visual Toolbox):按模型要求返回新的视频证据。
其推理轨迹可表示为:
τ = T 1 → C 1 → V 1 → T 2 → ⋯ → A n \tau= \mathcal{T}_1 \rightarrow \mathcal{C}_1 \rightarrow \mathcal{V}_1 \rightarrow \mathcal{T}_2 \rightarrow \cdots \rightarrow \mathcal{A}_nτ=T1→C1→V1→T2→⋯→An
其中:
- T \mathcal{T}T:文本思考步骤;
- C \mathcal{C}C:工具调用;
- V \mathcal{V}V:工具返回的视频证据;
- A \mathcal{A}A:最终答案。
这形成一条多模态思维链(multimodal CoT):推理过程不仅出现文字,也出现真实视频帧。
2. 多轮工具调用机制
每一轮模型要做什么?
在第 (k) 轮,模型根据历史信息生成:
O k = f M L L M ( { T i , C i , V i } i = 0 k ) \mathcal{O}_k=f_{MLLM} \left( \{\mathcal{T}_i,\mathcal{C}_i,\mathcal{V}_i\}_{i=0}^{k} \right)Ok=fMLLM({Ti,Ci,Vi}i=0k)
随后解析器从中提取:
- 下一步思考T k + 1 \mathcal{T}_{k+1}Tk+1;
- 工具调用请求( C k + 1 (\mathcal{C}_{k+1}(Ck+1;
- 或最终答案A k + 1 \mathcal{A}_{k+1}Ak+1。
若模型选择调用工具,则执行:
V k + 1 = g t o o l ( C k + 1 ) \mathcal{V}_{k+1}=g_{tool}(\mathcal{C}_{k+1})Vk+1=gtool(Ck+1)
工具结果重新进入模型上下文,开启下一轮推理。
是“多轮 agent”,但实验主要限制为一次调用
需要区分两个层面:
| 层面 | 实际设计 |
|---|---|
| 框架能力 | 支持多轮工具调用,允许模型反复观察视频 |
| 实验配置 | 主要采用视频裁剪工具,每个问题最多调用一次 |
| 生成阶段 | 最多约两个生成阶段:初始推理 → 可选工具 → 最终回答 |
因此更准确的表述是:
架构上是多轮工具调用 agent;当前实验是“单轮工具决策 + 两段生成”的 agentic RL。
它并非只能对最终答案做单轮强化学习,而是优化完整轨迹:
问题 → 是否调用工具 → 调用参数 → 观察返回帧 → 修正答案 \text{问题} \rightarrow \text{是否调用工具} \rightarrow \text{调用参数} \rightarrow \text{观察返回帧} \rightarrow \text{修正答案}问题→是否调用工具→调用参数→观察返回帧→修正答案
典型轨迹
不调用工具:
问题 → 思考 → 直接回答调用工具:
问题 → 初步思考 → Get_video_clip_frame(120, 180) → 观察密集帧 → 依据视觉证据推理 → 最终答案3. 工具有哪些?
论文测试了三类视频工具,但最终主要采用视频裁剪取帧。
| 工具 | 输入 | 返回 | 特点 | 采用情况 |
|---|---|---|---|---|
| 视频片段字幕 | 起止时间 | 文字描述或字幕 | 压缩视觉信息,可能丢失细节 | 候选测试 |
| 片段视觉问答 | 时间段 + 子问题 | 子问题答案 | 可验证假设,但会引入中间模型误差 | 候选测试 |
| 视频裁剪取帧 | start_time, end_time | 该区间的密集采样帧 | 直接提供视觉证据,最利于减少幻觉 | 主要采用 |
核心工具为:
V k + 1 = g c l i p ( V 0 , t s t a r t , t e n d ) \mathcal{V}_{k+1}=g_{clip}(\mathcal{V}_0,t_{start},t_{end})Vk+1=gclip(V0,tstart,tend)
即:
Get_video_clip_frame(start_time, end_time)它不是生成一个新视频文件,而是:
- 接收原始视频;
- 解析模型给出的时间区间;
- 在该区间密集抽取帧;
- 将帧序列返回给模型。
为什么最终选择视频裁剪?
- 时间定位任务本身要求预测起止时间;
- 密集帧能直接显示动作、对象和事件边界;
- 字幕工具可能受语音识别错误影响;
- 片段 VQA 会把判断权交给另一个模型;
- 让原模型亲自观察证据,更有利于抑制幻觉。
对应论文表格:
- 表 6:不同视觉工具的消融比较,说明视频裁剪效果最好。
4. 多任务训练设计
VITAL 同时优化三个相互关联的任务:
(1)时间定位(Temporal Grounding)
输入:
“什么时候有人打开冰箱?”输出:
<t_start>12.5</t_start> <t_end>14.8</t_end>它训练模型理解“事件发生在哪一段时间”。
(2)视频问答(Video QA)
输入:
“视频中的人最后做了什么?”输出:
“他把书放进了背包。”它训练模型综合视频内容进行推理。
(3)基于定位的问答(Grounded QA)
要求同时输出:
- 相关时间段;
- 对应答案。
它把前两个任务结合起来:
先找到证据所在时间,再依据证据作答。
论文认为时间定位与视频问答互为因果、互相促进:
- 时间定位帮助模型聚焦关键片段;
- 视频问答帮助模型理解为什么要定位该片段;
- Grounded QA 强制模型把答案绑定到视频证据。
5. 数据集:MTVR-CoT-72k 与 MTVR-RL-110k
原始数据来自:
- Charades-STA
- ActivityNet-MR
- VidChapters-7M
- Video-R1
- LongVideo-Reason
- ReXTime
- NExT-GQA
数据筛选策略
对每个样本生成 (k=8) 条高温度 rollout,保留“中等难度”样本:
- 全部答对(PassAll@k):太简单,RL 学不到新东西;
- 全部答错(PassNone@k):太难,容易产生噪声梯度;
- 部分答对:难度适中,保留。
随后使用强推理模型生成:
- 所有样本的基于文本 CoT;
- 长视频样本的多模态 CoT;
- 长视频时间定位的工具参数:在真实时间区间上添加约 20% 噪声;
- 长视频 QA 的工具参数:由推理模型自主决定。
两个数据集的分工
| 数据集 | 规模 | 阶段 | 作用 |
|---|---|---|---|
| MTVR-CoT-72k | 约 7.2 万 | 监督微调(SFT) | 冷启动,学习格式、推理和工具调用 |
| MTVR-RL-110k | 约 11 万 | 强化学习(RL) | 优化工具决策、时间定位和答案策略 |
对应论文图示:
- 图 4:数据 rollout、难度过滤与 CoT 生成流程。
- 图 5:两个数据集的构成与用途。
6. 两阶段训练
第一阶段:SFT 冷启动
学习目标:
- 按指定格式输出思考、工具调用和答案;
- 学会初步的时间定位;
- 学会根据返回帧修正结论;
- 在三个任务间建立共同表示。
第二阶段:DGRPO 强化学习
传统 GRPO 对同一问题的多个 rollout 计算相对优势。VITAL 提出DGRPO(Difficulty-aware GRPO),进一步考虑:
- 不同任务的难度差异;
- 同任务内不同样本的难度差异;
- 全对样本的奖励饱和;
- 全错样本的信号噪声。
DGRPO 会动态调整奖励尺度,使:
- 简单 VQA 不淹没困难时间定位;
- 困难样本不因偶尔答对而获得过高优势;
- 过易、过难样本不主导训练。
奖励通常包括:
- 答案正确性;
- 时间区间 IoU;
- 输出格式是否合法;
- 工具调用是否合理;
- 是否避免无效或重复调用。
对应论文公式与表格:
- 公式(3)及后续 DGRPO 推导:难度感知奖励缩放。
- 表 7:DGRPO 相对普通 GRPO 的增益。
- 表 8:难度过滤与数据筛选的消融结果。
三、实验结果
1. 总体结论
VITAL 在11 个视频理解基准上进行评测,覆盖:
- 长视频问答;
- 时间定位;
- 片段检索;
- 通用视频理解。
论文所报告的代表性结果包括:
| 基准 | VITAL 结果 | 对比最佳开源基线 | 提升 |
|---|---|---|---|
| LongVideo-Reason | 79.3% | 67.9% | +11.4 |
| VidChapters-7M(R@0.5) | 34.7% | 27.4% | +7.3 |
| ReXTime(mIoU) | 明显提升 | — | 工具带来+6.7 |
| LongVideo-Reason | 明显提升 | — | 工具带来+9.1 |
| VidChapters-7M(R@0.5) | 明显提升 | — | 工具带来+8.9 |
注:不同基准的指标口径不同,跨任务百分比不能直接比较;上表用于说明收益方向,精确数值应以论文对应表格为准。
最值得关注的趋势
- 视频越长,工具收益越大;
- 时间定位能力能迁移到视频问答;
- 多模态 CoT 比纯文本 CoT 更可靠;
- DGRPO 能缓解多任务训练中的难度失衡;
- 合理的数据筛选比单纯扩大数据更重要。
2. 工具到底有没有用?
论文通过“启用工具 / 不启用工具”进行比较,主要结论如下:
| 任务 | 工具带来的典型增益 | 原因 |
|---|---|---|
| LongVideo-Reason | 约+9.1 | 长视频初始采样容易漏掉关键事件 |
| VidChapters-7M R@0.5 | 约+8.9 | 时间边界需要密集观察才能校准 |
| ReXTime mIoU | 约+6.7 | 起止时间预测需要局部视觉证据 |
| 短视频 QA | 较小 | 初始帧已包含大部分信息 |
| 简单计数/属性题 | 可能为负或接近零 | 工具调用增加成本,却无信息增益 |
这说明工具不是“越多越好”,模型必须学会:
只在初始证据不足、回看预期收益较高时调用工具。
对应论文表格:
- 表 1、表 2:VITAL 与现有方法在 11 个基准上的主结果。
- 表 3、表 4:工具调用、初始帧数、最大轮次等消融。
- 表 6:不同视觉工具的效果比较。
四、结果分析
1. 为什么多模态 CoT 优于文本 CoT?
文本 CoT 的失败模式
看到稀疏帧 → 猜测事件可能发生在中段 → 用语言推理补齐细节 → 错误逐步累积 → 输出一个听起来合理的答案问题在于:一旦初始观察不足,后续推理只是在重新组合先验知识,没有回到视频验证。
多模态 CoT 的修正机制
初步观察 → 提出假设:“关键事件可能在 200–260 秒” → 调用裁剪工具 → 看到密集帧 → 发现真实事件在 238–251 秒 → 根据画面重新作答关键差别是:
推理链中存在一个可验证的视觉反馈环节。
这相当于把“想当然”变成“提出假设—搜集证据—更新结论”。
2. 时间定位为什么能帮助视频问答?
传统做法常把两个任务分开:
- 时间定位模型:输入描述,输出时间段;
- 视频 QA 模型:输入视频和 question,输出答案。
VITAL 发现二者共享底层能力:
- 回答“最后谁打开了门”,需要先定位“最后”和“开门”;
- 回答“两个人物何时第一次相遇”,需要同时定位事件和时间;
- 回答“为什么主角停下来”,需要回溯原因事件发生的时间段。
因此,VITAL 用时间定位作为:
- 表示学习任务:学会把语言描述映射到视频时间;
- 工具调用任务:学会为 QA 选择回看区间;
- 可验证监督信号:IoU 比开放文本答案更容易客观评判。
3. DGRPO 解决了什么?
假设一个 batch 中同时存在:
- 一道简单的是非题;
- 一道跨越 30 分钟的时间定位题。
若直接使用原始奖励:
- 简单题奖励波动小、模型容易全对;
- 难题奖励信号弱、训练不稳定;
- 简单任务可能主导梯度;
- 难题反而学不到有效策略。
DGRPO 的难度感知机制相当于:
给“跳一跳够得着”的样本更高学习权重,降低全对与全错样本的干扰。
这带来三个效果:
- 训练更稳定;
- 多任务性能更均衡;
- 模型更愿意挑战需要工具调用的困难样本。
五、优势、局限与后续方向
1. 主要优势
- 按需计算:不必把所有视频帧都送入模型;
- 可解释:思考与工具调用暴露了模型的“关注区间”;
- 抗幻觉:最终结论可回溯到密集帧证据;
- 任务协同:时间定位、QA 和 grounded QA 相互促进;
- 端到端可训练:工具决策与语言生成由同一策略学习;
- 长视频收益明显:越容易漏掉关键信息的场景,工具价值越高。
2. 主要局限
- 工具种类有限:当前主要使用视频裁剪,没有音频分析、目标检测、跟踪、OCR 等工具;
- 时间定位仍可能出错:第一步定位错误,后续观察也会跑偏;
- 错误会沿轨迹传播:早期思考错 → 工具区间错 → 最终答案错;
- 推理时延更高:工具调用、解码取帧和第二次生成都会增加延迟;
- 训练成本较高:需要 rollout、工具执行、奖励计算和轨迹优化;
- 最大轮次受限:当前实验没有充分展现真正多轮、递归调用工具的潜力;
- 基准不可完全横向比较:不同方法的基础模型、帧数、视频长度和提示方式并不统一。
3. 值得继续研究的方向
- 工具组合:裁剪 + 音频 + OCR + 目标检测 + 视频搜索;
- 自适应取帧:根据动作速度、场景变化和信息熵决定密度;
- 多轮递归调用:允许“粗定位 → 细定位 → 验证 → 再扩展”;
- 调用成本控制:把时延、帧数和错误风险写入奖励;
- 空间能力增强:从“何时”扩展到“何地、何人、何物”;
- 真实环境评测:在噪声、长尾事件和未剪辑视频上测试;
- 可验证奖励改进:减少规则奖励对格式和字符串匹配的依赖。