拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【Vid】Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

【Vid】Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

note

  • 核心结论:VITAL 让多模态大模型在回答视频问题前,先判断“要不要回看、回看哪一段”,再通过视频裁剪工具获取关键时间段的密集帧,形成“文本推理 + 视觉证据”的多模态思维链。该方法主要解决长视频理解中的跨模态交互不足和幻觉,在 11 个视频理解基准上取得领先,尤其擅长长视频问答和时间定位。
  • VITAL 的本质,是教会多模态大模型在视频推理中“不懂就回看”:模型先形成时间假设,再调用视频裁剪工具密集观察关键片段,最后依据真实画面作答;
  • 通过 SFT 冷启动与 DGRPO 强化学习,将时间定位、视频问答和 grounded QA 联合训练,从而显著改善长视频理解并抑制幻觉。
  • 其最具启发性的设计不是某一个网络模块,而是三种机制的闭环:工具提供证据 → 时间定位指导工具 → 问答验证定位价值。

文章目录

  • note
  • 一、研究动机
    • 1. 长视频理解难在哪里?
    • 2. 现有方法的两个缺陷
      • 3. 核心洞察
  • 二、论文核心
    • 1. VITAL 是什么?
    • 2. 多轮工具调用机制
      • 每一轮模型要做什么?
      • 是“多轮 agent”,但实验主要限制为一次调用
      • 典型轨迹
    • 3. 工具有哪些?
      • 为什么最终选择视频裁剪?
    • 4. 多任务训练设计
      • (1)时间定位(Temporal Grounding)
      • (2)视频问答(Video QA)
      • (3)基于定位的问答(Grounded QA)
    • 5. 数据集:MTVR-CoT-72k 与 MTVR-RL-110k
      • 数据筛选策略
      • 两个数据集的分工
    • 6. 两阶段训练
      • 第一阶段:SFT 冷启动
      • 第二阶段:DGRPO 强化学习
  • 三、实验结果
    • 1. 总体结论
      • 最值得关注的趋势
    • 2. 工具到底有没有用?
  • 四、结果分析
    • 1. 为什么多模态 CoT 优于文本 CoT?
      • 文本 CoT 的失败模式
      • 多模态 CoT 的修正机制
    • 2. 时间定位为什么能帮助视频问答?
    • 3. DGRPO 解决了什么?
  • 五、优势、局限与后续方向
    • 1. 主要优势
    • 2. 主要局限
    • 3. 值得继续研究的方向

一、研究动机

Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
CVPR 2026
https://github.com/tongjingqi/Thinking-with-Video

1. 长视频理解难在哪里?

视频推理要求模型从动态画面中识别对象、关系、事件及其因果关系,典型任务包括:

  • 视频问答(Video QA)
  • 时间定位(Temporal Grounding)
  • 时空定位(Spatial-Temporal Grounding)
  • 视频字幕生成

长视频的难点不只是“帧数多”,而是:

  1. 关键信息稀疏:答案往往只依赖几秒;
  2. 时间依赖强:事件原因可能出现在很久之前;
  3. 视觉计算昂贵:不能无差别地把所有帧送入模型;
  4. 容易遗忘与幻觉:模型可能凭语言先验“编答案”。

2. 现有方法的两个缺陷

此前许多视频多模态大模型主要使用基于文本的思维链(text-based CoT):模型先看少量采样帧,然后在文字中逐步推理。

这种方法存在两个问题:

  • 跨模态交互不足:后续推理主要操作文字,不再主动查看视频;
  • 幻觉随链条增长而累积:推理步骤越多、视频越长,越容易偏离画面事实。

3. 核心洞察

人在不确定视频内容时,不会只凭第一眼印象硬猜,而会:

暂停、回放、放大关键片段,再下结论。

VITAL 要把这种“按需回看”能力教给模型:

  • 模型先形成初步假设;
  • 主动调用视觉工具;
  • 密集观察疑似时间段;
  • 根据真实画面修正答案。

因此,论文标题中的“Thinking with Videos”不是简单“看图后推理”,而是:在推理过程中持续引入新的视频证据。


二、论文核心

1. VITAL 是什么?

VITAL(Video Intelligence via Tool-Augmented Learning)是一个端到端的 agentic 视频推理框架,由两部分组成:

  1. 多模态大模型(MLLM):负责理解、推理、决策和作答;
  2. 视觉工具箱(Visual Toolbox):按模型要求返回新的视频证据。

其推理轨迹可表示为:

τ = T 1 → C 1 → V 1 → T 2 → ⋯ → A n \tau= \mathcal{T}_1 \rightarrow \mathcal{C}_1 \rightarrow \mathcal{V}_1 \rightarrow \mathcal{T}_2 \rightarrow \cdots \rightarrow \mathcal{A}_nτ=T1​→C1​→V1​→T2​→⋯→An​

其中:

  • T \mathcal{T}T:文本思考步骤;
  • C \mathcal{C}C:工具调用;
  • V \mathcal{V}V:工具返回的视频证据;
  • A \mathcal{A}A:最终答案。

这形成一条多模态思维链(multimodal CoT):推理过程不仅出现文字,也出现真实视频帧。


2. 多轮工具调用机制

每一轮模型要做什么?

在第 (k) 轮,模型根据历史信息生成:

O k = f M L L M ( { T i , C i , V i } i = 0 k ) \mathcal{O}_k=f_{MLLM} \left( \{\mathcal{T}_i,\mathcal{C}_i,\mathcal{V}_i\}_{i=0}^{k} \right)Ok​=fMLLM​({Ti​,Ci​,Vi​}i=0k​)

随后解析器从中提取:

  • 下一步思考T k + 1 \mathcal{T}_{k+1}Tk+1​;
  • 工具调用请求( C k + 1 (\mathcal{C}_{k+1}(Ck+1​;
  • 或最终答案A k + 1 \mathcal{A}_{k+1}Ak+1​。

若模型选择调用工具,则执行:

V k + 1 = g t o o l ( C k + 1 ) \mathcal{V}_{k+1}=g_{tool}(\mathcal{C}_{k+1})Vk+1​=gtool​(Ck+1​)

工具结果重新进入模型上下文,开启下一轮推理。

是“多轮 agent”,但实验主要限制为一次调用

需要区分两个层面:

层面实际设计
框架能力支持多轮工具调用,允许模型反复观察视频
实验配置主要采用视频裁剪工具,每个问题最多调用一次
生成阶段最多约两个生成阶段:初始推理 → 可选工具 → 最终回答

因此更准确的表述是:

架构上是多轮工具调用 agent;当前实验是“单轮工具决策 + 两段生成”的 agentic RL。

它并非只能对最终答案做单轮强化学习,而是优化完整轨迹:

问题 → 是否调用工具 → 调用参数 → 观察返回帧 → 修正答案 \text{问题} \rightarrow \text{是否调用工具} \rightarrow \text{调用参数} \rightarrow \text{观察返回帧} \rightarrow \text{修正答案}问题→是否调用工具→调用参数→观察返回帧→修正答案

典型轨迹

不调用工具:

问题 → 思考 → 直接回答

调用工具:

问题 → 初步思考 → Get_video_clip_frame(120, 180) → 观察密集帧 → 依据视觉证据推理 → 最终答案

3. 工具有哪些?

论文测试了三类视频工具,但最终主要采用视频裁剪取帧。

工具输入返回特点采用情况
视频片段字幕起止时间文字描述或字幕压缩视觉信息,可能丢失细节候选测试
片段视觉问答时间段 + 子问题子问题答案可验证假设,但会引入中间模型误差候选测试
视频裁剪取帧start_time, end_time该区间的密集采样帧直接提供视觉证据,最利于减少幻觉主要采用

核心工具为:

V k + 1 = g c l i p ( V 0 , t s t a r t , t e n d ) \mathcal{V}_{k+1}=g_{clip}(\mathcal{V}_0,t_{start},t_{end})Vk+1​=gclip​(V0​,tstart​,tend​)

即:

Get_video_clip_frame(start_time, end_time)

它不是生成一个新视频文件,而是:

  1. 接收原始视频;
  2. 解析模型给出的时间区间;
  3. 在该区间密集抽取帧;
  4. 将帧序列返回给模型。

为什么最终选择视频裁剪?

  • 时间定位任务本身要求预测起止时间;
  • 密集帧能直接显示动作、对象和事件边界;
  • 字幕工具可能受语音识别错误影响;
  • 片段 VQA 会把判断权交给另一个模型;
  • 让原模型亲自观察证据,更有利于抑制幻觉。

对应论文表格:

  • 表 6:不同视觉工具的消融比较,说明视频裁剪效果最好。

4. 多任务训练设计

VITAL 同时优化三个相互关联的任务:

(1)时间定位(Temporal Grounding)

输入:

“什么时候有人打开冰箱?”

输出:

<t_start>12.5</t_start> <t_end>14.8</t_end>

它训练模型理解“事件发生在哪一段时间”。

(2)视频问答(Video QA)

输入:

“视频中的人最后做了什么?”

输出:

“他把书放进了背包。”

它训练模型综合视频内容进行推理。

(3)基于定位的问答(Grounded QA)

要求同时输出:

  • 相关时间段;
  • 对应答案。

它把前两个任务结合起来:

先找到证据所在时间,再依据证据作答。

论文认为时间定位与视频问答互为因果、互相促进:

  • 时间定位帮助模型聚焦关键片段;
  • 视频问答帮助模型理解为什么要定位该片段;
  • Grounded QA 强制模型把答案绑定到视频证据。

5. 数据集:MTVR-CoT-72k 与 MTVR-RL-110k

原始数据来自:

  • Charades-STA
  • ActivityNet-MR
  • VidChapters-7M
  • Video-R1
  • LongVideo-Reason
  • ReXTime
  • NExT-GQA

数据筛选策略

对每个样本生成 (k=8) 条高温度 rollout,保留“中等难度”样本:

  • 全部答对(PassAll@k):太简单,RL 学不到新东西;
  • 全部答错(PassNone@k):太难,容易产生噪声梯度;
  • 部分答对:难度适中,保留。

随后使用强推理模型生成:

  • 所有样本的基于文本 CoT;
  • 长视频样本的多模态 CoT;
  • 长视频时间定位的工具参数:在真实时间区间上添加约 20% 噪声;
  • 长视频 QA 的工具参数:由推理模型自主决定。

两个数据集的分工

数据集规模阶段作用
MTVR-CoT-72k约 7.2 万监督微调(SFT)冷启动,学习格式、推理和工具调用
MTVR-RL-110k约 11 万强化学习(RL)优化工具决策、时间定位和答案策略

对应论文图示:

  • 图 4:数据 rollout、难度过滤与 CoT 生成流程。
  • 图 5:两个数据集的构成与用途。

6. 两阶段训练

第一阶段:SFT 冷启动

学习目标:

  • 按指定格式输出思考、工具调用和答案;
  • 学会初步的时间定位;
  • 学会根据返回帧修正结论;
  • 在三个任务间建立共同表示。

第二阶段:DGRPO 强化学习

传统 GRPO 对同一问题的多个 rollout 计算相对优势。VITAL 提出DGRPO(Difficulty-aware GRPO),进一步考虑:

  • 不同任务的难度差异;
  • 同任务内不同样本的难度差异;
  • 全对样本的奖励饱和;
  • 全错样本的信号噪声。

DGRPO 会动态调整奖励尺度,使:

  • 简单 VQA 不淹没困难时间定位;
  • 困难样本不因偶尔答对而获得过高优势;
  • 过易、过难样本不主导训练。

奖励通常包括:

  • 答案正确性;
  • 时间区间 IoU;
  • 输出格式是否合法;
  • 工具调用是否合理;
  • 是否避免无效或重复调用。

对应论文公式与表格:

  • 公式(3)及后续 DGRPO 推导:难度感知奖励缩放。
  • 表 7:DGRPO 相对普通 GRPO 的增益。
  • 表 8:难度过滤与数据筛选的消融结果。

三、实验结果

1. 总体结论

VITAL 在11 个视频理解基准上进行评测,覆盖:

  • 长视频问答;
  • 时间定位;
  • 片段检索;
  • 通用视频理解。

论文所报告的代表性结果包括:

基准VITAL 结果对比最佳开源基线提升
LongVideo-Reason79.3%67.9%+11.4
VidChapters-7M(R@0.5)34.7%27.4%+7.3
ReXTime(mIoU)明显提升—工具带来+6.7
LongVideo-Reason明显提升—工具带来+9.1
VidChapters-7M(R@0.5)明显提升—工具带来+8.9

注:不同基准的指标口径不同,跨任务百分比不能直接比较;上表用于说明收益方向,精确数值应以论文对应表格为准。

最值得关注的趋势

  1. 视频越长,工具收益越大;
  2. 时间定位能力能迁移到视频问答;
  3. 多模态 CoT 比纯文本 CoT 更可靠;
  4. DGRPO 能缓解多任务训练中的难度失衡;
  5. 合理的数据筛选比单纯扩大数据更重要。

2. 工具到底有没有用?

论文通过“启用工具 / 不启用工具”进行比较,主要结论如下:

任务工具带来的典型增益原因
LongVideo-Reason约+9.1长视频初始采样容易漏掉关键事件
VidChapters-7M R@0.5约+8.9时间边界需要密集观察才能校准
ReXTime mIoU约+6.7起止时间预测需要局部视觉证据
短视频 QA较小初始帧已包含大部分信息
简单计数/属性题可能为负或接近零工具调用增加成本,却无信息增益

这说明工具不是“越多越好”,模型必须学会:

只在初始证据不足、回看预期收益较高时调用工具。

对应论文表格:

  • 表 1、表 2:VITAL 与现有方法在 11 个基准上的主结果。
  • 表 3、表 4:工具调用、初始帧数、最大轮次等消融。
  • 表 6:不同视觉工具的效果比较。

四、结果分析

1. 为什么多模态 CoT 优于文本 CoT?

文本 CoT 的失败模式

看到稀疏帧 → 猜测事件可能发生在中段 → 用语言推理补齐细节 → 错误逐步累积 → 输出一个听起来合理的答案

问题在于:一旦初始观察不足,后续推理只是在重新组合先验知识,没有回到视频验证。

多模态 CoT 的修正机制

初步观察 → 提出假设:“关键事件可能在 200–260 秒” → 调用裁剪工具 → 看到密集帧 → 发现真实事件在 238–251 秒 → 根据画面重新作答

关键差别是:

推理链中存在一个可验证的视觉反馈环节。

这相当于把“想当然”变成“提出假设—搜集证据—更新结论”。


2. 时间定位为什么能帮助视频问答?

传统做法常把两个任务分开:

  • 时间定位模型:输入描述,输出时间段;
  • 视频 QA 模型:输入视频和 question,输出答案。

VITAL 发现二者共享底层能力:

  • 回答“最后谁打开了门”,需要先定位“最后”和“开门”;
  • 回答“两个人物何时第一次相遇”,需要同时定位事件和时间;
  • 回答“为什么主角停下来”,需要回溯原因事件发生的时间段。

因此,VITAL 用时间定位作为:

  1. 表示学习任务:学会把语言描述映射到视频时间;
  2. 工具调用任务:学会为 QA 选择回看区间;
  3. 可验证监督信号:IoU 比开放文本答案更容易客观评判。

3. DGRPO 解决了什么?

假设一个 batch 中同时存在:

  • 一道简单的是非题;
  • 一道跨越 30 分钟的时间定位题。

若直接使用原始奖励:

  • 简单题奖励波动小、模型容易全对;
  • 难题奖励信号弱、训练不稳定;
  • 简单任务可能主导梯度;
  • 难题反而学不到有效策略。

DGRPO 的难度感知机制相当于:

给“跳一跳够得着”的样本更高学习权重,降低全对与全错样本的干扰。

这带来三个效果:

  1. 训练更稳定;
  2. 多任务性能更均衡;
  3. 模型更愿意挑战需要工具调用的困难样本。

五、优势、局限与后续方向

1. 主要优势

  • 按需计算:不必把所有视频帧都送入模型;
  • 可解释:思考与工具调用暴露了模型的“关注区间”;
  • 抗幻觉:最终结论可回溯到密集帧证据;
  • 任务协同:时间定位、QA 和 grounded QA 相互促进;
  • 端到端可训练:工具决策与语言生成由同一策略学习;
  • 长视频收益明显:越容易漏掉关键信息的场景,工具价值越高。

2. 主要局限

  • 工具种类有限:当前主要使用视频裁剪,没有音频分析、目标检测、跟踪、OCR 等工具;
  • 时间定位仍可能出错:第一步定位错误,后续观察也会跑偏;
  • 错误会沿轨迹传播:早期思考错 → 工具区间错 → 最终答案错;
  • 推理时延更高:工具调用、解码取帧和第二次生成都会增加延迟;
  • 训练成本较高:需要 rollout、工具执行、奖励计算和轨迹优化;
  • 最大轮次受限:当前实验没有充分展现真正多轮、递归调用工具的潜力;
  • 基准不可完全横向比较:不同方法的基础模型、帧数、视频长度和提示方式并不统一。

3. 值得继续研究的方向

  1. 工具组合:裁剪 + 音频 + OCR + 目标检测 + 视频搜索;
  2. 自适应取帧:根据动作速度、场景变化和信息熵决定密度;
  3. 多轮递归调用:允许“粗定位 → 细定位 → 验证 → 再扩展”;
  4. 调用成本控制:把时延、帧数和错误风险写入奖励;
  5. 空间能力增强:从“何时”扩展到“何地、何人、何物”;
  6. 真实环境评测:在噪声、长尾事件和未剪辑视频上测试;
  7. 可验证奖励改进:减少规则奖励对格式和字符串匹配的依赖。

返回列表