长视频多跳推理的原生工具调用

2026-01-30 📁 intelligence 🏷️ 大语言模型 深度学习

当我们需要在一段几小时长的视频中寻找某个关键证据时,人类的做法是什么?

通常是先快速扫一遍,找到可疑的片段,然后仔细查看那些片段,再根据发现的新线索调整搜索方向——这是一个迭代的、交错的"线索寻求"过程。

但现有的多模态大语言模型( MLLM )处理长视频的方式却完全不同:它们通常对整个视频进行均匀采样,然后单次推理就给出答案。这种方式有两个明显的缺陷:

  1. 注意力分散:推理过程和工具调用混在一起,导致模型难以集中注意力
  2. 上下文效率低:冗余的视觉内容占据了大量上下文,而真正关键的线索反而被淹没

Video-o3 要解决的,正是这两个问题。

核心创新:原生交错工具调用

Video-o3 的核心思想是让模型能够迭代式地发现显著视觉线索、细粒度检查关键片段、并在获得足够证据时自适应终止。

这听起来很像人类的信息 seeking 行为。而实现这一点的关键技术有两个:

1. 任务解耦注意力掩码( Task-Decoupled Attention Masking )

在交错工具调用场景中,推理过程和工具调用过程是异构的——如果把它们放在一起处理,会导致注意力分散。

Video-o3 提出的 Task-Decoupled Attention Masking 能够隔离每一步的专注区域,同时保留共享的全局上下文。这就像是为不同的"思维线程"分配独立的注意力通道,避免相互干扰。

2. 可验证轨迹引导奖励( Verifiable Trajectory-Guided Reward )

多轮交互会带来上下文长度快速增长的问题。 Video-o3 引入了可验证轨迹引导奖励,在探索覆盖率和推理效率之间取得平衡。

这个奖励机制的核心是:只有那些产生了有效线索发现轨迹的步骤才会获得正向奖励,而超出轮次限制的轨迹会被 mask 掉,不参与优势计算。

VideoCrop 工具:动态寻求视觉线索

Video-o3 的工具调用以 VideoCrop 为核心——模型可以动态地"裁剪"出视频中的特定时间窗口和空间区域,进行细粒度检查。

模型的工作流程是:

  1. 初步扫描:快速浏览视频,识别可疑区域
  2. 迭代探索:调用 VideoCrop 工具,聚焦于关键片段
  3. 证据聚合:将多个线索的发现整合起来
  4. 自适应终止:当证据足够时,停止搜索并给出答案

Seeker-173K 数据集

为了让模型学会这种交错式的线索寻求能力,团队开发了一条可扩展的数据合成 pipeline,并构建了 Seeker-173K 数据集,包含 173K 高质量的工具交互轨迹。

这些轨迹同时用于监督学习( SFT )和强化学习( GRPO )阶段的训练。

实验结果

Video-o3 在多个长视频理解基准上取得了 state-of-the-art 的表现:

基准准确率
MLVU72.1%
Video-Holmes46.5%
VideoMME66.5%
VideoMMMU51.7%

特别值得注意的是, Video-o3 在需要多跳推理的任务上表现尤为突出,这验证了原生工具调用范式在长视频场景中的有效性。

消融实验的发现

论文的消融实验揭示了一些有趣的洞察:

Task-Decoupled Attention Masking 的最优 mask ratio 为 0.1——这个值能够平衡推理性能和注意力控制。

可验证轨迹引导奖励中的 Hybrid Clue Score 和 Turn Decay Factor 是最关键的设计,它们通过强制时序监督和战略决策,显著提升了工具使用的有效性和模型一致性。

局限与未来方向

论文也坦诚地指出了当前 limitations :

  1. 交互深度受限:当前系统的多轮交互次数有上限,对于超长视频可能不够
  2. 工具可扩展性:目前工具集相对有限

未来的改进方向包括:


arXiv: 2601.23224 | Xiangyu Zeng et al. | 2026-01-30

© 2026 Hot Ingest