当我们需要在一段几小时长的视频中寻找某个关键证据时,人类的做法是什么?
通常是先快速扫一遍,找到可疑的片段,然后仔细查看那些片段,再根据发现的新线索调整搜索方向——这是一个迭代的、交错的"线索寻求"过程。
但现有的多模态大语言模型( MLLM )处理长视频的方式却完全不同:它们通常对整个视频进行均匀采样,然后单次推理就给出答案。这种方式有两个明显的缺陷:
- 注意力分散:推理过程和工具调用混在一起,导致模型难以集中注意力
- 上下文效率低:冗余的视觉内容占据了大量上下文,而真正关键的线索反而被淹没
Video-o3 要解决的,正是这两个问题。
核心创新:原生交错工具调用
Video-o3 的核心思想是让模型能够迭代式地发现显著视觉线索、细粒度检查关键片段、并在获得足够证据时自适应终止。
这听起来很像人类的信息 seeking 行为。而实现这一点的关键技术有两个:
1. 任务解耦注意力掩码( Task-Decoupled Attention Masking )
在交错工具调用场景中,推理过程和工具调用过程是异构的——如果把它们放在一起处理,会导致注意力分散。
Video-o3 提出的 Task-Decoupled Attention Masking 能够隔离每一步的专注区域,同时保留共享的全局上下文。这就像是为不同的"思维线程"分配独立的注意力通道,避免相互干扰。
2. 可验证轨迹引导奖励( Verifiable Trajectory-Guided Reward )
多轮交互会带来上下文长度快速增长的问题。 Video-o3 引入了可验证轨迹引导奖励,在探索覆盖率和推理效率之间取得平衡。
这个奖励机制的核心是:只有那些产生了有效线索发现轨迹的步骤才会获得正向奖励,而超出轮次限制的轨迹会被 mask 掉,不参与优势计算。
VideoCrop 工具:动态寻求视觉线索
Video-o3 的工具调用以 VideoCrop 为核心——模型可以动态地"裁剪"出视频中的特定时间窗口和空间区域,进行细粒度检查。
模型的工作流程是:
- 初步扫描:快速浏览视频,识别可疑区域
- 迭代探索:调用 VideoCrop 工具,聚焦于关键片段
- 证据聚合:将多个线索的发现整合起来
- 自适应终止:当证据足够时,停止搜索并给出答案
Seeker-173K 数据集
为了让模型学会这种交错式的线索寻求能力,团队开发了一条可扩展的数据合成 pipeline,并构建了 Seeker-173K 数据集,包含 173K 高质量的工具交互轨迹。
这些轨迹同时用于监督学习( SFT )和强化学习( GRPO )阶段的训练。
实验结果
Video-o3 在多个长视频理解基准上取得了 state-of-the-art 的表现:
| 基准 | 准确率 |
|---|---|
| MLVU | 72.1% |
| Video-Holmes | 46.5% |
| VideoMME | 66.5% |
| VideoMMMU | 51.7% |
特别值得注意的是, Video-o3 在需要多跳推理的任务上表现尤为突出,这验证了原生工具调用范式在长视频场景中的有效性。
消融实验的发现
论文的消融实验揭示了一些有趣的洞察:
Task-Decoupled Attention Masking 的最优 mask ratio 为 0.1——这个值能够平衡推理性能和注意力控制。
可验证轨迹引导奖励中的 Hybrid Clue Score 和 Turn Decay Factor 是最关键的设计,它们通过强制时序监督和战略决策,显著提升了工具使用的有效性和模型一致性。
局限与未来方向
论文也坦诚地指出了当前 limitations :
- 交互深度受限:当前系统的多轮交互次数有上限,对于超长视频可能不够
- 工具可扩展性:目前工具集相对有限
未来的改进方向包括:
- 动态上下文管理:更智能地管理长上下文
- Code-as-Action 范式:用代码生成替代预定义工具,提升灵活性
arXiv: 2601.23224 | Xiangyu Zeng et al. | 2026-01-30