• 视频理解

MOSS-VL-Realtime

会“边看边答”的开源视觉理解大模型,在持续视频流中实现即问即答、持续感知、即时改口与主动沉默。

作者
OpenMOSS Team

模型简介

在通用多模态能力上,MOSS-VL 支持中英文双语下的文本、单图、多图、单视频、多视频以及图文/视频交错输入,可完成视频描述、基于视频内容的问答与推理、跨时段事件关联、视频动作计数、图像关键信息提取、多图关联推理、OCR 识别与文档布局解析等任务。

由此,视频理解从「看完整段再作答」推进到「边看边答、边答边改」,更贴近真实在线交互场景。

功能描述

  • 实时交互:模型能在持续输入的视频流上边看边答,更能在生成回复的同时持续感知画面、即时改口乃至打断,并在信息不足时主动沉默等待——从「看完再答」迈入「边看边答、边答边改」,贴近真实在线场景。

  • 视频理解: 时序一致性、动作识别与因果推理能力全面强化,能够更准确地还原复杂视频中的事件链条、识别跨时段因果关系;本代模型的细粒度动作计数能力实现显著跃升,可精准统计视频中重复或连续动作的发生次数,在 VideoMME、MLVU、VSI-bench 等基准测试中的表现较上一代进一步领先。

  • 多模态感知: 细粒度物体识别和空间推理能力持续优化,能够在高分辨率画面中更精准地定位细小物体,并理解复杂空间关系。

  • 图像关键信息提取与多图推理:图像中文字内容识别(OCR)与推理多图之间的逻辑联系与对比关系。

  • 文档布局解析:可以将论文、报告等文档转化为 Markdown 格式,文档版面结构识别与信息提取。

Benchmark

MOSS-VL-Realtime 实时视觉理解模型评测

模型演示