模思智能创始人邱锡鹏教授受邀出席第四届中国 AIGC 产业峰会并发表主题演讲

63c19572980269f62aef59f41dc8d238

2026年5月20日,由量子位主办的第四届中国AIGC产业峰会在北京隆重举行。本届峰会以“@所有人,马上AI起来”为主题,汇聚近20位产业与学术界顶尖专家、企业领袖,共同探讨生成式AI、大模型技术与行业落地的未来趋势,现场观众超千人,线上直播观看人数近千万,吸引了主流科技媒体的广泛关注与报道。

pzN0eCRo

复旦大学特聘教授、上海创智学院院长助理、模思智能(MOSI)创始人 邱锡鹏教授 受邀参加本次峰会并发表主题演讲**《MOSS多模态模型及其推理优化》**,与行业同仁分享前沿技术洞见。

tK1kqP8o

邱教授指出,未来我们一定会进入泛情境智能时代,其中非常重要的就是交互。未来的多模态模型需要去充分理解情境,要面对更长的上下文、更大的Token消耗量和更多的实时推理需求。以下为本次发言亮点精华提炼在 “MOSS多模态模型及其推理优化” 的分享中,邱教授围绕多模态大模型的能力边界、实时交互需求和未来智能时代的关键技术方向,提出了多项核心观点:

f7d443a58e7c5bd6a3816d5ba2a35cc01779445813514

AI 将进入泛情境智能时代,交互会成为关键部分

未来更强大的AI必须具备对广义context(情境)的深度理解能力,而人与AI之间的交互将成为智能系统价值的重要体现。多模态理解不仅限于文字,还需涵盖视觉、音频等信号,使AI能够理解用户所处的全局情境。

实时交互下的多模态模型挑战

面向实时交互的多模态AI,需要处理更长的上下文、更复杂的信息维度,同时满足高性能、低延迟的推理需求,为模型架构和推理设计带来全新挑战。多模态Token的消耗远高于传统文本或编码任务,对模型和推理框架提出更严格要求。

TrHUVZTT

视频与时序推理将成为核心能力

视频理解在信息密度和时序逻辑上具备独特优势,是未来多模态交互系统的核心能力之一。

MOSS系列模型创新亮点

MOSS-VL采用cross attention结构,实现视频流持续输入,文本模型按需获取动态视觉信息,使交互更自然;MOSS-VL 开源发布:交叉注意力架构驱动视频理解新范式,Open MOSS 多模态生态再添核心拼图

MOSS-Audio致力于在更广义的情境中,不仅听清语音内容,还理解场景与情感等复杂信息;在ASR、speech caption与带时间戳ASR等任务中已达到一线专用模型水平;MOSS-Audio:一个模型,听懂所有声音

MOSS-TTS构建了覆盖语音合成、轻量化、声音设计与实时性需求的端到端能力,其基于纯Transformer架构的audio tokenizer已被广泛使用,开源后下载量超过百万。MOSS-TTS Family正式发布!真正生产级全场景覆盖:复刻、长语音、对话、指令、音效

邱教授在演讲中强调,未来智能交互系统应实现视觉理解、语音理解和语音输出的无缝融合,构建面向情境交互的端到端模型,这是AI走向更广泛应用的关键一步。