南大×阿里提出TVIR:深度研究Agent迈入图文交错时代
机器学习算法与自然语言处理
2026-07-26 01:29
文章摘要
本文介绍了南京大学与阿里巴巴联合提出的TVIR(Text-Visual Interleaved Report Generation)框架,旨在解决当前深度研究智能体在生成报告时忽视视觉证据整合的问题。研究背景指出,现有基准大多以文本为中心,无法满足真实专业报告对图文交错、多模态证据支撑的需求。研究目的是构建一个统一基准与智能体框架,系统评估智能体的多模态能力。TVIR包含TVIR-Bench基准(100道专家级多模态任务)和TVIR-Agent框架(四阶段多智能体架构),并提出双路径评估体系兼顾文本与视觉质量。实验表明,TVIR-Agent在文本和视觉整合上整体优于现有商业系统,特别是在引用支持和跨模态对齐方面表现突出。研究总结指出,当前系统在文本综合上强于视觉整合,TVIR为未来可信的多模态深度研究智能体奠定了基础。
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。