从视觉压缩,到视觉记忆:MonkeyOCRv2以重建保留文档页面证据
机器学习算法与自然语言处理
2026-07-27 01:10
文章摘要
本文介绍了MonkeyOCRv2,一个针对文档AI的视觉-文本基础模型。背景方面,文档视觉语言模型中,视觉编码器常被作为可替换前端,但自然图像预训练追求语义不变性,而文档则要求保留字符、数字、公式等细节,其丢失会导致后端信息补全。研究目的在于验证通过像素级文档重建可以保留关键视觉证据,从而提升文档理解能力。结论表明,在受控实验中,仅更换视觉编码器即可带来13.2分的差距;MonkeyOCRv2通过图像到文本生成与像素重建联合训练,使视觉表示能恢复输入信息,在8个文档理解基准上取得57.2分。在字符打乱和与语言常识冲突的测试中,重建目标显著提高识别准确率和视觉忠实度。MonkeyOCRv2还在文字识别、公式识别、文本检测等七类任务上取得一致提升,并开放包含1.13亿张文档图像的MonkeyDoc v2数据集,推动研究透明性。文章主张“重建即视觉记忆”,强调压缩后确保页面证据可恢复的重要性。
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。