跳到正文
arXiv AI· Zhuchenyang Liu, Yao Zhang, Yu Xiao·· 14 小时前评分60

Inverting Multi-Vector Visual Document Indices

摘要

主流多向量视觉文档检索器将每页存储为约一千个拼接向量,通常存放在第三方运营的向量数据库中。由于无人能从向量中读取一页,该索引被认为比实际页面更不敏感。然而,由于索引按拼接向量的 raster 顺序保留一个向量,并且每个向量由预训练的视觉-语言模型计算得出,因此我们推测,任何运行或破坏该存储的人,均可从其索引中重建一页。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org