技术文章、实战教程、经验心得
RAG 系列第二十三篇。真实文档里 30%–50% 的信息藏在图片和表格里,文本 RAG 完全看不到。三条处理路线:OCR/解析提取后文本化(最成熟)、CLIP 多模态 Embedding(图文同一向量空间)、ColPali 直接把 PDF 页面当图像处理(2024 年最新方法,绕开文本提取)。每条路线各自的适用场景和局限。