BLOG
知识分享
技术文章、实战教程、经验心得
共找到 3 篇文章
RAG多模态Multimodal
RAG 系列(二十三):多模态 RAG——图片、表格也能检索
RAG 系列第二十三篇。真实文档里 30%–50% 的信息藏在图片和表格里,文本 RAG 完全看不到。三条处理路线:OCR/解析提取后文本化(最成熟)、CLIP 多模态 Embedding(图文同一向量空间)、ColPali 直接把 PDF 页面当图像处理(2024 年最新方法,绕开文本提取)。每条路线各自的适用场景和局限。
·约 11 分钟阅读
RAG代码理解AST
RAG 系列(二十四):代码 RAG——让 AI 理解你的代码库
RAG 系列最终篇。代码不是文档,它有结构(函数/类)、语义(docstring)和调用关系(call graph)——普通文本分块会把这些全部丢掉。本文用 AST 解析 llm-in-action 代码库(22 个 Python 文件、225 个代码单元),构建调用图(168 条边),实现语义代码搜索和调用链查询。代码运行结果:`build_self_rag_graph` 的完整下游调用链、`main` 的 54 个直接调用、`build_index` 的调用树全部被正确找出。
·约 10 分钟阅读
RAG长上下文Large Context
RAG 系列(二十二):长上下文 vs RAG——要不要 RAG
RAG 系列第二十二篇。Gemini 1.5 Pro 和 Claude 的百万 token 上下文窗口,让一部分人觉得 RAG 要过时了。这篇文章拆解两条路的实际代价:长上下文在成本和延迟上不是免费午餐;RAG 的检索会出错,召回不全。最后给出一个决策框架:文档量、更新频率、查询次数、延迟要求四个维度定位你的场景,再加一种两者兼用的混合策略。
·约 8 分钟阅读