BLOG
知识分享
技术文章、实战教程、经验心得
共找到 2 篇文章
RAG企业级多租户
RAG 系列(二十):企业级 RAG 架构设计
RAG 系列第二十篇。Demo 级 RAG 对所有用户共享同一个向量库,任何人都能检索到任何内容。企业场景需要三件事:多租户隔离(不同公司/部门的知识库互不可见)、权限控制(工程师看不到 HR 文档,HR 看不到财务数据)、服务化(缓存重复问题 + 限流防止滥用)。本文用 Qdrant Collection 实现多租户,用元数据过滤器做权限控制,用滑动窗口实现限流,5 个场景验证全部通过。
·约 10 分钟阅读
RAG性能优化缓存
RAG 系列(二十一):性能优化——又快又省钱
RAG 系列第二十一篇。一次 RAG 请求涉及两种 API 调用:Embedding 和 LLM,都是按量计费且有延迟。四种优化:LLM 响应缓存(相同问题 0ms 返回,5057ms→0.8ms)、Embedding 缓存(重复文本零 API 调用)、Semantic Cache(相似问题复用答案,但阈值校准是难点)、异步批量 Embedding(12 条文本 2.87x 加速)。每种优化独立测量,数据说话。
·约 10 分钟阅读