摘要音频
本节课没有语音摘要。
学习笔记
📚 学习笔记:上下文检索 (Contextual Retrieval)
核心概念:
- 定义: 上下文检索是一种提高检索增强生成 (RAG) 管道准确性的技术。
- 解决的问题: 当原始文档被分割成文本块 (chunks) 时,每个单独的文本块往往会丢失原始文档的整体上下文信息。
工作流程 (Pre-processing Step):
- 目标: 在将文本块插入检索数据库之前,增加一个预处理步骤。
- 步骤:
- 将单个文本块 + 原始源文档输入给大型语言模型 (LLM,如 Claude)。
- 要求 LLM 撰写补充文本,用于“定位”或增加该文本块在整个文档中的上下文。
- 输出结果: 原始文本块 + LLM 生成的额外上下文 = 上下文化文本块 (Contextualized Chunk)。
- 将上下文化文本块作为输入,用于向量索引和 BM25 索引。
处理超大文档的策略:
- 限制: 如果原始源文档过大,无法一次性放入 LLM 的提示词 (prompt) 中,则不能提供整个文档。
- 解决方案: 采用有限的上下文片段来辅助定位。
- 起始块 (Starter Chunks): 选取文档开头的几个文本块(通常包含摘要或概述)。
- 前置块 (Preceding Chunks): 选取目标文本块之前的几个文本块(提供局部上下文)。
- 目的: 显著减少输入 LLM 的文本量,同时保留关键的上下文信息。
关键优势:
- 通过提供更丰富的上下文,可以显著提高检索的准确性,尤其适用于具有复杂内部关联的文档。
Takeaways
- 上下文检索是一种提高检索增强生成 (RAG) 管道准确性的技术,旨在解决文本块分割时丢失整体上下文的问题。
- 核心工作流程是利用大型语言模型 (LLM) 为原始文本块生成补充文本,从而创建“上下文化文本块”。
- 当源文档过大无法一次输入 LLM 时,可采用起始块或前置块等有限的上下文片段来辅助定位。
- 通过提供更丰富的上下文信息,上下文检索能够显著提高检索的准确性,尤其适用于复杂文档。
抽认卡 6 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.