RAG（检索增强生成）流程的基本步骤是什么？	接收源文档 -> 将其切分成文本块（Chunks）-> 根据用户问题找到最相关的文本块 -> 将文本块放入提示词（Prompt）中。
在RAG流程中，文档切分（Chunking）为什么被认为是复杂且关键的一步？	切分方式对RAG流程的最终质量有巨大的影响，不当的切分可能导致上下文丢失或错误信息插入。
什么是基于大小的切分策略（Size-based Chunking）？	将整个文档简单地分割成一系列长度大致相等的文本字符串。
基于大小的切分策略的主要缺点是什么？	每个文本块可能包含被截断的词（Cutoff words），并且缺乏周围的上下文信息。
如何通过“重叠策略”（Overlap Strategy）解决基于大小切分的上下文缺失问题？	在相邻的文本块之间包含一定数量的重叠字符，使每个块都包含部分邻近块的上下文。
什么是基于结构切分策略（Structure-based Chunking）？	根据文档的整体结构（如标题、段落、章节）来划分文本块。
基于结构切分策略的局限性是什么？	它要求文档具有明确、可预测的结构（例如Markdown格式），不适用于格式不确定的纯文本或PDF。
什么是基于语义的切分策略（Semantic-based Chunking）？	使用自然语言处理（NLP）技术来判断连续句子或段落之间的相关性，然后将相关内容组合成文本块。
相比于大小和结构切分，基于语义切分属于哪种技术级别？	它是更高级、更复杂的自然语言处理技术。
在实际应用中，选择哪种切分方法取决于什么？	取决于特定的使用场景（Use Case）以及对输入文档结构所能提供的保证（Gu
默认的块（chunk）设置是什么？	块长度为150，重叠度为20。
如何提高块的质量？	调整块的长度和重叠度。
块重叠（overlap）的作用是什么？	确保跨越多个块的复杂短语不会丢失。
“按句子分块”（Chunk by Sentence）策略的特点是什么？	使用正则表达式按句子分割，默认每块包含5个句子和1个句子的重叠。
“按章节分块”（Chunk by Section）策略适用于哪种文档？	结构明确、有预定章节的文档（如摘要、目录）。
“按章节分块”的主要局限性是什么？	无法处理缺乏格式保证的文档。
“按字符分块”（Chunk by Character）的特点是什么？	是一种可靠的备用标准，虽然不保证最佳结果，但适用性广。
选择哪种分块策略取决于什么？	文档的性质和结构保证。
为什么不建议按句子分块处理代码？	代码中可能存在不寻常的句号，导致分割错误。
