摘要音频
本节课没有语音摘要。
学习笔记
📚 RAG 流程中的语义搜索与文本嵌入 (Text Embeddings)
一、 核心概念与目标
- RAG 流程阶段: 在提取文本块 (text chunks) 后,下一步是接收用户查询 (query)。
- 核心任务: 找到与用户问题相关的文本块,并将它们作为上下文 (context) 放入提示词 (prompt) 中。
- 解决思路: 这是一个搜索问题,最常用的方法是实现语义搜索 (Semantic Search)。
二、 文本嵌入 (Text Embeddings)
- 定义: 文本嵌入是文本所包含的含义的数值表示。
- 生成方式: 由嵌入模型 (Embedding Model) 生成。
- 输出结构: 模型接收文本后,会输出一个长数字列表(即嵌入)。
- 数字含义: 嵌入中的每个数字代表输入文本某种特性的评分(例如:文本的“快乐度”或“水果相关度”)。
- 注意: 实际操作中,我们通常不确定每个数字具体代表什么质量,但将其视为某种特性的分数非常有助于理解。
三、 实际操作与实现
- 推荐提供商: Voyage AI。
- 配置要求:
- 需要单独注册账号并获取 API Key。
- 将 API Key 添加到 . env 文件中,变量名为 voyage_api_key。
- 功能实现: 使用 generate_embedding 函数将文本转换为嵌入列表。
- 后续重点: 理解嵌入如何融入整个 RAG 流程中。
Takeaways
- RAG流程的核心搜索任务是实现语义搜索,以找到与用户查询相关的文本块。
- 文本嵌入(Text Embeddings)是文本所包含的含义的数值表示。
- 嵌入模型(Embedding Model)负责接收文本并输出这些数值表示(即嵌入)。
- 嵌入中的每个数字代表输入文本某种特性的评分。
抽认卡 8 张卡片
问题
点击显示 · ←/→
答案
点击翻回
知识检测 0 题
No quiz for this lesson yet.