2026年AI知识库问答教程:从文档切分到检索增强的完整搭建步骤
2026年AI知识库问答教程:从文档切分到检索增强的完整搭建步骤
很多人第一次搭 AI 知识库问答,卡点往往不在模型,而在文档进不去、检索找不到、答案还编得一本正经。这套流程拆开只有四步,每一步却都有容易忽略的前提。
下面按文档切分、向量化索引、检索增强、生成复核四段展开,每一段都给出可执行的检查点;最后再说明模型调用这一层如何用统一入口管理,减少后期换模型、换平台的返工。
一、AI知识库问答其实由两条链路组成
一套可用的 AI知识库问答 系统,实际上由离线索引和在线查询两条链路拼起来。前者把文档变成可检索的数据结构,后者把用户问题变成答案。
- 离线索引:文档采集 → 清洗 → 切分 → 向量化 → 写入向量库,可重复执行、可增量更新。
- 在线查询:问题改写 → 向量化 → 召回 → 重排 → 拼接上下文 → 调模型生成 → 附引用。
这两条链路要分开调试。把整条流程串起来一次跑完,答案不好就换模型,往往找不到真正的原因。更稳的顺序是:先把检索固定住,确认喂给模型的上下文里确实有答案,再去调生成。检索决定答案上限,模型只决定你能多接近这个上限。
二、第一步:文档切分决定整条链路的上限
切分的目标只有一个——让每个片段在语义上自洽,能被一个问题单独命中。
1. 切分前先清洗
页眉页脚、页码、目录、水印、重复免责声明要先去掉;扫描件必须先做 OCR 并抽样校对;表格和代码块不要和正文混进同一个片段,单独成块并保留表头。清洗不彻底,后面调多少参数都是在给脏数据打补丁。
2. 粒度与重叠怎么定
中文技术文档常见做法是 300 至 800 字一段,相邻片段保留 10% 至 20% 的重叠,避免答案正好被切在两段之间。带标题层级的 Markdown 文档优先按标题切,再对超长小节做二次切分。FAQ、条款、操作手册这类文档更适合按问答对切,一段一问一答,命中率通常更高。
3. 元数据必须一起写入
只存文本、不存元数据,后面就无法按来源过滤,也无法给出引用。建议至少写入:来源文件名、章节标题、页码或段落序号、更新时间、权限标签。这些字段在检索阶段可以直接变成过滤条件,效果通常比反复调模型参数更明显。
三、第二步:向量化与索引
切分完成后进入索引阶段。这一步的验收标准很朴素:用文档里的一句话去检索,能把包含它的片段排进前列。
| 环节 | 输入 | 输出 | 复核点 |
|---|---|---|---|
| 清洗 | PDF、Word、网页 | 纯文本与结构标记 | 抽查表格、代码块是否错行 |
| 切分 | 清洗后的文本 | 语义片段与元数据 | 随机抽 10 段,看能否独立读懂 |
| 向量化入库 | 片段文本 | 向量与索引 | 用原文句子检索,能否命中自身 |
| 召回与重排 | 用户问题 | Top-K 上下文 | 正确答案是否进前 3 条 |
检索用的向量模型和生成模型可以分开选:前者更看重中文语义区分能力,后者更看重指令遵循和长上下文表现。换向量模型必须重建全量索引,所以项目初期就要把重建脚本准备好。如果希望把这两类调用放在同一处管理、统一查看可用模型和协议说明,可以了解 通联AI中转站官网 的模型清单与兼容协议介绍。
四、第三步:检索增强的四个关键动作
1. 混合检索通常比单一向量检索更稳
向量检索擅长语义相近,但对型号、编号、人名这类精确匹配容易失手。把关键词检索与向量检索的结果做融合,再统一重排,是成本较低的改进方式。同时把元数据过滤打开,例如限定在某个产品线、某个版本文档内检索,噪音会明显下降。
2. 先广召回,再窄重排
召回阶段可以放宽,取 Top 30 至 50;重排阶段再收敛到 3 至 8 条真正进入上下文。上下文不是越多越好,无关片段会稀释有效信息,也会推高 Token 消耗。
检索决定上限,生成决定下限。上下文里没有答案时,再强的模型也只能编。
3. 问题改写别忽略
用户的口语化提问和文档用语常常对不上。把问题先改写成更接近文档表述的检索式,或者同时用原始问题和改写问题各检一次再合并结果,往往比换一个更大的模型更有效。
4. 给每条上下文标注来源
编号、来源文件、页码一起塞进上下文,并要求回答时引用编号。这一方面方便人工核查,另一方面也能让模型更克制,减少把不同文档内容混在一起说的情况。
五、第四步:生成、引用与拒答
拿到上下文后,提示词至少要管三件事:只依据给定资料回答;标注引用来源编号;资料不足时明确说明未找到相关内容。第三条最容易被跳过,但它直接决定这套系统在真实业务里能不能用。上线后还要定期抽样人工复核,尤其是数字、日期、金额、条款类回答,不能只看流畅度。
六、实战中最常见的五个坑
- 只调模型不看召回:答案不对就换模型,实际上正确答案根本没被检索出来。
- 切分过碎:一句话被切成三段,每段都缺主语,检索和生成同时变差。
- 上下文塞太满:把十几条片段全塞进去,模型注意力被稀释,成本还上升。
- 没有索引版本管理:文档更新了,旧向量还在库里,同一问题给出两种答案。
- 忽略权限隔离:不同部门文档混在一个索引里,检索时越权带出内容。
七、模型调用层:用一个入口管住多模型
知识库项目上线后,往往会同时用到对话模型和向量模型,有时还要加图片理解等多模态能力。如果每类模型都单独维护地址、密钥和额度,切换与排错的成本会迅速上升。这时候可以把调用层收敛到一个统一入口上。
通联AI中转站 提供 OpenAI 兼容的调用方式,可以在一个控制台里管理 API Key、查看可用模型清单,并按任务切换不同模型。实际接入时,先用一个 Base URL 和一把 Key 跑通检索结果到生成这一段,再逐步替换其他模型的配置。具体的模型名称、接口地址与计费规则,以控制台和文档页面显示的实时信息为准,可以从 通联AI中转站 开始查看。
对需要反复对比模型效果的知识库项目来说,统一入口还有一个好处:换模型只改一个参数,不用重写调用代码,能更快判断问题到底出在检索还是生成。
如果你已经准备好按上面的步骤搭一套知识库问答,下一步可以先注册账号、拿到 API Key,在控制台里确认可用的对话与向量模型,再用最小请求跑通一次检索到生成的链路。