先看怎么选
用稳定位置 ID 判断片段在哪里,用内容指纹判断文字是否改变。未变则保留,改文则重嵌入,移位但内容相同可复用向量,新增和删除分别处理;删除推断必须建立在完整、成功取得的当前来源清单之上。
先把“资料变化”拆成不同事件 一篇文档可能只是换了 URL,也可能保持地址不变但内容已经更新。如果只比较位置,移动会被当成全新内容;如果只比较文本,又难以维护正确来源。官方增量教程因此同时跟踪内容与位置,分别回答是不是同一段文字、是否还在同一个地方。 两种身份怎样配合 内容指纹由规范化后的文本计算,位置身份则由 URL、章节锚点和分段编号等稳定规则生成。官方还提醒记录 embedding 模型和预处理版本;更换任一环节,都不能直接假定旧向量可以继续复用。 五种情况逐项处理 同一位置且指纹相同,保持原样;同一位置内容改变,重新嵌入;位置新但指纹已存在,可以复用原向量;两者都新,生成新向量;当前来源中不再存在的旧位置,进入删除处理。此方法依赖确定性的分段和文本处理,否则无关空白或规则波动也可能触发大量更新。 一份能核对计数的同步练习 准备五个自拟片段:A 保持原位置和文字;B 只改文字;C 只移动到新地址;D 是新内容;E 已从完整来源中删除。预期 A 不重算,B 与 D 重新嵌入,C 在模型和预处理版本相同的条件下复用旧向量并更新来源,E 在最后的删除阶段移除。C 的旧位置也需要按当前来源清单清理,不能留下两个过期入口。 同步完成后,使用完全相同的来源再跑一次,预期不再新增、重嵌入或删除。若计数仍变化,先查规范化、锚点和分段编号是否每次稳定,再查是否存在其他写入者。只有减少模型调用但第二次仍大量变动,还不能证明增量规则正确。 重复内容也应保留位置含义。两份文档包含同一句说明,可以复用其向量,但不一定要合并成同一个 point;它们的来源链接、文档身份和筛选属性可能不同。内容指纹判断能否复用表示,位置身份负责维护这些不同入口。 删除不能从失败采集推出 官方方案使用当前完整片段列表与存量对照,因此“缺少某条”只有在来源完整时才可能代表删除。文档明确要求拒绝空输入,并在删除数量异常时停止调查。编辑建议还要检查每个来源是否读取成功、总量是否突然下降,再允许删除阶段运行。 同步顺序与并发边界 教程先完成写入,再移除旧位置,过程中查询可能短暂看见新旧并存。示例假设同一时间只运行一个同步任务;若系统存在并发更新,应另外研究条件更新与版本控制。不要把单任务示例直接当成支持任意并发的通用同步器。 增量嵌入不等于增量扫描 虽然只有变化文本需要重新编码,所核对方案每次仍读取整个存量指纹集合并进行对照,成本随语料规模增长。部署前应分别估算扫描、比较和嵌入,不要只看到模型调用减少就认定总同步成本与变化量成正比。 用重复运行验收 准备修改、移位、新增、删除和不变五种样例。第一轮核对各类计数与来源链接,第二轮使用完全相同输入,预期不再产生新增更新。保留失败阶段与恢复记录,并在实际规模下测量扫描代价。删除阶段应建立在完整来源和已核对的测试结果上。
放在一起,看清差异
| 项目 | 本文用途 | 验收重点 |
|---|---|---|
| Qdrant | 内容指纹与稳定位置身份 | 五类计数、来源完整性与重复运行 |
本篇涉及的工具1

Qdrant
同步原始文档变化与向量表示
- 适合场景
- 维护文档检索索引,希望减少无效重嵌入并保持资料同步的开发者。
- 需要留意
- 完整来源清单、确定性分段与单任务假设是示例前提。
我们如何筛选
根据文末官方资料核对功能与接口语义,围绕本文问题整理操作路径和验收建议。文中的测试样例属于编辑建议,没有安装实测或性能排名。
参考来源与更新
补充五种变化的同步计数练习、移动后的旧位置清理与重复内容的身份区分。
发布于 2026-09-12 · 更新于 2026-09-13


