RAG Optimization (检索增强生成优化)

在构建企业级和个人级 RAG 检索系统中,从数据工程源头优化检索单元和语料结构,是比下游调整 Reranker 或语义阈值高出数倍杠杆的优化路径。

传统“中性分块” (Naive Chunk) 的三大死结

在常规的 RAG 管道中,多以按 Token 大小硬切的文本分块 (Chunk) 作为 Embedding 最小单元。这带来了三个工程硬伤:

  1. 语义边界损毁 (No Idea Boundary):分块割裂了段落原本的思想,导致召回的文本片段缺乏推导过程或上下文结论,造成 LLM 无法辨识缺损。
  2. 多版本污染 (Version Clutter):企业库或个人库在多端(Git, Confluence 等)常存有同一个文档的细微差异多副本。Top-K 检索极易召回 5 个不同时期的“废弃/当前版混杂”相似段落,拉低真实向量召回的概率质量,导致生成 confidently wrong 的回答。
  3. 权限过滤器外置 (Orchestrator Governance):Chunk 自身没有安全与权限的 metadata 属性,迫使开发人员必须在编排层堆叠复杂的权限拦截逻辑,容易发生权限泄露或越权。

新范式:问答数据包 (IdeaBlock) 与语义蒸馏

为打破分块的局限, Blockify 提出了在数据预处理阶段对语料进行 语义蒸馏 (Semantic Distillation) 并重塑为 IdeaBlock (问答包) 单元:

  • 结构化对齐 (Structural QA Match):IdeaBlock 包含:一个特定问句 + 2至3句精炼验证的回答 + 强类型的权限和版本 metadata。由于用户的 Query 绝大多数是问句 shape,将向量库的索引也重塑为“Question-Answer Packet”结构,能够实现物理上的结构化直接匹配,将 Query 与 IdeaBlock 最佳向量召回的 Cosine 距离减少 2.29 倍 (0.1585 vs 0.3624)。
  • 多轮聚类语义去重 (Semantic Deduplication):通过在 80-85% 相似度阈值下运行 3-5 轮 iterative 聚类去重,将重复和高度相似的冗余向量进行折叠合并(Collapsed into a single Canonical Block),去除同一向量区域内的竞争噪声。在 benchmark 中,蒸馏使原始语料体积折叠了 40 倍,字数减少一半,检索精度反而逆向提升了 13.55%。
  • 应用优势:
    • 治理下沉:clearance level、version state 等权限元数据成为数据包的原生属性,由底层直接过滤。
    • 单点敏捷更新:当某项规格变更时,只用更新对应的 canonical 规范问答包,所有后续检索瞬间感知,彻底避免了 naive chunk 下需大面积多处文本校正的难题。

Source: 2026-07-02-x-x-com-akshay_pachaar-status-2052743644411765230-s-46(来源未公开)