RAG
PixelRAG:把表格和版式重新放回 RAG 的证据链
PixelRAG 通过截图瓦片和视觉嵌入保留网页表格、图表与布局,本文从工程成本与混合检索角度判断它的适用边界。
本地 PDF 解析不只是省一次 OCR:pdf-inspector 正在变成文档流水线的前置基础设施
pdf-inspector 用 Rust 核心把 PDF 分类、阅读顺序、表格抽取和 Markdown 生成放到本地完成,适合作为文档流水线与 RAG 的第一层路由,而不是把所有文档都先扔给 OCR。
MinerU 不该只选一个后端:把 pipeline、VLM 与 hybrid 做成文档分流系统
MinerU 的生产价值在于按文档与页面难度分流,并用队列、幂等、版本化产物、质量指标、隐私和许可证治理把解析做成可运营系统。
SAG 不是另一个向量库:它在重建知识库的证据链
SAG 的重点是把 Chunk、Entity、Event 和动态关系链结合起来,解决普通 RAG 多跳证据容易断的问题。
LiteParse:文档解析别一上来就烧云服务,先把本地入口做成可分流系统
LlamaIndex 团队开源的 LiteParse 适合把 RAG 文档解析前置层做成本地优先、带坐标、可复杂度检测、可分流的工程入口,而不是所有文件都直接送云端重解析。