OCR

为什么我本地部署的OCR与 RAG流水线设计会导致检索性能下降?

我正在构建一个本地部署的文档处理系统,使用: 针对扫描的PDF进行OCR(光学字符识别) 用于索引的嵌入向量 用于检索和问答的RAG(检索增强生成) 然而,当将OCR输出与嵌入向量结合时,我在检索质量和延迟方面遇到了问题。 例如: OCR文本嘈杂,影响嵌入质量 相似查询之间的检索结果不一致 随着文档集规模增大,性能下降 这些问题在这样一个流水线中的常见原因是什么,应该如何解决? 解决方案 我对这个问题做了一些研究,下面的答案,供同样有此疑问的朋友参考。 我认为大致归结为几个方面。 第一是OCR。如果文本嘈

如何把文档中的格式化数据转换成可用的电子表格?

我手头有一些数据来自源站点,格式看起来像PDF,但实际上是CSV形式。 如你所见,每个学生都有一个“头部信息块”,其中包含多列,用来概括姓名、地址、年级等信息。学生的姓名总是在第一个课程名称上方的五行位置。 我想把它整理成一个比较合理的格式,如下所示: 学生姓名 学年 科目 级别 评定周期 分数 Doe, Jane 2025 - 2026 宗教 6 T1 97.4 Doe, Jane 2025 - 2026 阅读/文学 6 T1 95 Doe, Jane 2025 - 2026 语言 6 T1 94.9