feat(data_process): 显式关闭 docling OCR 并拒绝无文本层 PDF

- docling 转换器通过 PdfPipelineOptions 显式设置 do_ocr=False,
  混合 PDF 的图片页不再产出 OCR 文字;不提供重新开启 OCR 的参数。
- 无文本层 PDF 的错误文案改为"扫描版或图片型 PDF 不支持",
  上传阶段整批拒绝,保留混合 PDF 的可处理判定。
- 新增 test_layout_converter_disables_ocr 守护开关状态,
  同步设计文档与 disable-ocr 实施计划/设计说明。
This commit is contained in:
caoxiaozhu
2026-08-18 15:48:30 +08:00
parent 2f48934e66
commit 91b4ae2287
7 changed files with 337 additions and 5 deletions

View File

@@ -118,7 +118,7 @@ pending ──start/generate──> running ──success──> completed
抽取幻灯片文本与表格,随后统一进入切片算法。
- 旧版二进制 DOC、XLS、PPT 不直接解析,返回 415 并提示分别转换为
DOCX、XLSX、PPTX。
- 扫描 PDF 没有文本层时明确提示需要 OCR当前流程不执行 OCR。加密、损坏或
- 扫描 PDF 没有文本层时明确提示扫描版或图片型 PDF 不支持。加密、损坏或
超出页数/工作表/行列/解压规模限制的文件整批拒绝。
现代 Office 文件在交给解析库前检查 ZIP 成员路径、重复成员、加密标记、活动