caoxiaozhu
|
03254f8196
|
feat(data_process): 模型缓存统一仓库根 .cache 并修复 PDF 页眉页脚清理
- 新增 app/core/cache_paths.py:HF_HOME / tiktoken 缓存统一指向 <repo>/.cache,
本地与 Docker 路径一致,离线部署打包 .cache 即可
- Dockerfile.backend 的 tiktoken 词表改用官方 SHA 文件名,避免运行时回退重建
- 修复 layout_hybrid 路径不运行 detect_pdf_document_noise 的缺陷:
needs_pdf_noise 不再与 needs_layout_raw 互斥,PDF 智能预处理在版面切分下也生效
- 新增 layout_noise.py:识别跨页重复的页眉表格标签组并按行剔除,
解决 docling layout 模型把中文企业 PDF 页眉识别成普通 Table 导致清不掉的问题
- 回收 HybridChunker 丢弃的末尾孤立标题,找回章节标题内容
|
2026-08-21 10:16:23 +08:00 |
|
caoxiaozhu
|
f47611020a
|
fix(data_process): 修复 Word 切分行号断档与预览标题缺失
- 正文抽取下钻 SDT 内容控件,目录等内容不再整段丢失
- 切片投影匹配剥离序列化插入的列表自动编号,新增行锚点兜底与游标防回退
- fixed/semantic 切分路径定位失败时保留切片,不再静默丢弃
- Word 预览按段落大纲级别识别标题,未套标题样式的小节正常渲染
- 本地嵌入模型抽为共享单例,供语义分块与质量评分共用
|
2026-08-19 14:22:27 +08:00 |
|
caoxiaozhu
|
91b4ae2287
|
feat(data_process): 显式关闭 docling OCR 并拒绝无文本层 PDF
- docling 转换器通过 PdfPipelineOptions 显式设置 do_ocr=False,
混合 PDF 的图片页不再产出 OCR 文字;不提供重新开启 OCR 的参数。
- 无文本层 PDF 的错误文案改为"扫描版或图片型 PDF 不支持",
上传阶段整批拒绝,保留混合 PDF 的可处理判定。
- 新增 test_layout_converter_disables_ocr 守护开关状态,
同步设计文档与 disable-ocr 实施计划/设计说明。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
b975de02da
|
fix: 完善数据预处理与 JSON 上传链路
|
2026-07-30 16:54:00 +08:00 |
|
caoxiaozhu
|
9428c6b785
|
feat(data-process): 支持单项生成五十条数据
|
2026-07-27 09:11:51 +08:00 |
|
caoxiaozhu
|
ea08478a37
|
feat(data-process): 接入三种文档切分引擎
|
2026-07-25 18:00:21 +08:00 |
|
caoxiaozhu
|
9cb77c251a
|
fix(data-process): 发布精确三路数据切分
|
2026-07-24 20:43:47 +08:00 |
|
caoxiaozhu
|
3266a6fc09
|
feat(data-process): 清理PDF文档级噪声
|
2026-07-24 15:05:39 +08:00 |
|
caoxiaozhu
|
33d0ed2e01
|
feat(data-process): 完善文件解析与切分存储链路
|
2026-07-24 14:35:03 +08:00 |
|
caoxiaozhu
|
f04dc479bb
|
feat: 完成数据处理接口与前端接入
|
2026-07-23 15:10:13 +08:00 |
|