caoxiaozhu
|
f47611020a
|
fix(data_process): 修复 Word 切分行号断档与预览标题缺失
- 正文抽取下钻 SDT 内容控件,目录等内容不再整段丢失
- 切片投影匹配剥离序列化插入的列表自动编号,新增行锚点兜底与游标防回退
- fixed/semantic 切分路径定位失败时保留切片,不再静默丢弃
- Word 预览按段落大纲级别识别标题,未套标题样式的小节正常渲染
- 本地嵌入模型抽为共享单例,供语义分块与质量评分共用
|
2026-08-19 14:22:27 +08:00 |
|
caoxiaozhu
|
91b4ae2287
|
feat(data_process): 显式关闭 docling OCR 并拒绝无文本层 PDF
- docling 转换器通过 PdfPipelineOptions 显式设置 do_ocr=False,
混合 PDF 的图片页不再产出 OCR 文字;不提供重新开启 OCR 的参数。
- 无文本层 PDF 的错误文案改为"扫描版或图片型 PDF 不支持",
上传阶段整批拒绝,保留混合 PDF 的可处理判定。
- 新增 test_layout_converter_disables_ocr 守护开关状态,
同步设计文档与 disable-ocr 实施计划/设计说明。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
2f48934e66
|
fix(data_process): 修复 tiktoken 加载器的变量作用域错误
函数内部的 import tiktoken.core 会把 tiktoken 变成局部变量,导致
tiktoken.get_encoding 在联网下载前就抛 UnboundLocalError,被 except
吞掉后联网与本地缓存两条路径全部失效。移除该内部 import(模块顶部
已引入 tiktoken),切分测试全部通过,编码器成功下载并缓存到
~/.cache/tiktoken,此后离线环境也可正常加载。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
5f6e7523cf
|
feat: 新增外部数据源拉取与 DPO 输出格式支持
- 支持从 PostgreSQL 数据库拉取结构化数据作为训练来源
- 新增 DPO (Direct Preference Optimization) 输出类型
- 支持 chosen/rejected 字段的编辑、校验和发布
- 完善数据预处理切分逻辑和元数据管理
- 移除 OCR 扫描 PDF 功能,保持基础文本解析能力
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 14:17:45 +08:00 |
|
caoxiaozhu
|
ea08478a37
|
feat(data-process): 接入三种文档切分引擎
|
2026-07-25 18:00:21 +08:00 |
|