caoxiaozhu
|
f47611020a
|
fix(data_process): 修复 Word 切分行号断档与预览标题缺失
- 正文抽取下钻 SDT 内容控件,目录等内容不再整段丢失
- 切片投影匹配剥离序列化插入的列表自动编号,新增行锚点兜底与游标防回退
- fixed/semantic 切分路径定位失败时保留切片,不再静默丢弃
- Word 预览按段落大纲级别识别标题,未套标题样式的小节正常渲染
- 本地嵌入模型抽为共享单例,供语义分块与质量评分共用
|
2026-08-19 14:22:27 +08:00 |
|
caoxiaozhu
|
78fb894307
|
feat(data_process): 优化问题生成提示语,提升问题自然度
- 系统提示语注入问题风格规则:像真实用户自然提问、避免"请描述/
请说明/根据文档"等模板化开头、多条问题交替句式,并附正反示例;
服务端注入对存量任务即时生效。
- 未配置提示语时的后端兜底从一句话充实为与前端同信息量的完整默认。
- 前端标准/思维链/DPO 三套内置默认提示语新增"问题表述自然"要求,
旧版归档为 _4 常量并注册进 isBuiltInGenerationPrompt 迁移映射,
自定义提示语不受影响。
- 新增兜底提示语专项测试与风格规则断言,生成测试 32/32 通过。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
91b4ae2287
|
feat(data_process): 显式关闭 docling OCR 并拒绝无文本层 PDF
- docling 转换器通过 PdfPipelineOptions 显式设置 do_ocr=False,
混合 PDF 的图片页不再产出 OCR 文字;不提供重新开启 OCR 的参数。
- 无文本层 PDF 的错误文案改为"扫描版或图片型 PDF 不支持",
上传阶段整批拒绝,保留混合 PDF 的可处理判定。
- 新增 test_layout_converter_disables_ocr 守护开关状态,
同步设计文档与 disable-ocr 实施计划/设计说明。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
2f48934e66
|
fix(data_process): 修复 tiktoken 加载器的变量作用域错误
函数内部的 import tiktoken.core 会把 tiktoken 变成局部变量,导致
tiktoken.get_encoding 在联网下载前就抛 UnboundLocalError,被 except
吞掉后联网与本地缓存两条路径全部失效。移除该内部 import(模块顶部
已引入 tiktoken),切分测试全部通过,编码器成功下载并缓存到
~/.cache/tiktoken,此后离线环境也可正常加载。
|
2026-08-18 15:49:00 +08:00 |
|
wuyongtao
|
2adf78a6ed
|
feat: 数据集下载鉴权、MinIO 发布与数据库兼容增强
- 数据集下载接口鉴权:单文件直接返回、多文件打包 ZIP,前端统一走请求客户端携带 Token
- 预检/同步支持 MinIO 对象补建与资源副本记录,兼容接入 MinIO 前的历史数据集
- create_dataset 增加名称重复校验,软删记录释放名称并保留墓碑
- 数据处理发布结果支持写入 MinIO storage_objects 并关联 dataset_file
- 数据存储根目录支持 YG_FT_DATA_ROOT 环境变量
- SQL 迁移兼容旧版 approval_steps / retention_policies / data_process_results
- 训练日志图表按曲线独立过滤缺失采样点
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-18 14:45:16 +08:00 |
|
caoxiaozhu
|
2f64086177
|
docs(data_process): 在 __init__ 补充模块职责速查与分层说明
|
2026-08-12 14:46:56 +08:00 |
|
caoxiaozhu
|
bdaf72d58b
|
chore: 删除误存的 document_chunking.txt(macOS 压缩的 zip 残留,代码未引用)
|
2026-08-12 14:39:11 +08:00 |
|
caoxiaozhu
|
ca012893f7
|
refactor: 完整重构 data_process 模块并修复拆分遗留缺陷
将 algorithms.py / store.py 拆分为 algorithms/ 与 store/ 子包,并修复
机械拆分造成的导入与辅助函数缺失:
- algorithms/: 补全各子模块依赖与 17 个私有辅助函数、8 个常量;重写
__init__.py 移除坏的 importlib 兜底,分层导入并以局部 import 断开
text_utils<->parsers、quality<->structured_processing 循环依赖。
- store/: 补回 DataProcessStoreError / hashlib / _serialize_value /
estimate_token_count 等缺失导入,包入口导出测试与调用方依赖的私有
辅助函数。
- 删除旧单文件 algorithms.py / store.py 及重构残留(_algorithms_old、
backups、refactor 脚本、REFACTORING 文档)。
algorithms 与 store 测试套件 91 项全部通过。
|
2026-08-12 14:29:39 +08:00 |
|
caoxiaozhu
|
5f6e7523cf
|
feat: 新增外部数据源拉取与 DPO 输出格式支持
- 支持从 PostgreSQL 数据库拉取结构化数据作为训练来源
- 新增 DPO (Direct Preference Optimization) 输出类型
- 支持 chosen/rejected 字段的编辑、校验和发布
- 完善数据预处理切分逻辑和元数据管理
- 移除 OCR 扫描 PDF 功能,保持基础文本解析能力
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 14:17:45 +08:00 |
|
wuyongtao
|
75cc105ebc
|
chore: 忽略离线部署包,提交安全加固、数据库初始化与文档
- .gitignore: 忽略 docker/offline 离线部署包(镜像/运行时等大文件)
- 安全加固: 新增 compute/api/security.py 及各端安全测试,补充 docs/security-hardening.md
- 数据库: 新增完整初始化 SQL 与 docs/database-config.md
- 数据转换与评测: 修复类型检查、增强校验并补充测试
- Docker 配置与环境变量更新
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-07 09:24:35 +08:00 |
|
wangjiming
|
c64fa1cd61
|
新增数据类型转换
|
2026-08-05 16:23:00 +08:00 |
|
caoxiaozhu
|
b975de02da
|
fix: 完善数据预处理与 JSON 上传链路
|
2026-07-30 16:54:00 +08:00 |
|
wuyongtao
|
a9ab130d43
|
feat: P0 训练闭环核心功能实现
P0-1 模型路径治理:
- 新增 003_model_path_governance.sql 迁移,models 表增加 can_train 字段
- create_model/update_model 自动计算 can_train(非API+有路径=可训练)
- _compute_job_payload_from_task_node 拒绝 API 模型和无可训练路径模型
- 平台诊断规则增加 API 模型/路径缺失检测
P0-2 数据集格式校验:
- 新增 dataset_format.py,支持 Alpaca/ShareGPT/DPO/CPT 格式校验
- 训练预检时自动根据 train_type 匹配格式并校验内容字段
- llama_dataset_info 增加 DPO/CPT 格式列映射
P0-3 训练完成产物入库:
- _ensure_trained_model 使用 compute 节点返回的真实 artifacts
- 注册 per-file artifact 记录(含 size_bytes/checksum_sha256)
- trained_models 表增加 artifact_dir 字段
P0-4 失败日志拉取:
- poll_compute_jobs_once 检测到 failed/stopped 时强制拉取最后 200 行日志
- apply_compute_job 持久化失败日志片段到任务 payload
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 13:10:53 +08:00 |
|
caoxiaozhu
|
01d2e6c76a
|
feat(data-process): 完善后台生成与失败重试
|
2026-07-28 10:56:05 +08:00 |
|
caoxiaozhu
|
9025437a37
|
feat(data-process): 增加 Office 原文件预览接口
|
2026-07-27 16:12:50 +08:00 |
|
caoxiaozhu
|
f97245b814
|
feat(data-process): 增加可配置思维链生成
|
2026-07-27 14:41:38 +08:00 |
|
caoxiaozhu
|
de2e8952b5
|
feat(data-process): 支持思维链输出类型
|
2026-07-27 13:08:44 +08:00 |
|
caoxiaozhu
|
b08a771a61
|
fix(data-process): 保留可验证的任务耗时
|
2026-07-27 11:16:48 +08:00 |
|
caoxiaozhu
|
8caaaa5bbc
|
fix(data-process): 恢复提前中断的重新生成任务
|
2026-07-27 11:07:18 +08:00 |
|
caoxiaozhu
|
53014bb381
|
fix(data-process): 延迟重新生成破坏性变更
|
2026-07-27 10:43:42 +08:00 |
|
caoxiaozhu
|
b14b2ecf22
|
fix(data-process): 修正任务详情数据契约
|
2026-07-27 10:03:46 +08:00 |
|
caoxiaozhu
|
895983ac20
|
feat(data-process): 返回任务文档数量
|
2026-07-27 09:50:19 +08:00 |
|
caoxiaozhu
|
e4ea1f168c
|
fix(data-process): 保留重新生成前的已发布数据集
|
2026-07-27 09:39:19 +08:00 |
|
caoxiaozhu
|
9428c6b785
|
feat(data-process): 支持单项生成五十条数据
|
2026-07-27 09:11:51 +08:00 |
|
caoxiaozhu
|
396d3f6f47
|
feat(data-process): 支持任务重新生成
|
2026-07-25 22:40:55 +08:00 |
|
caoxiaozhu
|
07e2999323
|
fix(data-process): 修复三数据集发布参数错误
|
2026-07-25 18:19:37 +08:00 |
|
caoxiaozhu
|
ea08478a37
|
feat(data-process): 接入三种文档切分引擎
|
2026-07-25 18:00:21 +08:00 |
|
caoxiaozhu
|
e9a121cfeb
|
fix(data-process): 发布三个独立切分数据集
|
2026-07-25 17:04:14 +08:00 |
|
caoxiaozhu
|
9cb77c251a
|
fix(data-process): 发布精确三路数据切分
|
2026-07-24 20:43:47 +08:00 |
|
caoxiaozhu
|
994ec6644a
|
fix(data-process): 修正详情统计字段契约
|
2026-07-24 16:28:47 +08:00 |
|
caoxiaozhu
|
3266a6fc09
|
feat(data-process): 清理PDF文档级噪声
|
2026-07-24 15:05:39 +08:00 |
|
caoxiaozhu
|
33d0ed2e01
|
feat(data-process): 完善文件解析与切分存储链路
|
2026-07-24 14:35:03 +08:00 |
|
caoxiaozhu
|
f04dc479bb
|
feat: 完成数据处理接口与前端接入
|
2026-07-23 15:10:13 +08:00 |
|
wuyongtao
|
ba4059fe3b
|
feat: 添加后端架构、计算模块及部署文档
|
2026-07-16 13:47:37 +08:00 |
|