__init__.py 1.1 KB

12345678910111213141516171819202122
  1. # -*- coding: utf-8 -*-
  2. """预处理层(PREPROCESS)。
  3. 把原始 HTML 转成统一文档结构,不直接调用业务装配。
  4. 按 ARCHITECTURE.md §4.1 分层原则:
  5. preprocess 只把原始 HTML 转成统一文档结构,不直接调用业务装配。
  6. Phase 4 已填充模块:
  7. html_cleaner.py <- 清洗、异常字符、附件前处理(来自 Preprocessing.py)
  8. table_parser.py <- tableToText / fixSpan / 表格二维化
  9. segmenter.py <- segment / get_preprocessed_sentences 分句
  10. ner.py <- get_preprocessed_entitys / union_ner / union_result
  11. article.py <- get_preprocessed / get_preprocessed_article
  12. outline.py <- get_preprocessed_outline + outline_extractor.py 合并
  13. kvtree.py <- KV 树算法(来自 html_2_kvtree.py)
  14. 依赖方向(§4.3):
  15. - preprocess 可引用 common / infra / interface.Entitys / interface.predictor
  16. - preprocess 不反向依赖 pipeline / assembly / rules
  17. - preprocess 内部依赖:article → table_parser / segmenter / html_cleaner / outline / ner
  18. """