# -*- coding: utf-8 -*- """预处理层(PREPROCESS)。 把原始 HTML 转成统一文档结构,不直接调用业务装配。 按 ARCHITECTURE.md §4.1 分层原则: preprocess 只把原始 HTML 转成统一文档结构,不直接调用业务装配。 Phase 4 已填充模块: html_cleaner.py <- 清洗、异常字符、附件前处理(来自 Preprocessing.py) table_parser.py <- tableToText / fixSpan / 表格二维化 segmenter.py <- segment / get_preprocessed_sentences 分句 ner.py <- get_preprocessed_entitys / union_ner / union_result article.py <- get_preprocessed / get_preprocessed_article outline.py <- get_preprocessed_outline + outline_extractor.py 合并 kvtree.py <- KV 树算法(来自 html_2_kvtree.py) 依赖方向(§4.3): - preprocess 可引用 common / infra / interface.Entitys / interface.predictor - preprocess 不反向依赖 pipeline / assembly / rules - preprocess 内部依赖:article → table_parser / segmenter / html_cleaner / outline / ner """