template21.py 3.7 KB

123456789101112131415161718192021222324252627282930313233343536373839404142434445464748495051525354555657585960616263646566676869707172737475767778798081828384858687888990919293949596979899100101102103104105106107108109110111112113
  1. # coding:utf8
  2. import re
  3. from typing import Dict, Any
  4. from BiddingKG.dl.template_extract.abstract_template import AbstractTemplate, table2list
  5. import os
  6. import json
  7. class DealInfoTemplate(AbstractTemplate):
  8. """
  9. 成交信息提取模板(适配包含标的、标包、成交供应商的表格)
  10. 适配提取成交相关信息的表格数据
  11. """
  12. def __init__(self):
  13. super().__init__(
  14. template_id=os.path.abspath(__file__),
  15. priority=3
  16. )
  17. def check_call_timing(self, preprocessed_data: Dict[str, Any]) -> bool:
  18. """检查是否符合模板调用条件""" # 例子:673148370
  19. if "表格列表" not in preprocessed_data:
  20. return False
  21. tables = preprocessed_data["表格列表"]
  22. if len(tables) < 1:
  23. return False
  24. try:
  25. # 取第一个表格进行验证
  26. datas = tables[0]
  27. # 验证表头列数(目标表格为4列)
  28. if len(datas[0]) != 4:
  29. print("表头数量异常;", len(datas[0]))
  30. return False
  31. # 表头内容正则匹配
  32. header_patterns = [
  33. '序号', # 第1列:序号
  34. '标的(名称)?', # 第2列:标的
  35. '标包|标段|包名称', # 第3列:标包
  36. '(成交|中标|中选)(人|单位|供应商)(名称)?', # 第4列:成交供应商或中标人
  37. ]
  38. # 逐列验证表头
  39. for i, pattern in enumerate(header_patterns):
  40. if not re.fullmatch(pattern, datas[0][i]):
  41. print('表头未验证: ', pattern, datas[0][i])
  42. return False
  43. # 确保表格有数据行
  44. if len(datas) < 2:
  45. return False
  46. self.header = datas[0]
  47. self.data = datas[1:]
  48. return True
  49. except Exception as e:
  50. print(f"表格验证错误: {e}")
  51. return False
  52. def extract(self, preprocessed_data: Dict[str, Any]) -> Dict[str, Any]:
  53. """提取表格中的招标信息、中标信息、候选人信息"""
  54. extract_result = {
  55. "招标信息": [],
  56. "中标信息": [],
  57. "候选人信息": []
  58. }
  59. for row in self.data:
  60. # 跳过列数异常的行
  61. if len(row) != 4:
  62. continue
  63. # 解析每行数据
  64. seq, subject, package, winner = row
  65. # 招标信息:必须包含招标人或预算,当前表格无相关字段,故不提取
  66. # (注:若实际场景中存在隐含的招标人信息,可在此处补充提取逻辑)
  67. # 中标信息:必须包含中标人
  68. if winner:
  69. winner_info = {
  70. "标的": subject,
  71. "标包": package,
  72. "中标人": winner
  73. }
  74. # 过滤空值字段
  75. winner_info = {k: v for k, v in winner_info.items() if v}
  76. extract_result["中标信息"].append(winner_info)
  77. # 候选人信息:必须包含候选人及排名,当前表格无相关字段,故不提取
  78. return extract_result
  79. # 使用示例
  80. if __name__ == "__main__":
  81. from lxml import etree
  82. # 读取并解析数据文件
  83. with open("data.json", "r", encoding="utf8") as f:
  84. preprocessed_data = json.load(f)
  85. # 初始化模板并提取信息
  86. template = DealInfoTemplate()
  87. if template.check_call_timing(preprocessed_data):
  88. result = template.extract(preprocessed_data)
  89. print("提取结果:", json.dumps(result, ensure_ascii=False, indent=2))
  90. else:
  91. print("当前数据不满足模板调用条件")