# coding:utf8 import re from typing import Dict, Any from BiddingKG.dl.template_extract.abstract_template import AbstractTemplate, table2list import os import json class TranslationServiceBidTemplate(AbstractTemplate): """ 翻译服务招标信息提取模板 适配包含标的名称、标包名称、采购金额等列的招标信息表格提取 """ def __init__(self): super().__init__( template_id=os.path.abspath(__file__), priority=3 ) def check_call_timing(self, preprocessed_data: Dict[str, Any]) -> bool: """检查是否符合模板调用条件""" if "表格列表" not in preprocessed_data: return False tables = preprocessed_data["表格列表"] if len(tables) < 1: return False try: datas = tables[0] # 验证表头列数(目标表格为10列) if len(datas[0]) < 4:# != 10: print(f"表头数量异常:{len(datas[0])}列,需10列") return False # 表头内容正则匹配(泛化表达) header_patterns = [ '序号', # 第1列:序号 '(标的|项目)(名称)?', # 第2列:标的名称 '(标包|标段|包)(名称)?', # 第3列:标包名称 '((预计采购|预算|概算)金额|最高投标限价|最高限价|拦标价)(([万亿美欧日]?元))?', # 第4列:预计采购金额 # '(最高投标限价|最高限价|拦标价)(([万亿美欧日]?元))?', # 第5列:最高投标限价 # '最大中标数量', # 第6列:最大中标数量 # '(服务期/工期|工期/服务期|服务期|工期)', # 第7列:工期/服务期 # '是否特殊包', # 第8列:是否特殊包 # '(响应|投标)保证金', # 第9列:响应保证金 # '备注' # 第10列:备注 ] # 逐列验证表头 for i, pattern in enumerate(header_patterns): if not re.fullmatch(pattern, datas[0][i], re.IGNORECASE): print(f'表头未验证:第{i+1}列 {pattern} 与 {datas[0][i]} 不匹配') return False # 确保表格有数据行 if len(datas) < 2: return False self.header = datas[0] self.data = datas[1:] return True except Exception as e: print(f"表格验证错误: {e}") return False def extract(self, preprocessed_data: Dict[str, Any]) -> Dict[str, Any]: """提取表格中的招标信息、中标信息、候选人信息""" extract_result = { "招标信息": [], "中标信息": [], "候选人信息": [] } for row in self.data: # 跳过列数异常的行 if len(row) < 4: #!= 10: continue # 解析每行数据 # seq, subject, package, budget, limited_price, max_win_num, period, is_special, deposit, remark = row seq, subject, package, budget = row[:4] # 补充金额单位(如果表头有单位而内容没有) if re.search('[万亿美欧日]?元', self.header[3]) and not re.search('[万亿美欧日]?元', budget): budget += re.search('[万亿美欧日]?元', self.header[3]).group(0) # if re.search('[万亿美欧日]?元', self.header[4]) and not re.search('[万亿美欧日]?元', limited_price): # limited_price += re.search('[万亿美欧日]?元', self.header[4]).group(0) # 整理招标信息(包含预算,符合必填条件) bid_info = { "标的": subject, "标包": package, "预算": budget, # "限价": limited_price } # 过滤空值字段 bid_info = {k: v for k, v in bid_info.items() if v} extract_result["招标信息"].append(bid_info) return extract_result # 使用示例 if __name__ == "__main__": from lxml import etree # 读取并解析数据文件 with open("data.json", "r", encoding="utf8") as f: preprocessed_data = json.load(f) # 初始化模板并提取信息 template = TranslationServiceBidTemplate() if template.check_call_timing(preprocessed_data): result = template.extract(preprocessed_data) print("提取结果:", json.dumps(result, ensure_ascii=False, indent=2)) else: print("当前数据不满足模板调用条件")