信息抽取
Information Extraction
让计算机在文档中找出姓名、日期、金额等特定信息,并整理成结构化格式的任务。
简单来说
信息抽取就是从头到尾读完一份厚厚的文档,只挑出需要的项目,整理成表格。可以想象一个实习生,翻阅上百份合同,用荧光笔标出公司名称、合同期限、违约金条款,再抄进Excel表里。信息抽取就是让计算机代替人做这种重复劳动。
问题在于"查找的灵活程度"。只快速查找固定项目的方式成本低,但一旦出现新类型的项目就束手无策。反过来,使用什么都能回答的大语言模型确实灵活,但每处理一份文档就要产生成本。还有一个陷阱是长度:简短的姓名或日期容易找到,但像四十个词那么长的免责条款这类连续很长的表达,很容易被整段漏掉。
因此最近出现了一种尝试:通读整份文档一次,但只标出每个项目开始和结束的位置,以此减少这一困境。不必逐一列出候选项,只标记边界就能减少计算量,也不再需要为长度设上限。
在报道中是这样出现的
文章中这样解释:"从文档中提取姓名、日期、条款等信息的过程叫做信息抽取。"这里容易被误解的一点是,信息抽取和总结文档或回答问题不同。信息抽取是把特定项目以准确的形式(姓名、日期、条款等)提取出来,留存为结构化数据,而不是对文档的含义进行解释说明。
亲手试一试
向聊天机器人提出如下请求,可以体会信息抽取实际是如何运作的。
请从下面这句话中分别找出人物姓名、日期和金额,并整理成表格。
"金民秀代表同意于2024年3月15日支付定金5000万韩元。"
拿到结果后,把句子改得更长更复杂再问一次,你会发现:简短的项目能被准确找出,但像长长的条件性从句这类内容,却常常被漏掉。
