司法领域的信息抽取是从司法文书中提取出细粒度的关键要素,可辅助司法工作者高效处理大量文书工作。然而,相较于通用领域,司法文书中的要素通常具有长度较长、语义分布广泛的特点,同时细粒度要求对局部细节的提取尤为严格。这使得模型...司法领域的信息抽取是从司法文书中提取出细粒度的关键要素,可辅助司法工作者高效处理大量文书工作。然而,相较于通用领域,司法文书中的要素通常具有长度较长、语义分布广泛的特点,同时细粒度要求对局部细节的提取尤为严格。这使得模型不仅需要具备处理长距离依赖的能力,还需在局部范围内精准捕获细粒度的语义信息。针对该问题,提出一种融合全局和局部语义的司法要素抽取方法。首先,拼接要素标签与司法文书内容,并利用BERT(Bidirectional Encoder Representations from Transformers)模型进行深度嵌入。其次,引入自注意力机制增强模型对全局上下文的理解能力;同时,利用自适应多头注意力机制动态调节关注权重,确保能获取到更丰富且准确的语义特征。最后,结合二元交叉熵损失函数和高斯分布平滑边界的KL(Kullback-Leibler)散度损失函数,提升模型对要素边界识别的泛化能力。实验结果表明,与序列标注方法、跨度抽取方法及其他方法相比,所提方法在LAIC2023、CAIL2021司法要素抽取数据集上的F1值均有提升,其中在LAIC2023数据集上比次优模型DiffusionNER高2.88个百分点,在CAIL2021数据集上比次优的机器阅读理解(MRC)模型高1.01个百分点。展开更多
摘要司法领域的信息抽取是从司法文书中提取出细粒度的关键要素,可辅助司法工作者高效处理大量文书工作。然而,相较于通用领域,司法文书中的要素通常具有长度较长、语义分布广泛的特点,同时细粒度要求对局部细节的提取尤为严格。这使得模型不仅需要具备处理长距离依赖的能力,还需在局部范围内精准捕获细粒度的语义信息。针对该问题,提出一种融合全局和局部语义的司法要素抽取方法。首先,拼接要素标签与司法文书内容,并利用BERT(Bidirectional Encoder Representations from Transformers)模型进行深度嵌入。其次,引入自注意力机制增强模型对全局上下文的理解能力;同时,利用自适应多头注意力机制动态调节关注权重,确保能获取到更丰富且准确的语义特征。最后,结合二元交叉熵损失函数和高斯分布平滑边界的KL(Kullback-Leibler)散度损失函数,提升模型对要素边界识别的泛化能力。实验结果表明,与序列标注方法、跨度抽取方法及其他方法相比,所提方法在LAIC2023、CAIL2021司法要素抽取数据集上的F1值均有提升,其中在LAIC2023数据集上比次优模型DiffusionNER高2.88个百分点,在CAIL2021数据集上比次优的机器阅读理解(MRC)模型高1.01个百分点。