参加了天池的一个pdf简历信息提取的比赛,这里进行回顾、整理和分享
赛题要求从pdf简历中提取出信息,比如说名字,籍贯等。这里搭建了一个BiLSTM-CRF模型,能够从PDF简历中提取出所需的信息。
模型的线上得分是0.727,排名 21/1200+
模型目标:pdf简历 --> 类别信息


此处留一个pytorch官方的BiLSTM-CRF教程链接: https://pytorch.org/tutorials/beginner/nlp/advanced_tutorial.html#
https://github.com/Agwave/PDF-Resume-Information-Extraction
- 没有利用外部文本来训练语言模型。语言模型的文本只利用了训练集的pdf中的文本。
- 只使用了字嵌入。中文文本的话还可以结合词嵌入。