入门自然语言处理的基本任务——文本匹配-电子发烧友网

2020年初，新冠疫情席卷全球。除了“待在家，不乱跑”，我想还能从哪为抗击疫情出点微薄之力呢？

碰巧室友推送了一个天池公益赛“新冠疫情相似句对判定大赛”，秉持“重在参与”的心态参加了比赛。经过半个月的努力，最终结果勉强不错（第6），收割了一台Kindle。

2021年1月，疫情形势依然严峻，幸运的是国家不仅及时稳住了疫情，还研发出了有效的疫苗。借助疫情主题的比赛，我希望帮助更多读者，入门自然语言处理的基本任务——文本匹配。

开源代码：

https://github.com/yechens/COVID-19-sentence-pair

01 数据分析任务背景非常直观，主办方给定了“肺炎”、“支气管炎”、“上呼吸道感染”等医疗背景下的用户真实提问，要求选手通过算法识别任意2个问题，是否表达同一个意思。举例：

问题1：“轻微感冒需不需要吃药？”

问题2：“轻微感冒需要吃什么药？”

问题1关心“是否得吃药”，问题2关心“该吃什么药”，侧重点不同所以意思不同。

数据集样本都是三元组（query1， query2， label）。为了降低难度，每一个问题的长度被控制在20字以内。

比赛的训练集、验证集分别包含8746、2001条三元组。我们从dev中随机保留了800条样本作为最终dev，其余均加入训练。

数据增强拿到数据简单分析后，我发现数据集已经过清洗，竟然异常的干净整齐（没有杂乱的符号、不通顺的句子），label分布几乎也接近1:1。

再观察数据，相同的query1总是按顺序排列在一起，随后跟着不同的query2。这种分布很容易想到一种数据增强策略：相似传递性。

A 《-》 B 相似 and A 《-》 C 相似 =》 B 《-》 C 相似

最终我额外获得了5000条高质量的数据，比赛准确率因此提升了0.5%。

实体替换此外，我们也尝试了训练一个NER模型挖掘文本中的医疗实体，如“胸膜炎”、“肺气肿”，再通过word2vec查找最接近的实体进行替换。

但这种方式并没有提升最终结果。我觉得原因有2个：

1W条样本规模偏小，NER模型识别误差较大

词向量没有针对医疗场景训练，包含的医疗实体很少

02 匹配方法实现文本匹配有非常多简单又实用的方法，例如：

基于字符统计：字符串匹配、编辑距离、Jaccards距离

基于语言模型：word2vec/glove词向量、BERT

基于神经网络：孪生网络、TextCNN、DSSM、FastText等

由于比赛需要尽可能获得高分，这里主要介绍基于神经网络和BERT的文本匹配算法。

BERT［1］是一种预训练语言模型，通过海量文本、Transformer架构和MLM训练任务在众多NLP任务上取得了优异成果。对BERT不了解的读者，可以参考我之前的文章“从BERT、XLNet到MPNet，细看NLP预训练模型发展变迁史”［2］。

比赛中我们测试了5-6种不同的神经网络方法，并最终选择了3种在dev上表现最好的模型加权融合。具体可以参考文件。

文本CNN（TextCNN）TextCNN是Yoon Kim［3］在2014年提出的用于句子分类的卷积神经网络。文本匹配任务本质上可以理解成二分类任务（0：不相似，1：相似），所以一般的分类模型也能满足匹配需求。

与图像中的二维卷积不同，TextCNN采用的是一维卷积，每个卷积核的大小为（h为卷积核窗口，k为词向量维度）。文中采用了不同尺寸的卷积核，来提取不同文本长度的特征。

然后，作者对于卷积核的输出进行最大池化操作，只保留最重要的特征。各个卷积核输出经MaxPooling后拼接形成一个新向量，最后输出到全连接层分类器（Dropout + Linear + Softmax）实现分类。

我们知道，文本中的关键词对于判断2个句子是否相似有很大影响，而CNN局部卷积的特效能很好的捕捉这种关键特征。同时TextCNN还具有参数量小，训练稳定等优点。

文本RNN（TextRCNN）相比TextCNN，TextRCNN的模型结构看起来复杂一些。

简单浏览论文后，会发现它的思路其实简单，粗暴。

首先通过词向量获得字符编码，随后将其通过双向RNN学习上下文特征，编码得到两个方向的特征。

再将词向量和、拼接得到新向量，输入经tanh函数激活的全连接网络。最后，将网络的输出最大池化，并输入另一个全连接分类器完成分类。

RNN模型对于长文本有较好的上下文“记忆”能力，更适合处理文本这种包含时间序列的信息。

BERT+MLP（fine-tune）最后一种方法，直接用语言模型BERT最后一层Transformer的输出，接一层Dense实现文本匹配。

实验中我们发现，对最终输出的每个token特征取平均（MeanPooling）效果好于直接使用首字符“［CLS］”的特征。

模型权重上，崔一鸣等人［5］发布的中文roberta_wwm_ext_large模型效果要好于BERT_large。

最后，我们根据这三种模型在dev上的准确率设置了不同比重，通过自动搜索找到最优权重组合，在线上测试集取得了96.26%的准确率。

读者可以在“NLP情报局”后台回复“文本匹配”直接下载模型论文。

03 涨分trick做一个深度学习主导的算法比赛，除了分析数据与模型，一些trick也是获得高分的重要因素。这里罗列了一些常用策略。

数据增强［6］

标签平滑

自蒸馏

文本对抗训练［7］

模型融合

特征筛选

使用多个学习率［8］

针对这次文本匹配任务，数据增强、标签平滑、模型融合、多学习率都被证明是有效的。

04 总结过去将近1年的天池“新冠疫情相似句对判定大赛”，任务并不复杂，是入门NLP项目实战，提升编程能力的很好锻炼机会。

比赛虽然结束了，疫情犹在。大家一定要保护好自己哦！

编辑：jq

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

神经网络

神经网络

+关注

关注
42

文章
4575

浏览量
98792
数据集

数据集

+关注

关注
4

文章
1179

浏览量
24356
nlp

nlp

+关注

关注
1

文章
464

浏览量
21828

原文标题：天池NLP赛道top指南

文章出处：【微信号：zenRRan，微信公众号：深度学习自然语言处理】欢迎添加关注！文章转载请注明出处。

一种基于自然语言的轨迹修正方法

本研究提出了ExTraCT框架，利用自然语言进行轨迹校正。该框架结合了大型语言模型（LLMs）用于自然语言理解和轨迹变形函数。ExTraCT能够根据场景在线生成轨迹修改特征及其自然语言

发表于 01-19 10:45 •187次阅读

自然语言处理的研究内容

自然语言处理（NLP）的最新发展改变了我们与AI系统的交互方式： 1. 预训练模型：像 GPT-3 这样的模型已经进步，使人工智能能够在聊天机器人和虚拟助手中生成更连贯的上下文感知响应。 2.

发表于 01-18 16:39 •205次阅读

2023年科技圈热词“大语言模型”，与自然语言处理有何关系

电子发烧友网报道（文/李弯弯）大语言模型（LLM）是基于海量文本数据训练的深度学习模型。它不仅能够生成自然语言文本，还能够深入理解文本含义，

发表于 01-02 09:28 •1403次阅读

变频器主控电路的基本任务

变频器的内部控制框图如下所示。变频器主控电路以微机电路为主体，要求提供稳定性非常高的0~+5V电源。一、主控电路的基本任务 1、接收各种信号 1）在功能预置阶段，接收对各种功能的预置

发表于 09-14 15:57 •780次阅读

自然语言处理和人工智能的区别

　　自然语言处理(Natural Language Processing，NLP)是人工智能(AI)中的一个分支，它利用计算机技术对自然语言进行处理，使得电脑能够理解和操作人类

发表于 08-28 17:32 •936次阅读

自然语言处理和人工智能的概念及发展史自然语言处理和人工智能的区别

自然语言处理(Natural Language Processing, NLP)的定义是通过电脑软件程序实现人们日常语言的机器自动处理。为了帮助计算机理解，掌握

发表于 08-23 18:22 •539次阅读

自然语言处理的概念和应用自然语言处理属于人工智能吗

　　自然语言处理(Natural Language Processing)是一种人工智能技术，它是研究自然语言与计算机之间的交互和通信的一门学科。自然语言

发表于 08-23 17:31 •854次阅读

自然语言处理的优缺点有哪些自然语言处理包括哪些内容

自然语言处理（Natural Language Processing）是一种人工智能的技术及领域，它致力于让计算机理解及处理人类语言。它可以帮助计算机对人类

发表于 08-23 17:26 •2608次阅读

自然语言理解问答对话文本数据，赋予计算机智能交流的能力

能够理解和回答用户的问题、执行任务以及进行情感识别等多样化的交流。本文将深入探讨自然语言理解问答对话文本数据的意义、构建过程以及在人工智能研究和应用中的价值。一、自然语言理解问答对话

发表于 08-07 18:11 •418次阅读

自然语言处理包括哪些内容自然语言处理技术包括哪些

自然语言处理(Natural Language Processing, NLP)一般包括以下内容：语音识别(Speech Recognition)：将人类语言转换为计算机可以理解的形式。语音合成

发表于 08-03 16:22 •3931次阅读

PyTorch教程-16.7。自然语言推理：微调 BERT

节）。现在我们通过微调 BERT 重新审视这个任务。正如16.6 节所讨论的，自然语言推理是一个序列级文本对分类问题，微调 BERT 只需要一个额外的基于 MLP 的架构，如图

发表于 06-05 15:44 •1002次阅读

PyTorch教程-16.4。自然语言推理和数据集

从另一个句子推断出来，或者通过识别语义等同的句子来消除冗余时，知道如何对一个文本序列进行分类是不够的。相反，我们需要能够对成对的文本序列进行推理。 16.4.1。自然语言推理¶ 自然语

发表于 06-05 15:44 •340次阅读

PyTorch教程-16.5。自然语言推理：使用注意力

实验室在 SageMaker Studio Lab 中打开笔记本我们在16.4 节介绍了自然语言推理任务和 SNLI 数据集。鉴于许多基于复杂和深层架构的模型， Parikh等人。( 2016

发表于 06-05 15:44 •346次阅读

PyTorch教程16.7之自然语言推理：微调BERT

电子发烧友网站提供《PyTorch教程16.7之自然语言推理：微调BERT.pdf》资料免费下载

发表于 06-05 10:52 •0次下载

搜索历史

入门自然语言处理的基本任务——文本匹配

评论