发表于2019年的对话意图识别任务的baseline
本文发表时间算比较早了,模型结构比较简单,大体就是以BERT作为encoder编码器部分,对输入序列进行编码获得token的词向量表示
意图识别本质就是分类任务,这篇文章使用BERT最后一级的[CLS] 作为句子分类的向量表示。槽填充部分使用分类标注的形式。因为槽填充其实就是在进行命名实体识别,这篇文章也做了CRF作为输出级的实验,从实验结果来看,两个数据集上结果有好有坏。联想到之前做少样本NER的时候,发现其实BERT+MLP+Softmax已经可以获得足够好的性能。CRF是不是真的很好用?现在做NER的看到有很多基于Span分类的方法了。
整体模型结构从现在来看是非常简单的,但在一些任务中已经足够好用(实际工程上,同时这个模型代码也比较好看懂和好改,输入输出格式也简单易懂。)
搜对话意图识别任务baseline的时候高频出现的是这篇文章。我觉得其实有很多可以改进的地方(单纯从这篇文章的方法角度)
- [CLS] 单纯做句子分类任务的缺陷在后面的文章已经提到了,有类似Sentence- BERT等更好的句子分类方法
- 虽然可以应用到对话意图识别任务中,但从源代码中可以看到,其实并没有利用对话层面的信息,将对话句子处理成纯文本的形式丢给BERT看的。对话其他关联研究(情绪分类等)支持对对话者信息、对话互动进行建模可以更有效进行表示,不知道放在意图识别这里有没有研究过类似的问题?