ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【论文精读】《Emotion Recognition in Conversation》:直至2019年ERC领域已有哪些进展还有哪些挑战?

【论文精读】《Emotion Recognition in Conversation》:直至2019年ERC领域已有哪些进展还有哪些挑战? 提示本文纯手工制作无AI加工如有错误或质疑尽情反馈。引用基本上都来源于原论文想看哪里点哪里当然推荐从头到尾读论文相关基本信息1. 现如今该论文价值何在2. 论文中所述ERC的挑战到底有哪些2.1 “Categorization of emotions” : 情绪分类2.2 “Basis of emotion annotation” 情绪数据集标注基础2.3 “Conversational context modeling”对话上下文建模2.4 “Speaker specific modeling”特定对话参与者建模2.5 “Listener specific modeling”针对听众的建模2.6 “Presence of emotion shift”不可忽视的情绪转变2.7 “Fine-grained emotion recognition”细粒度情感识别2.8 “Multiparty conversation”多人对话2.9 “Presence of sarcasm”讽刺之气2.10 “Emotion reasoning”情绪推理2.11 小结3. 来看看数据3.1 数据集有哪些4. “最新”进展看看前人是如何面对ERC挑战的4.1 DialogueRNN一句话核心方法原文锚点关键句翻译与讲解实验真正证明了什么在 ERC 中 []~(▽)~*4.2 CMN 与 ICON额外还有 IANN一句话核心方法原文锚点关键句翻译与讲解实验真正证明了什么在 ERC 中 (▽)4.3 EmoContext 上的 bc-LSTM 家族一句话核心方法原文锚点关键句翻译与讲解实验真正证明了什么在 ERC 中 ヾ(≧▽≦*)o4.4 HRLCEEmoContext 上的“杂交”框架一句话核心方法原文锚点关键句翻译与讲解实验真正证明了什么在 ERC 中 (●◡●)4.5 该论文给这些方法下的总评5. 术语表论文相关基本信息项目内容英文题目《Emotion Recognition in Conversation: Research Challenges, Datasets, and Recent Advances》作者1.新加坡 南洋理工大学计算机科学与工程学院 - Soujanya Poria2.墨西哥 国立理工学院计算中心 - Navonil Majumder3.美国 密歇根大学计算机科学与工程系 - Rada Mihalcea4.美国 卡内基梅隆大学语言技术研究所 - Eduard Hovy年份2019 (arVix为准)论文链接https://arxiv.org/abs/1905.029471. 现如今该论文价值何在《Emotion Recognition in Conversation》的价值不只是总结了先前已有研究的结论与成果它还明确指出了当时ERC领域仍然存在的多项挑战。与其说这篇论文是一篇综述或总结不如说是为未来ERC领域发展提供线索与依据为之后的研究奠定基础并有可能成为自2019年后新研究是认知基础潜在作用于医疗系统作为心理分析工具、教育理解学生挫败感等领域。该论文可能被误认为是所有ERC领域论文的总和或仅阅读这一篇足够理解该领域。但实际上它仍只是部分且重点引用并阐述了当时已有的几种处理ERC问题的机器学习架构及其之间的比对同时说明仍存在各种挑战以及需要优化的问题。而其中没有详细展开讲述各个架构的原理实验设计及其实验过程。2. 论文中所述ERC的挑战到底有哪些2.1 “Categorization of emotions” : 情绪分类据该论文可知研究中情绪被两种类型的模型进行了定义类别模型离散型维度模型连续型然而对于类别模型则是将情绪分为固定数量的离散类别这也就间接导致了情绪分类口径不统一的问题。而该问题便会影响数据集采集标准进而产生分歧。比如Plutchik普鲁奇克的情绪轮盘图一所示定义了八种不同的基本情绪类型每种类型都有更细的相关子类型Ekman艾克曼总结了六种基本情绪——愤怒厌恶恐惧快乐悲伤和惊讶MELD数据集将情绪分类为七种基本情绪——愤怒厌恶恐惧快乐中性悲伤和惊讶EmoContext数据集中甚至只标注了四种情绪快乐悲伤愤怒和其他图一类别模型不仅口径难以统一选择哪几种以及多少基础情绪种类时也仍然需要谨慎考虑因为基础情绪种数过多相似情绪类别很可能增多比如愤怒和狂怒导致标注数据参与者标注难度上升标注者对数据情绪意见难以统一。基础情绪种数过少无法涵盖复杂情绪很可能出现多条对话本身存在情绪波动却被误判为完全一致的情绪训练出的模型会显得简单很多而无法分析复杂情绪。2.2 “Basis of emotion annotation” 情绪数据集标注基础带有情绪标签的标注工作是很具有挑战性的因为标签取决于标注者的视角正如经典的“千人眼中有千个哈姆雷特”。这也很好的印证了“2.1”中基础情绪种数过多导致标注者对情绪数据意见难以统一的问题。这时候可能就有人说“情绪数据的标签即对对话内容评定这句话在该语境下是什么情绪不应该是由发言人自己决定的吗怎么要求多人对同一数据进行标注” 即自己才能更清楚自己此刻发言的情绪。——想法非常好据此可以将情绪数据标注工作分为三种方式对话中进行边对话边标注影响数据产出对话后进行会话后进行自我标注截至2019还未有尝试会话后由与对话或剧本完全无关的一组或几组人进行主流方式不幸的是该论文表示“在对话期间进行实时标记会影响对话流畅性”同时也很可惜据论文可知截至2019年还未有数据集采用会话后自我标注方式标注数据2.3 “Conversational context modeling”对话上下文建模上下文是NLP自然语言处理研究的核心也是ERC中不可缺少的一环并且在对简短话语进行情绪分类时尤其重要比如“yeah”“okay”“no”它们的情绪表达在不同上下文语境中含义会有所不同。 图二所示图二然而情绪具有动态波动性使得相比于NLP计算这种以情绪为主的上下文时往往存在较大的困难。而该论文中指出对话时的情感动态变化包含两方面自我依赖自我依赖也称为“情感惯性”即在对话过程中对自身感情的影响人际依赖对方的发言与态度也会对自身情绪与发言造成一定影响还可能出现倾向“模仿”对方以建立关系的情况与“人云亦云”有几分相似之处图三所示Person A本就因长期失业而感到沮丧想着寻求Person B的安慰(U1U4)。可是Person B却因为忙于自己的事而敷衍Person AU4U5。致使Person A的情绪转变为生气U6。 以及下图中所示医生会根据对方不同的回答来答复以帮助对方在这个例子中Person A的人际依赖表现十分明显她的情绪受到了Person B发言以及态度的影响。而Person B则是自我依赖情绪惯性表现十分明显情绪基本毫无波动。而医生则是出现倾向于“模仿”对方的情况图三然而建模此类上下文并非只取决于这两种依赖仅仅只是从这个例子中说明了两种依赖对对话双方确实存在影响并可作为因素参考。而自我与人际及依赖的建模还可能取决于话题等其他更多因素比如论证结构对话双方的性格意图观念态度等。尽可能的分析这些因素是实现真正自我与人际依赖建模的关键这也可以带来更丰富的上下文理解。2.4 “Speaker specific modeling”特定对话参与者建模现实中每个人都有独属于自己微妙的表达情绪的方式。这使得对百态的对话参与者的建模是困难的因为这相关个人性格观念与习惯同时对话中常常缺少必要的信息背景。图四所示在背景1的前提下Person B说的“太棒了”更多的是以讽刺的态度情绪表达对本次订单取消的不满在背景2的前提下Person B才有可能是字面意思表达对这次订单取消的认可图四基于原论文描述的场景自制对话显然如果能基于先前对话或补充必要背景信息对对话参与者进行分析通常会得到更好的结果。2.5 “Listener specific modeling”针对听众的建模首先必然存在的事实是倾听方会对说话方的内容进行判断且前提是倾听方安静不发言那么显然需要依靠模型视觉模态对倾听方面部表情进行分析并捕捉其反应。但是据 DialogueRNN 的观点说辞捕捉倾听方反应并不会带来改善因为倾听方后续发言已经包含了他们的反应。此外如果倾听方在对话中从不发言那么他/她的反应就没有什么意义因为对对话或情绪的影响并不大哈哈哈哈似乎很有道理但是再次反转该论文更严谨的指出在需要对对话每一刻的情绪进行连续识别的场景中对倾听方的建模还是有必要的。比如在政治演讲中观众的反应而不是也不太可能对每一句话都进行情绪识别。图五所示图五根据描述绘制发言场景与倾听方反应2.6 “Presence of emotion shift”不可忽视的情绪转变同样一个难点有可能牵引出多个问题就比如如上挑战中就已经提及相似度高的情绪是难以分辨的这也就导致训练出的模型也难以判别两种高相似度情绪的差异进而导致对情绪转变的误判。同样具有挑战性的则是追踪参与者在谈话中对讨论话题的观点发展变化和动态。好在截至2019年最先进的 DialogueRNN情绪识别模型能对没有情绪变化或变化为相似情绪的发言中情绪检测是更为准确的。图六所示该场景中展现了 Joey乔伊因为 Chandler钱德勒最后一句话感到意外和震惊因此情绪由中性转变为了愤怒。图六2.7 “Fine-grained emotion recognition”细粒度情感识别可能在显性和隐性对话过程中双方或多方的观点与意图完全一致但是表达情感的方式会截然不同。而这个时候便需要对对话参与者进行细粒度情感识别它面对对话话题对话参与者的意见和立场有更深入的理解。图七所示当两人同时支持法案却表达相反的情绪态度Person 1直接表达对法案的支持Person 2通过表达反对抗议者的负面情绪间接表达对法案的支持普通的情感识别机器模型无法单独理解Person 2在政府法案方面的积极感情。图七2.8 “Multiparty conversation”多人对话显然现实对话中并不是只有双人对话多人对话也不在少数。而多人对话相比于双人对话这类对话中的情绪更具有挑战性因为更难追踪每个说话者的状态和处理共指问题。2.9 “Presence of sarcasm”讽刺之气“讽刺”竟被单独提出说明其具有的挑战性和重要性便是不可忽视的一点。“讽刺”这一词可能夹杂在情绪性格或态度中而该论文特别指出“讽刺”是一种使用反语来表达轻蔑的语言工具。显而易见的是一个无法检测讽刺的感情识别系统通常无法正确预测讽刺性话语的情感并且对话中检测讽刺很大程度上依赖于对话的上下文和语篇语境同样的也可能取决于个人。而这也再一次印证了对上下文建模和对对话者建模的必要性。2.10 “Emotion reasoning”情绪推理推理能力对于任何可解释的人工智能系统都是必要的。在ERC的背景下人们通常希望理解说话者所表达的情绪的原因。上图三所示一个理想的ERC系统如果具备情绪推理能力应该能够像图三中那样感知到 Person A 在U6中表达的愤怒的原因。可以明显看出这种愤怒是由 Person B 持续的冷漠行为造成的即U4U5。上图六所示类似地当 Joey 发现 Chandler 在前一句话中撒谎了他就会表达愤怒。定义情绪推理的分类或标签集是非常困难的。目前截至2019年还没有包含如此丰富注释的数据集。构建这样的数据集将使未来的对话系统能够形成有意义的论证逻辑和话语结构更接近人类的对话。但是需要注意的是不应该将情绪推理与前面讨论的上下文建模混为一谈。与上下文建模不同情绪推理不仅找出对话历史中引发情绪的上下文话语同时还要确定这些上下文话语对目标话语的作用。2.11 小结因此这篇论文的核心问题不是简单地判断一句话中的情绪或给其机械化分类而是考虑多方面因素智能分析上下文及其所影响的每一句话的复杂情绪并模拟人实现含带情感的更完整复杂的表达方式甚至生成具有情绪感知和共情能力的对话。3. 来看看数据3.1 数据集有哪些该论文只讨论了公开可用的ERC数据集截至2019年ERC领域公开可用的数据集数据集链接IEMOCAPhttps://sail.usc.edu/iemocap/ 需填写申请表3-5天审核SEMAINEhttps://github.com/marytts/dfki-semaine-dataEmotionlineshttp://academiasinicanlplab.github.io/#download 官方下载页MELDhttps://affective-meld.github.io/ 直接下载https://web.eecs.umich.edu/~mihalcea/downloads/MELD.Raw.tar.gzDailyDialoghttp://yanran.li/dailydialogEmoContexthttps://huggingface.co/datasets/oneonlee/cleansed_emocontext表一数据集详细对比其中train训练集用于训练模型让模型学习参数val验证集训练过程中用于调参不参与梯度更新防止过拟合test测试集模型完全训练完成后用来做最终公平评估的数据模型训练时绝不能见过它dialogue对话由多个 utterance 按顺序组成的一次完整对话多轮对话utterance话语一句话/一条发言是对话的最小单位表二在不同情感识别数据集中的标签分布统计注意IEMOCAPSEMAINE 和 MELD 是多模态数据集包含声音视觉和文本信息。其余的是文本类型数据。这些数据集包含类别情绪标签。但是 SEMAINE 数据集的每个语句都标注了四个实值情感属性效价( [ − 1 , 1 ] ) ([-1,1])([−1,1])唤醒度( [ − 1 , 1 ] ) ([-1,1])([−1,1])期望( [ − 1 , 1 ] ) ([-1,1])([−1,1])和力度( [ 0 , ∞ ) ) ([0,∞))([0,∞))。在 EmoContext 数据集中每个对话的情绪标签只分配给最后一句语句。这些数据集都不能用于情绪推理因为它们缺少推理任务所需的必要标注细节。见下图十这些数据集都不包含细粒度和话题层面的情绪标注。4. “最新”进展看看前人是如何面对ERC挑战的原文“recognizing emotion of an utterance in a conversation primarily depends on these following three factors: 1) the utterance itself and its context defined by the interlocutors’ preceding utterances in the conversation, as well as intent and the topic of the conversation, 2) the speaker’s state comprising variables like personality and argumentation logic and, 3) emotions expressed in the preceding utterances.”翻译判断一句话的情绪主要靠三样东西——①这句话本身 它的上下文②对话参与者的状态性格、论证逻辑这类变量③前面话语里已经表达过的情绪。配图其中P a PaPaP b PbPb分别是对话参与者的人格U UU表示对话S SS表示对话参与者的状态I II表示对话参与者的意图E EE表示情绪T o p i c TopicTopic表示话题t tt表示对话轮次但论文无奈指出IEMOCAP 和 SEMAINE 都快发布十年了早期大多数用这两个数据集的工作还没考虑上述因素。原文“most of the works that used these two datasets did not consider the aforementioned factors”4.1 DialogueRNN一句话核心方法一句话概括用“带注意力的分层多级 RNN”同时建模自我与人际依赖并且头一次把目标话语的说话人信息用了起来在 IEMOCAP 和 SEMAINE 上把前辈们全部比了下去。方法总流程论文给的粒度就三步把目标话语的说话人信息纳入考虑——这正是它区别于 CMN/ICON 的关键用分层多阶段 RNN 建模自我情绪影响和人际情绪影响用注意力机制决定“历史里哪些话语更值得看”。为什么这个设计可能有效论文明确指出这批模型CMN/ICON/IANN/DialogueRNN共同证实了“上下文历史 自我/人际影响建模”对 ERC 有益并且 DialogueRNN 的注意力分析显示邻近的话语上下文更丰富把未来话语也当上下文时性能还能提升。原文锚点关键句翻译与讲解锚点 1核心方法“DialogueRNN aims to solve this issue by considering the speaker information of the target utterance and, further, modeling self and inter-speaker emotional influence with a hierarchical multi-stage RNN with attention mechanism.”翻译DialogueRNN 就是要解决 CMN/ICON 留下的盲区——把目标话语的说话人信息考虑进去再用分层多阶段 RNN 加注意力机制来建模自我和人际之间的情绪影响。讲解“multi-stage”指状态是分层递进更新的“attention”负责从历史中筛选有用的上下文。锚点 2实验结论“On both IEMOCAP and SEMAINE datasets, DialogueRNN outperformed the other two approaches.”翻译在 IEMOCAP 和 SEMAINE 两个数据集上DialogueRNN 都超过了另两个方法ICON 和 CMN。讲解IEMOCAP 上加权准确率 63.40%ICON 59.09%、CMN 56.56%SEMAINE 四个维度效价、唤醒度、期望、力度的 MAE 和相关系数也全面领先。表三表四表三其中F1 F1 值 Acc准确率分类任务的评价指标情绪数据集里“中性”判别偏大多数、类别极不均衡所以主要看加权 F1表四其中MAE平均绝对误差Pearson r 皮尔逊相关系数回归任务指标MAE 越小越好预测差多少r 越接近 1 越好高中学的相关性r。SEMAINE 是回归任务所以用它俩锚点 3限制情绪转变“DialogueRNN could only correctly predict 47.5% instances… as compared to the 69.2% success-rate that it achieves at the regions of no emotional-shift.”翻译当目标话语的情绪与上一句不同发生情绪转变时DialogueRNN 只能正确预测 47.5% 的样本而没有情绪转变的区域成功率有 69.2%。讲解可惜再强的 DialogueRNN在情绪转变处照样拉胯——这是所有方法CMN、ICON、IANN、DialogueRNN的通病。锚点 4限制多人对话“on the multiparty conversational dataset MELD, only a little performance improvement is observed by DialogueRNN compared to bc-LSTM”翻译在多人对话数据集 MELD 上DialogueRNN 相比 bc-LSTM 只有一点点提升。讲解加权 F1 是 57.03% vs 56.44%CNN 55.02%表五。论文认为这说明多人 ERC 还是个没解决的方向。表五实验真正证明了什么明确支持的结论上下文历史 自我/人际影响建模确实有益这批模型一致指向这一点DialogueRNN 在 IEMOCAP/SEMAINE 上是当时最强。看数据说话只能有限支持的结论说话人信息有用——但在 EmoContext 这种只有三句话的短对话里DialogueRNN75.80 F1和不用说话人信息的 HRLCE76.66 F1差不多论文的解释是“上下文太短说话人信息变得无关紧要”。实验没有证明的结论它没有证明自己能处理好情绪转变47.5% vs 69.2% 反而是反面证据也没证明长距离上下文建模论文说 RNN 类方法抓长距离上下文都表现不佳。最有说服力的一项实验注意力距离直方图图八所示——直接把“邻近话语被用得最多、过去和未来话语被用到的频率大致相同、远处话语用得少”可视化了出来是“上下文有益且邻近更丰富”的最直接证据。图八其中Δ t ΔtΔt是目标话语与其上下文的距离最欠缺的一项实验情绪转变处只给了个总数字没有拆开分析为什么差、怎么补救MELD 上只和 CNN/bc-LSTM 比没法与 ICON/CMN 进行同台竞技双人对话与多人对话仍有差距。在 ERC 中 [](▽)*它继承了什么继承了 CMN/ICON 的“自我/人际情绪影响”思路同时补上了它们缺失的目标话语说话人信息。它后来影响了什么本论文把它当成最强基线贯穿论文还指出“固定上下文窗口版的 DialogueRNN”适合实时应用——说明它已经成了后续工作要对标的对象。今天哪些部分仍值得复用固定上下文窗口用于实时场景“邻近话语上下文更丰富”的结论。哪些部分不能直接无脑照搬依赖未来话语的版本不能上实时系统多人对话上提升有限情绪转变处效果差。对后续研究的一般启发引用论文结论的原话——“一个有效的情绪转变识别模型 上下文编码器能显著提升闲聊对话的性能甚至改善任务型对话的某些方面”。4.2 CMN 与 ICON额外还有 IANN一句话核心方法一句话概括CMN 是 ERC 里最早给“每个说话人单独配一个记忆槽”的方法之一ICON 把这些记忆互联起来建模自我与人际情绪影响IANN 也走“每说话人独立记忆 交互关系建模”的路线。但这三位都没用目标话语的说话人信息——对“要预测的这句话到底是谁说的”它们并没有处理。方法总流程给每个说话人一个独立的记忆槽说话人特定的上下文建模ICON 的改进把这些记忆互联 → 建模自我与人际情绪影响从记忆中读取上下文给目标话语分类。为什么这个设计可能有效分别对应挑战 2.4说话人特定建模和 2.3上下文建模、自我/人际依赖论文也认可这批模型共同证实了上下文历史建模有益。原文锚点关键句翻译与讲解锚点 1核心方法·CMN“Conversational memory network (CMN), proposed by Hazarika et al. for dyadic dialogues, is one of the first ERC approaches that utilizes distinct memories for each speaker for speaker-specific context modeling.”翻译CMNHazarika et al.针对双人对话提出是最早利用“每个说话人单独记忆”做说话人特定上下文建模的 ERC 方法之一。锚点 2核心方法·ICON“Later, Hazarika et al. improved upon this approach with interactive conversational memory network (ICON), which interconnects these memories to model self and inter-speaker emotional influence.”翻译后来 ICON 在 CMN 的基础上改进——把各个说话人的记忆互联起来建模自我和人际之间的情绪影响。锚点 3共同的缺陷“None of these two methods actually exploit the speaker information of the target utterance for classification. This makes the model blind to speaker-specific nuances.”翻译这两个方法都没有利用目标话语的说话人信息来做分类导致模型对说话人特有的细微差别视而不见。锚点 4IANN“Yeh et al. proposed an ERC method called Interaction-aware Attention Network (IANN) by leveraging inter-speaker relation modeling. Similar to ICON and CMN, IANN utilises distinct memories for each speaker.”翻译IANN 靠人际关系建模 每说话人独立记忆实际套路和 ICON、CMN 差不多。实验真正证明了什么明确支持的结论IEMOCAP 上 ICON59.09% CMN56.56% bc-LSTM55.21%——把记忆互联起来确实有用但都比 DialogueRNN63.40%低见上表。实验没有证明的结论没有证明它们能处理多人对话——论文明确指出把 ICON/CMN 搬到 MELD 会出可扩展性问题测试集说话人数多于训练集时怎么办而且它们完全不用未来话语做上下文。最有说服力的一项实验CMN 与 DialogueRNN 的注意力对比图图九所示。图九其中图源头本身来源于DialogueRNN论文中也表明DialogueRNN相较于CMN预测更准确一些最欠缺的一项实验没有在多人数据集上的实验。在 ERC 中 (▽)它继承了什么把“记忆网络”从问答搬到了情绪识别开辟了“说话人特定上下文建模”这条路线。它后来影响了什么CMN 催生 ICONICON 又被 DialogueRNN 补完本论文的结论是“实时场景下CMN、ICON 和固定窗口的 DialogueRNN 是合适的选择”。今天哪些部分仍值得复用固定上下文窗口的实时可用性每说话人独立记忆的思路。哪些部分不能直接照搬双人对话设计多人扩展性差不用未来话语对目标话语的说话人信息未考虑到的。对后续研究的一般启发说话人信息“用在哪”很关键——只用在历史建模里、不用在目标话语上就基本毫无意义。4.3 EmoContext 上的 bc-LSTM 家族小插曲论文提到当时有两个共享任务——EmotionX与 SocialNLP workshop 合办和 EmoContextSemEval 2019后者吸引了 500 参与者说明 ERC 的热度涨得飞快。图十需要注意EmoContext 数据集极短每个对话只有三句话目标是给第三句打标签前两句没有情绪标签。一句话核心方法一句话概括当时 EmoContext 上的主流解法 用 bc-LSTM 把三句话的时间顺序“封装”起来做上下文建模再靠“GloVe ELMo”这种传统词向量与上下文词向量的结合提升效果。方法总流程每句话用词向量表示传统 GloVe 上下文式 ELMo 混用bc-LSTM 用 LSTM 封装话语的时间顺序预测第三句话的情绪标签。为什么这个设计可能有效对话看作是序列LSTM 在一定程度上把对话顺序信息封装进去了ELMo 比 GloVe 多了上下文感知能力。论文中提到这是当时这些工作里的“共同趋势”common trend。原文锚点关键句翻译与讲解锚点 1核心方法“The key works on this dataset have mainly leveraged on context modeling using bc-LSTM architecture that encapsulates the temporal order of the utterances using an LSTM.”翻译这个数据集上的关键工作主要靠 bc-LSTM 架构做上下文建模——用 LSTM 把话语的时间顺序封装起来。锚点 2趋势“A common trend can be noticed in these works, where traditional word embeddings, such as Glove, are combined with contextualized word embeddings, such as ELMo to improve the performance.”翻译这些工作有个共同趋势把传统词向量GloVe和上下文词向量ELMo组合起来提升性能。锚点 3限制“none of the works on the EmoContext dataset utilize speaker information”翻译EmoContext 上的工作没有一个用到了说话人信息。实验真正证明了什么明确支持的结论DialogueRNN75.80 F1和 Bae et al.、Huang et al.、Chatterjee et al. 的成绩大致相当见上表对比。只能有限支持的结论“对话参与者信息在 EmoContext 上没用”只适用于超短对话——论文中解释“上下文历史太短说话人信息变得无关紧要”原文very short context history… renders speaker information inconsequential。实验没有证明的结论不能推出“说话人信息在长对话里也没用”——恰恰相反4.1 里 IEMOCAP 的结果表明它有用。最有说服力的一项实验DialogueRNN 带说话人信息却在各项比对中没有完全胜过其他模型——本身就是个很好的“反直觉”对照实验。见下图十二最欠缺的一项实验EmoContext 前两句没有情绪标签所以无法研究情绪是怎么在句间流动的。在 ERC 中 ヾ(≧▽≦*)o它继承了什么bc-LSTM 结构来自 Poria et al.ACL 2017。它后来影响了什么形成了“GloVe ELMo 序列编码”的组合HRLCE 直接在这套组合上进行修改优化见 4.4。今天哪些部分仍值得复用短对话场景下轻量的 bc-LSTM 依然够用。哪些部分不能直接照搬EmoContext 是三句话的微型对话结论不能外推到 IEMOCAP 那种长对话“说话人信息没用”更不能当普适结论。对后续研究的一般启发数据集的设计长短、有没有前文标签会直接影响“什么方法有效”的结论——看榜单前应该先看数据集长相。4.4 HRLCEEmoContext 上的“杂交”框架图十一一句话核心方法一句话概括Huang et al. 的 HRLCE 框架 话语编码器ELMo GloVe DeepMoji 三路词向量组合 上下文编码器bc-LSTM 多头注意力在 EmoContext 上拿下当时最好成绩 76.66 F1。方法总流程话语编码器用 ELMo、GloVe、DeepMoji 三种表示共同编码每个话语上下文编码器接收话语编码器的输出采用 bc-LSTM 框架 多头注意力层输出第三句话的情绪。为什么这个设计可能有效三路词向量互补——GloVe 静态、ELMo 带上下文、DeepMoji 是拿海量 emoji 语料练出来的、看这组合感觉已经很懂情绪和讽刺多头注意力在 bc-LSTM 之上再筛一遍更重要的上下文信息。原文锚点关键句翻译与讲解锚点 1结构“HRLCE… comprises of an utterance encoder and a context encoder that takes input from the utterance encoder.”翻译HRLCE 由话语编码器和上下文编码器组成上下文编码器接收话语编码器的输出——两层先处理话语后处理上下文。锚点 2话语表示“To represent each utterance, HRLCE utilizes ELMo, Glove and Deepmoji.”翻译为了表示每个话语HRLCE 用上了 ELMo、GloVe 和 DeepMoji——一句话三种表示。锚点 3上下文编码“The context encoder in HRLCE adapts the bc-LSTM framework followed by a multi-head attention layer.”翻译上下文编码器沿用 bc-LSTM 框架后面再接一层多头注意力。锚点 4限制“Huang et al. applied HRLCE framework only on the EmoContext dataset. However, HRLCE can be easily adapted to apply on other ERC datasets.”翻译HRLCE 只在 EmoContext 上验证过不过该论文认为它很容易迁移到其他 ERC 数据集——注意这是作者的判断不是实验结果。实验真正证明了什么明确支持的结论HRLCE 76.66 DialogueRNN 75.80 F1在 EmoContext 上确实是当时最好。图十二所示图十二只能有限支持的结论只在 EmoContext 一个数据集上验证过“容易迁移到其他数据集”只是论文作者的主观判断还没有实验验证过。实验没有证明的结论无法证明多头注意力或 DeepMoji 具体贡献了多少同样没用说话人信息。最有说服力的一项实验与 DialogueRNN 的直接对比——比带说话人信息的模型还高说明短对话里“表示能力”比“说话人建模”更管用。最欠缺的一项实验跨数据集验证完全缺失——这是它和其他方法最大的差别。在 ERC 中 (●’◡’●)它继承了什么bc-LSTM 家族 “GloVe ELMo”配方4.3再加 DeepMoji 和多头注意力。它后来影响了什么代表了 2019 年前后“多路预训练表示 注意力”的组合范式。今天哪些部分仍值得复用多路词向量互补的思路。哪些部分不能直接照搬只在三句话短对话上验过直接搬到长对话/多人对话效果未知。对后续研究的一般启发论文结论给出的未来方向——多人 ERC、话题级说话人特定情绪识别、对话讽刺检测以及长独白中的细粒度连续情绪跟踪。4.5 该论文给这些方法下的总评考虑到对话既然是序列所以上下文生成都倾向于使用 RNN但 RNN 类方法面对长距离上下文都表现不佳还有很大改进空间原文“Due to the sequential nature of the utterances in conversations, RNNs are used for context generation”原文“ample room for improvement”。实时系统不能依赖未来话语此时 CMN、ICON 和固定上下文窗口的 DialogueRNN 更合适。原文“for real-time applications, systems cannot rely on future utterances”所有方法在情绪转变处集体拉胯47.5% vs 69.2%官方点说这是挑战也是未来研究的机遇论文的结论是有效的情绪转变识别模型和上下文编码器能带来显著提升多人 ERC、话题级对话参与者特定情绪识别、对话讽刺检测、长独白连续情绪跟踪都是未来方向。5. 术语表术语中文说明本文中的具体含义ERC对话情绪识别Emotion Recognition in Conversation给对话里的每一句话打一个情绪标签的任务这篇综述讨论的所有数据集和方法都围着它转dyadic / multiparty双人对话 / 多人对话论文说多人更难要跟踪每个说话人状态还要处理共指categorical model类别模型把情绪分成固定几个类别MELD 7 类、EmoContext 4 类的标注方式也是这些数据集的主流做法dimensional model维度模型不用类别、用连续数值描述情绪的方式SEMAINE 就是每句话标四个实数值属性valence / arousal效价 / 唤醒度心理学最常用的两个情绪维度效价积极还是消极唤醒度激动程度expectancy / power期望 / 力度SEMAINE 特有的两个维度期望和力度emotion shift情绪转变当前这句话的情绪和上一句不同比如从中性变成愤怒所有模型在这里表现最差emotional inertia情绪惯性也叫“自我依赖”人的情绪倾向于保持现状受自己先前情绪的影响self / inter-speaker dependency自我依赖 / 人际依赖自我依赖受自己前面情绪影响惯性人际依赖受对方话语、态度影响甚至模仿对方context modeling上下文建模利用对话历史有时也包括未来话语帮助判断当前话语的情绪图二的 “Yeah” 就是典型例子speaker-specific modeling特定对话参与者建模把“这句话是谁说的”建模进系统listener-specific modeling倾听者建模对“听的人”的反应建模比如看面部表情论文认为只有连续逐刻情绪识别场景如政治演讲的观众才真有必要sarcasm讽刺用反语表达轻蔑的语言工具尤其需要依靠上下文进行识别分析emotion reasoning情绪推理不仅要猜出情绪还要找出“为什么”——哪几句上下文引发了它截至 2019 还没有支持它的标注数据集fine-grained emotion recognition细粒度情绪识别看穿“立场相同但情绪相反”的情况co-reference共指不同说法指向同一对象比如可能“他”“那个人”“钱德勒”是同一个人多人对话的难点之一memory network记忆网络带外部记忆槽的神经网络CMN 给每个说话人一个记忆槽ICON 再把记忆互联起来RNN / LSTM循环神经网络 / 长短期记忆网络RNN 用于处理序列LSTM 是改良版记得更长。对话是序列所以上下文生成倾向于用 RNNbc-LSTM双向上下文 LSTMPoria et al.ACL 2017的结构用 LSTM 封装话语的时间顺序EmoContext 上的主流基线attention mechanism注意力机制让模型自动决定“历史里哪些话语更重要”并按重要程度加权multi-head attention多头注意力同时并行几套注意力从不同角度抓信息再拼起来GloVe / ELMo / DeepMoji三种词向量GloVe传统静态词向量ELMo上下文相关的词向量DeepMoji用海量 emoji 语料训练的表示context window上下文窗口只取当前话语前后固定数量的句子做上下文实时系统拿不到未来话语只能用固定窗口interlocutor state / intent对话者状态 / 意图状态包含性格、论证逻辑、人际关系等意图由先前的意图和状态决定进而决定情绪和话语pragmatic constraints语用约束“什么场合说什么话才合适”层面的“场面话”约束Hovy 的经典概念论文把它和情感对话生成联系了起来
返回列表