[ACL2020]Generalizing Natural Language Analysis through Span-relation Representations

1 介绍
2 span-relation representations
- 2.1未涉及句子级任务
3.span-relation model
- 3.1 span representation
- 3.2 span and relation label prediction
- 3.3 应用到不同任务
- 3.5 多任务学习MTL
4 GLAD Benchmark基准 and Results
- 4.1 实验
- 4.2 证明通用模型有效
- 4.3 MTL
- - 4.3.2 任务之间的关系分析
  - 4.3.3 相似和区别
  - 4.3.4 MTL under different settings
  - 4.4.4 模型复杂度

1 介绍

2 span-relation representations

解释BRAT如何标注大量任务
- span标注–span-oriented tasks
- relation标注 --relation-oriented tasks

base(Lee et al.， 2017)–一个端到端的共指消解模型，span标注
- 扩展到其他任务
- 模型核心：用一个任意长度的向量表示span–用以预测label或span-pair的label

条件：可以任意长度
内容表示 $z_i^c$
边界表示 $z_i^u$
句子的token $w_1,w_2,...,w_n$
span: $s_i=[(b_{b_i},b_{b_i+1},...，b_{e_i}]$
$c_1,c_2,...,c_n=TokenRepr(w_1,w_2,...,w_n)\\ u_1,u_2,...,u_n=BiLSTM(c_1,c_2,...,c_n)\\ z_i^c=SelfAttn(c_{b_i},c_{b_i+1},...，c_{e_i})\\ z_i^u=[u_{b_i};u_{e_i}]\\ z_i=[z_i^c;z_i^u]$
- tokenRepr:Glove or Bert

invalid label
- NEG_SPAN
- NEG_REL
Model
1. 预测所有的span（长度<l）:MLP(多层感知机） $softmax(MLPspan(zi))∈Δ∣L∣softmax(MLP^{span}(z_i))\in\Delta^{|L|}$
2. 剪枝：保留前 $K=n⋅τK=n\cdot \tau$ 个span,剩下的为NEG_SPAN(阈值 $τ\tau$ 低，则剪枝更多)
3. 预测关系的感知机MLP: $ojk=MLPrel([zj;zk;zj⋅zk])∈R∣R∣o_{jk}=MLP^{rel}([z_j;z_k;z_j\cdot z_k])\in \mathbb{R}^{|R|}$

最大化真实关系的概率
具体到不同任务上需求不同
- 关心前后顺序：关系抽取
- 不关心顺序：
  - eg:共指消解：
    - 连接相同概念的span–cluster
    - 多个也只要连上了就好
为此，提供两种loss–最大化
- pairwise loss: $softmax(o_{jk})_{r_{jk}},r_{jk}是实际答案的indexes$ –其他所有任务
  - 预测一对
- head loss： $Σk∈head(sj)softmax([oj1，oj1,...,ojK)k\Sigma_{k\in head(s_j)} softmax([o_{j1}，o_{j1},...,o_{jK})_k$ –用于共指消解
  - 预测一堆
  - (?多元关系？怎么样）
这两个loss，仅在如何normalize时有区别，其他并无区别
test
- 共指消解：把span连接到得分最高的前件上e (Lee et al., 2017)
- consti:constituency parsing：贪婪的从上到下的解码，去产生有效的解析树
- dep:依赖解析：每个词链接到一个父节点（最高关系得分的）
- other：对每对实体预测关系，没关系的预测为NEG_REL
核心观点
- 我们的模型任务无关
  - 只要能建模为span标注任务和span关系预测任务即可

在这里插入图片描述

假设：语言模型预训练在理论上与MTL正交，实际上benefit是重叠的
分析
- (1)对于OpenIE和ORL来说，使用SRL进行多任务学习可以显著提高性能，而其他任务的提高则很少或根本没有。
- (2)依赖解析和SRL是对大多数目标任务有益的通用源任务。
- SpanREL可以很容易地进行MTL,并且看出谁是有益的源任务

在这里插入图片描述

证明SpanRel提供分析不同任务相似性和区别的平台
- 猜测，与attention有关
  - attention反应内部焦点
  - 公式： $simk(t,t′)=−1∣Xt∣Σx∈Xt∣∣Akt(x)−Akt′(x)∣∣F′Akt(x)是第k个头的attentionmapsim_k(t,t')=-\frac{1}{|X_t|}\Sigma_{x\in X_t}||A_k^t(x)-A_k^{t'}(x)||_{F'}\\A_k^t(x)是第k个头的attention map$
  - 下图证明这个公式确实反映了相似度