第三章 · 3.6

3.6 AttentiveFP:让网络学会看重点

AttentiveFP: Attention over Molecular Graphs
读出函数决定分子表示如何由原子拼成;固定池化对每个原子一视同仁,而毒性等性质常系于少数关键子结构。本节回顾序列注意力的打分与归一,沿 GAT 把邻域权重改为内容可学,重点剖析 AttentiveFP 的两级注意力:节点级看邻居,读出级看全局;继而核查其在 MoleculeNet 的成绩,把权重画回分子,并辨析注意力不等于解释的争议。

3.6.1 动机:读出决定了哪些原子算数

3.5 节把图模型拆成两段:消息传递让原子吸收邻居信息,读出函数(readout function)把原子状态拼成分子向量。加和、平均、取最大三种固定读出有共同前提——每个原子贡献同等份额。加和保留分子大小的信息,平均把大小抹平,取最大只留最强激活,但无论哪一种,都不区分原子的重要性:四十个原子的分子里,每个原子都占四十分之一。

化学偏偏常走少数派路线。致突变性与 hERG 心脏毒性往往由结构警报(structural alerts)决定——芳香硝基、亲电弹头、富电子稠环这类小集团;药效团(pharmacophore)更是只有寥寥几个原子:一个氢键供体、一个疏水中心,再配上固定的空间距离。真正推动性质的是八个原子,固定平均却给其余三十多个原子各发一份权重,关键子结构的信号随即稀释;分子越大,稀释越重。放大分子上的预测变差,一部分原因就在这里。

应对的办法有三条。一是外挂规则:警报列表先于模型存在,命中即标记。二是回到指纹:ECFP 已把子结构编码成比特,3.3 节的随机森林靠不纯度下降自行挑选——但指纹粒度在训练前写死,任务说了不算。第三条路把“重要性”本身变成可学习量:让网络在训练中为每个原子、每条邻居消息算出一个权重。这就是注意力机制(attention mechanism)

表 3.6-1读出策略对照:权重从固定到可学
读出策略原子权重分子大小信息对少数关键子结构
加和固定为 1保留(向量随原子数增长)被其余原子稀释
平均固定为 1/n抹平稀释更重,分子越大越弱
最大集中于单点抹平只留最强单激活,丢组合信息
注意力读出可学习 αi,和为一不自动保留(常以原子数特征另行补充)权重向关键原子集中
注记

从“选比特”到“学权重”。随机森林在 1024 个指纹位上挑比特,与注意力读出在几十个原子上分权重,回答的是同一个问题:分子里哪些局部算数。差别在自由度——前者只能在预制的子结构集合里挑选,后者在连续空间里为任意原子组合赋权,粒度随任务与数据调整。灵活是买来的:权重的参数要靠数据喂饱,小数据集上这份灵活可能变成负担(3.6.6)。

3.6.2 序列注意力的最小回顾

注意力诞生在序列建模里:翻译要决定目标词对齐哪些源词,摘要要决定句子吸收哪些要点。剥离所有工程细节,留下的骨架只有三个角色——查询(query)问“我在找什么”,每个位置的(key)答“我这里有什么”,匹配度决定从对应(value)中取多少。打分、归一、加权取值,三步合起来就是缩放点积注意力(scaled dot-product attention)(Vaswani et al., 2017):

Attention(Q, K, V) = softmax( Q KT / √dk ) V
(3.6-1)Q ∈ Rn×d_k 为 n 个查询堆叠的矩阵,K、V 同形,分别为键与值;softmax 逐行归一。权重落在单纯形上:非负、每行和为一——加权平均的推广。

两个设计需要说清。其一,除以 √dk 不是装饰。设 q、k 各分量独立、零均值单位方差,点积 q·k 的方差随维度 dk 线性增长;不缩放时,softmax 的输入跨度以 √dk 的速度扩张,很快被推向近似独热的分布,梯度经 softmax 雅可比几乎归零。除以 √dk 把方差拉回 1 附近,训练才稳定。其二,softmax 的归一是局部的还是全局的,取决于求和范围——序列里对全部位置归一,图上则只对邻域归一。这一点在下一小节成为图与序列的分界线。

抽象地看,式 (3.6-1) 做的事只有一件:以“内容相似度”为权做加权平均,顶替原先的等权平均。序列有位置顺序,分子图没有;但分子图有天然的邻接关系,“该看谁”的问题换了个提法——看哪些邻居、看哪些原子。打分函数也随之处更换:点积换成一对可学习向量作用于两个节点表示的拼接。

还有一层差异值得点破:归一的范围决定权重的“竞争对手”。序列注意力对全句归一,一个词与全部位置争夺份额;图注意力只对邻域归一,一个邻居只在键连的小圈子里竞争。后果是图上的注意力系数永远是局部相对量——同一个 α = 0.4,在三个邻居的季碳上与在十几个邻居的稠环碳上,含义并不相同。跨分子、跨原子比较系数时,先看邻域大小,再谈数值大小。

3.6.3 图注意力:权重由内容决定

3.5 节的 GCN 给出了注意力最贴切的参照系:邻域聚合的权重由度数固定,对称归一化后每条边拿到 1/√(dudv),训练前后分毫不变。图注意力网络(graph attention network, GAT)把这份权重交还给模型(Veličković et al., 2018)。对中心原子 v 与其邻居 u,先做共享线性变换,再以一个小打分向量 a 评估两边内容的匹配程度:

evu = LeakyReLU( aT [ W hu ‖ W hv ] )
(3.6-2)hu、hv ∈ RF 为邻居与中心原子的输入表示;W ∈ RF′×F 为共享变换;a ∈ R2F′ 为打分向量;‖ 为向量拼接。evu 无界、未归一,可正可负——LeakyReLU 的职责正在于保留负打分的次线性信息,而非截断为零。

打分只在 v 的邻域内归一:

αvu = exp(evu) / Σk∈N(v) exp(evk)
(3.6-3)N(v) 为 v 的键连邻居集合。αvu ≥ 0,且对固定 v 求和为一。注意打分是有向的:aT[Whu‖Whv] 中拼接次序固定,evu 与 euv 一般不相等——化学上说得通,给电子的邻居与接受电子的中心,互相的重要性本就不对称。

归一化后的权重接管聚合:

hv′ = σ( Σu∈N(v) αvu W hu )
(3.6-4)σ 为非线性激活。与 3.5 的 GCN 聚合逐项对照:线性变换、求和、非线性三处全同,唯一被替换的是权重——从“由度数固定”到“由内容计算”。
定义

图注意力系数。对图上一条有向边 (v, u),式 (3.6-2) 计算的原始打分经式 (3.6-3) 在中心节点 v 的邻域内做 softmax 归一,所得 αvu ∈ (0, 1) 称为图注意力系数;它度量“v 更新自身表示时从 u 处吸收信息的份额”。系数的取值依赖两端节点经 W 变换后的内容,因此同一官能团在不同化学环境中可获不同权重——结构上下文由此进入聚合权重。

GCN:度数决定

权重 1/√(dudv) 固定,仅反映图的连接密度;无需额外参数,稳定,但对内容不敏感——亲电碳与惰性碳若度数相同,待遇相同。

GAT:内容决定

权重 αvu 由两端表示计算,随任务与训练状态更新;代价是每条边一次打分运算,以及一份需要数据约束的自由度。

多头注意力(multi-head attention)再添一重冗余:K 组独立的 (W, a) 并行计算 K 套权重。中间层把 K 个头的输出拼接(特征维变为 K·F′),让不同的头各守一套打分标准——一套看电性互补、一套看度数与拓扑,分工无须人工指派;末层改拼接为平均,避免输出维度随头数膨胀。这套用法直接继承自序列注意力(Vaswani et al., 2017),在图上原样可用。

GAT 原是为节点分类设计的:一层看一度邻居,权重学得再好,也只回答“这个原子是谁”。分子性质预测要的是整张图的向量——还差最后一跳。

  • 2017消息传递框架把图模型统一为“聚合—更新—读出”三件套,读出首次与聚合并列成为设计维度(Gilmer et al., 2017)。
  • 2017缩放点积注意力成为序列建模的标准件(Vaswani et al., 2017)。
  • 2018GAT 把邻域权重从度数解放为内容(Veličković et al., 2018)。
  • 2020AttentiveFP 把注意力同时用在节点与读出两级,进入分子性质预测(Xiong et al., 2020)。
习题 3.6-1

设中心原子 v 有三个邻居 u₁、u₂、u₃,单头注意力打分(LeakyReLU 之后)为 evu₁ = ln 2,evu₂ = ln 4,evu₃ = ln 8。① 按式 (3.6-3) 求注意力系数;② 设三个邻居经变换后的消息 W hu(一维标量)依次为 3、−1、2,按式 (3.6-4)(取 σ 为恒等)求聚合结果;③ 改用 GCN 的等权平均,比较两者并作评论。

参考解答

① exp(ln 2) = 2,exp(ln 4) = 4,exp(ln 8) = 8,配分函数 Z = 2 + 4 + 8 = 14,故 αvu₁ = 1/7,αvu₂ = 2/7,αvu₃ = 4/7。② hv′ = (1/7)·3 + (2/7)·(−1) + (4/7)·2 = (3 − 2 + 8)/7 = 9/7 ≈ 1.286。③ 等权平均给出 (3 − 1 + 2)/3 = 4/3 ≈ 1.333。注意力把近六成权重压给打分最高的 u₃,聚合值随之下移;等权平均对打分完全盲——即便把三个 e 值任意重排,GCN 的输出纹丝不动。另可验证:若三邻居打分相同,α 全取 1/3,两式给出同一结果——度数归一化平均正是“打分恒等”的特例,见习题 3.6-2。

3.6.4 AttentiveFP:先看邻居,再看全局

AttentiveFP 的方案是把注意力用两次,两级各司其职(Xiong et al., 2020)。第一级在节点上。打分与归一同式 (3.6-2)、(3.6-3) 的形式:成对打分、邻域 softmax、加权求和。不同之处在更新与迭代——每一轮的加权聚合结果不直接作为新状态,而是与原子上一轮状态一起送入门控循环单元(gated recurrent unit, GRU)做门控融合;整个过程迭代 T 轮。T 是关键超参数:每轮信息跨一度键传播,T 轮后每个原子“见过”T 键以内的全部邻居——与 3.5 节消息传递层数、ECFP 半径的对应关系在此原样成立。论文的消融显示,多数任务在 T 取约 2~3 时已接近最优;继续加大 T,收益让位于过拟合。

第二级在读出上,也是本节真正的招牌。3.5 节末尾留过一道伏笔:分层读出按“键—环—官能团—分子”的层级逐层池化,分组由化学先验决定;另一种答案是不预设分组,让数据决定每个原子的份额。AttentiveFP 取后者,做法是引入一个虚拟结点(virtual node)——所谓 master 结点,与分子中全部原子连边,自身携带一个可学习状态 q。读出即在这个“星形图”上再做一次图注意力:q 是查询,每个原子的状态既是键又是值:

αi = exp(ei) / Σj exp(ej), ei = LeakyReLU( arT [ q ‖ hi ] )
(3.6-5)i、j 遍历分子全部原子;q 为 master 结点状态(查询),ar 为读出级打分向量。与式 (3.6-3) 逐字同构,只是求和范围从键连邻居换成了整个分子——读出级的“邻域”是全分子。
hmol = GRU( q, Σi αi hi )
(3.6-6)Σi αi hi 为按注意力加权的原子汇总;GRU 门控融合查询旧态与汇总,输出即分子向量。加和读出是 αi ≡ 1/n 的退化特例——固定池化被包进了注意力读出的参数空间里。
左:节点级注意力,中心原子对四个键连邻居的权重以线宽表示,迭代 T 轮;右:读出级注意力,虚拟 master 结点作为查询对全部原子加权,GRU 输出分子向量 节点级:原子注视键连邻居 α=0.46 α=0.28 α=0.17 α=0.09 u₁ u₂ u₃ u₄ v 迭代 T 轮,GRU 更新 权重以线宽示意;α 由两端原子经 W 变换后的内容决定 读出级:分子注视全部原子 master(q) hmol 0.42 0.30 0.15 0.08 0.05 h₁ h₂ h₃ h₄ h₅ αᵢ 之和为一;分子向量 = 原子状态的加权和,权重大头押给谁由任务学出
图 3.6-1 AttentiveFP 的两级注意力(示意)。左:节点级。中心原子 v 对四个键连邻居的注意力系数以线宽表示,权重由两端原子的内容决定而非度数;每轮聚合结果与旧状态经 GRU 融合,迭代 T 轮后每个原子的感受野覆盖 T 键以内。右:读出级。虚拟 master 结点携带查询状态 q,与全部原子连边——读出的“邻域”是整个分子;对各原子打分、softmax 归一、加权求和,再经 GRU 输出分子向量 hmol。两级共享“打分—softmax—加权”同一形式,化学上的分工是先看邻居、再看全局。

两级结构回应了 3.6.1 的动机:节点级让“哪些邻居值得吸收”可学,读出级让“哪些原子算数”可学;固定池化——包括 3.5 节的加和读出——都成了读出注意力在权重取常数时的特例。分层读出与注意力读出由此构成互补的一对:前者把化学先验写进分组结构,后者把分组交给数据。代价与收益都在“可学”二字里,要靠对照实验裁决。

案例

AttentiveFP 论文的成绩口径。Xiong 等(2020)在 MoleculeNet 的八个分类数据集(BBBP、Tox21、ToxCast、SIDER、ClinTox、HIV、BACE、MUV)与三个回归数据集(ESOL、FreeSolv、亲脂性)上,把 AttentiveFP 与 GCN、Weave 等消息传递基线对照。按论文报告,分类任务的 ROC-AUC 大致落在 0.65~0.88 区间(BBBP 与 Tox21 约 0.86、BACE 约 0.88,SIDER 约 0.65),多数数据集较消息传递基线高出约 2~4 个百分点,论文据此称其达到当时的最优预测性能。独立的后续比较给出了清醒注脚:描述符模型(XGBoost 等)与图模型互有胜负(Jiang et al., 2021)——3.3 节的教训依旧,提升以百分点计,不以架构名计;且该量级与划分波动(3.8 节)相距不远,交叉对照不可或缺。

DeepChem 对该架构有现成实现,接口与前几节的模型同构,一段即可跑通,作为本节原理的锚点:

import deepchem as dc
tasks, (train, valid, test), _ = dc.molnet.load_tox21(
    featurizer="MolGraphConv", splitter="scaffold")   # 原子级特征,固定划分对照
model = dc.models.AttentiveFPModel(                   # 两级注意力 + GRU 更新
    n_tasks=len(tasks), mode="classification")
model.fit(train, nb_epoch=20)
auc = dc.metrics.Metric(dc.metrics.roc_auc_score)
print(model.evaluate(test, [auc]))                    # 与 3.3 基线同表记录
习题 3.6-2

① 证明:当注意力打分在邻域内为常数(evk ≡ c 对一切 k ∈ N(v) 成立)且取 σ 为恒等映射时,式 (3.6-4) 退化为“变换后的邻域等权平均”;据此说明 GCN 的(非对称归一化的)平均聚合是 GAT 的特例。② 结合式 (3.6-1) 论证缩放因子 √dk 的必要性。

参考解答

① 打分相同时,αvu = exp(c)/Σk∈N(v) exp(c) = 1/|N(v)|,与 u 无关;代入式 (3.6-4) 得 hv′ = W · (1/|N(v)|) Σu hu,即变换后的等权平均。GCN 的对称归一化 1/√(dudv) 与等权平均只差逐边的归一化常数,信息内容相同——把 GAT 的打分函数“冻结”在常数上,就回到 GCN;反过来,GAT 是把 GCN 的权重解除冻结、交给内容。② 设 q、k 各分量独立同分布、零均值单位方差,则 Var(q·k) = dk,点积的标准差以 √dk 增长。softmax 输入的跨度随之扩张,dk 稍大即近独热:最大权重趋一、其余趋零,softmax 雅可比的行趋零,梯度消失。除以 √dk 恰把方差稳定回 1 量级,输入跨度不随维度漂移。

3.6.5 把权重画回分子:可视化与解释的边界

读出系数 αi 是逐原子的标量,天然可以映射回结构:把每个原子按 α 深浅着色,分子图随即变成一张“模型视线图”——哪里深,模型就把分子向量的大头押在哪里。图 3.6-2 给出示意:对一个带硝基的芳环小分子,训练后的读出权重倾向于聚在硝基及其邻位环原子上,远离警报的长尾近乎白色。论文的特征可视化报告了更强的现象:权重可以跨键聚集在不相邻的原子上——作者称之为模型学到了非局部分子内相互作用(nonlocal intramolecular interactions),例如共轭体系两端的原子同时获得高权重(Xiong et al., 2020)。这类图之所以受欢迎,正因它与药物化学家的读图习惯同构:看分子先看官能团。

左:一个含芳香硝基(结构警报)的分子,原子按读出权重深浅着色;右:逐原子权重的条形图,权重和为一 把读出权重画回分子(示意) N O O Cl 0.22 0.18 0.09 0.05 0.07 高 ← 读出权重 α → 低(环上未标注处为碳原子) 逐原子读出权重 α(Σ = 1) 0.22 0.18 0.10 0.10 0.10 0.07 0.07 0.07 0.05 0.05 N C₁ C₂ C₃ O C₄ Cl O′ C₅ C₆ N 与三个环碳合计 0.60:权重向结构警报聚集(示意数据)
图 3.6-2 读出权重的结构映射(示意数据)。左:芳环上的硝基是经典结构警报,读出注意力把深色集中在氮原子(α = 0.22)、与之相连的环碳(0.18)及两个邻位碳(各 0.10)上;间位、对位与氯几乎不着色。右:同一组权重的条形图,十个原子的 α 之和为一,前四个原子已占 0.60。这种图与化学家的读图习惯同构,但“深色”只说明模型从该原子取走的信息份额大,不直接等于该原子对预测的因果贡献——辨析见正文与警示框。

实践里还有两个技术选择需要交代。其一是用哪一层的权重:读出系数 αi 度量分子向量从每个原子取走多少;节点级系数也可以对入边求和或平均,聚合出原子的“被关注度”——两者回答的问题不同,前者关乎全局拼装,后者关乎消息吸收,图注若不写明便无从对读。其二是对照的缺席:着色解释的说服力一半来自反例。同一模型对不含警报的分子,着色应当平缓;若无论什么分子都处处深色,说明权重近乎均匀,着色失去分辨率,此时“深色”不再携带信息。发表与评审中都应附上这类负对照。

把“模型在看哪里”读成“分子为何有毒”,中间隔着一层未经检验的假设:权重度量信息通路的流量,而因果贡献度量拿走这块信息后预测会变多少——两个量只在特定条件下才重合。序列建模里早有系统性质疑(Jain & Wallace, 2019):同一预测可以由多组差异很大的注意力权重产生,权重不唯一;把权重换成均匀分布或重新排序,预测常常几乎不动,扰动不敏感。翻译到分子上就是:某原子 α 高,可能因为它携带判别信息,也可能只因为它是信息中转站——环系里的枢纽碳把邻域消息汇拢再传出,流量大,贡献未必大。反方意见同样存在:Wiegreffe 与 Pinter(2019)认为上述检验标准本身不充分,注意力的解释力应分情境讨论。争论没有关闭,态度不妨先保守。

警示

注意力权重不是因果解释。读出系数是事后解释(post-hoc explanation)的素材,不是结论。使用纪律:① 当线索,不当证据——着色图用于提出假设(“警报可能在此”),验证交给独立手段(警报规则、机理实验、删原子对照);② 报告稳健性——跨随机种子、跨训练轮次权重是否稳定,不稳定的着色不构成任何解释;③ 谨记权重与预测的耦合可以很松——权重抹平后预测几乎不变的例子并不罕见(Jain & Wallace, 2019)。着色图当作化学发现的起点是合格的,当作化学结论的替身则越界。

习题 3.6-3

论述题:请设计一套检验“读出注意力可信度”的实验方案,对象是 3.6.5 的着色式解释。要求至少包含一种干预式检验、一种外部对照检验,给出可量化的判据,并写明每项检验若通过、若不通过分别支持或否定什么。

参考解答

方案分四层。其一,干预式:权重抹平。把读出权重替换为均匀的 1/n(保持分子向量模长可比),重算预测;以测试集 ROC-AUC 的变化量为判据。变化可忽略,说明模型并未依赖权重通道,着色解释失去载体;变化显著,说明权重携带任务相关信息——但仍不等于因果。其二,干预式:权重置换。在同一分子内随机置换原子间的 α,重复百次,考察预测分数的扰动分布是否显著小于真实权重与随机权重的差异;置换不敏感即红灯。其三,外部对照:与结构警报对齐。取含已知警报(如芳香硝基)的分子子集,做配对比较:警报原子集合的平均 α 是否系统高于非警报原子;报告效应量与显著性,并对齐方向给出敏感性与特异性。对齐良好只说明权重与化学先验相关,是解释力的必要条件而非充分条件。其四,稳定性:同架构多种子重训,逐分子计算权重向量间的相关性;相关性低,则任何单次着色都不足为凭。整体结论的写法:四项全过,可称“权重是稳健且与化学先验一致的相关性证据”;任一项失败,着色图降级为启发式草图。全程不使用“证明机理”一类措辞——这套方案能划定解释的边界,不能把相关性升格为因果。

3.6.6 局限、成本与去向

注意力不是免费的午餐。计算上,打分成对进行:节点级每条边一次,读出级每原子一次,开销随分子线性增长——分子图普遍小于百原子,真正的账单在多头数与迭代轮数 T 的乘积上。统计上,灵活的权重是额外的自由度,需要数据约束:SIDER、ClinTox 这类千级样本的任务上,两级注意力完全可能过拟合,早停与正则化的分量比在固定池化下更重(3.8 节)。结构上,邻域 softmax 有两点刚性:权重非负且强制和一,重要性只剩相对含义;softmax 无法输出精确零,模型想彻底无视某个邻居,只能给一个极小而非零的权重——噪声邻居永远在门外探头。

放大视野收束本节:读出设计至此已有三条路线——结构先验写进分组的分层池化、数据决定份额的注意力读出、以迭代逼近集合信息的聚合式读出。三者并非取代关系,文献中并存且常混搭;裁决标准自始至终只有一条——回到 3.3 立起的基线表,同划分、同指标、同波动口径下比数字。

两级注意力给出的分子向量,也把本章的性质预测线推到了一个交汇处:表示端,原子份额由任务学出;评估端,成绩要回到 3.3 的基线表上对账,诚实评估的纪律一节都不能少(3.8 节)。往前看,第 4 章的生成模型里,注意力加权还会再登场——对候选分子打分时聚合原子贡献、在图变换中挑选作用位点,机制与本章同源,届时只须增量补课。


关键术语

注意力机制 (attention mechanism)
以内容相似度为权做加权聚合的机制,把“重要性”从先验改为可学习量。
缩放点积注意力 (scaled dot-product attention)
softmax(QKᵀ/√dk)V;缩放因子抑制高维点积导致的 softmax 饱和。
图注意力网络 (graph attention network, GAT)
邻域聚合权重由两端节点内容经打分与邻域 softmax 计算的图神经网络。
图注意力系数 (attention coefficient)
邻域内 softmax 归一后的边权 αvu,非负、对固定中心和为一。
多头注意力 (multi-head attention)
多组独立打分并行计算,中间层拼接、末层平均的稳定化用法。
结构警报 (structural alerts)
与毒性终点强关联的子结构片段,如芳香硝基与亲电弹头。
药效团 (pharmacophore)
决定活性的少量原子特征及其空间排布。
虚拟结点 (virtual node)
为读出增设、与全部原子连边的 master 结点,状态充当查询。
门控循环单元 (gated recurrent unit, GRU)
以门控融合旧状态与新输入的循环更新结构,AttentiveFP 两级各用一个。
非局部分子内相互作用 (nonlocal intramolecular interactions)
跨多个键的原子间作用,如共轭体系两端的远程影响。
事后解释 (post-hoc explanation)
训练完成后从模型内部量(如注意力权重)构造的解释,属相关性证据。

参考文献与延伸阅读

  1. Xiong Z, Wang D, Liu X, Zhong F, Wan X, Li X, Li Z, Luo X, Chen K, Jiang H, Zheng M. 2020. Pushing the boundaries of molecular representation for drug discovery with the graph attention mechanism. Journal of Medicinal Chemistry 63:8749–8760.
  2. Veličković P, Cucurull G, Casanova A, Romero A, Liò P, Bengio Y. 2018. Graph attention networks. In: International Conference on Learning Representations (ICLR).
  3. Vaswani A, Shazeer N, Parmar N, et al. 2017. Attention is all you need. In: Advances in Neural Information Processing Systems 30 (NeurIPS).
  4. Gilmer J, Schoenholz SS, Riley PF, Vinyals O, Dahl GE. 2017. Neural message passing for quantum chemistry. In: Proceedings of the 34th International Conference on Machine Learning (ICML). PMLR 70:1263–1272.
  5. Jain S, Wallace BC. 2019. Attention is not explanation. In: Proceedings of NAACL-HLT 2019 1:3543–3556.
  6. Wiegreffe S, Pinter Y. 2019. Attention is not not explanation. In: Proceedings of EMNLP-IJCNLP 2019:11–20.
  7. Wu Z, Ramsundar B, Feinberg EN, et al. 2018. MoleculeNet: a benchmark for molecular machine learning. Chemical Science 9:513–530.
  8. Jiang D, et al. 2021. Could graph neural networks learn better molecular representation for drug discovery? A comparison study of descriptor-based and graph-based models. Journal of Cheminformatics 13:3.