核心概念
Transformer
以自注意力在序列位置之间交换信息,并配合前馈层等组件处理序列的一类神经网络架构。
Transformer架构 变换器 自注意力模型
简明解释
Transformer是一类用自注意力在序列位置之间交换信息,并配合前馈层、残差连接等组件处理序列的神经网络架构。它针对当时循环式序列模型难以在同一序列的位置间并行计算这一限制,尝试以attention作为主要序列变换主干,而不依赖循环或卷积。[1, §§1 and 3]
自注意力让每个位置按任务需要汇聚其他位置的信息,计算可并行展开。原论文以英德、英法机器翻译评测这套设计,报告了BLEU分数、训练成本及与当时系统的比较;这些是特定数据与任务上的验证,不是通用智能测量。[1, §6] 后来Transformer用于语言、视觉和多模态模型,但它没有发明attention,也不是完整聊天产品。实际系统还需要数据、训练目标、解码和其他组件;表现与成本须按具体任务、版本和上下文评价。
历史位置
本页参考来源
- Vaswani A, Shazeer N, Parmar N, et al.. Attention Is All You Need [C]. arXiv / NeurIPS, 2017. arXiv v1, 2017-06-12. 定位:Abstract; §§1, 3, 6; submission history. 稳定来源(访问 )。