红色的线: 只在预测的时候使用
Add &Norm
预测的时候使用
q
k=Y
训练数据集
X
训练时需要,预测时为None
concat
Input Embedding
Linear
N×
v
q=X
Y_valid_length形状(batch_size)
v=Y
预测时,第一个输入token: <bos>
Feed Forward
v=X
Positional Encoding
Y
decode_output
kv的有效长度
Multi-Head Attention
Softmax
q=Y
训练时,用于计算loss
X_valid_length形状(batch_size)
encode_output
k
预测的数据
MaskedMulti-Head Attention
embedding_output
k=X
OutputProbabilities
Output Embedding