transformer模型<br>是当前主流的自然语言处理大模型,<br>在文本生成文本领域的应用最为广泛,<br>例如文案编写、智能客服问答、nl2sql等。
子主题
transformer模型的应用通常包括三种类型:<br>
· encoder-only:只使用transformer模型的encoder部分,典型例子如BERT模型,主要用于上下文语 义表征预训练,快速微调到具体的下游细节任务。<br><br>
· decoder-only:只使用transformer模型的decoder部分,典型例子如GPT模型, 利用自回归模型的 生成优势,在文本序列生成领域得到了广泛的应用。
· encoder-decoder:完整使用 transformer的encoder编码器和decoder解码器,典型例子如谷歌T5模 型,同时使用transformer结构有助于将所有的NLP任务大一统到seq2seq架构中,但参数量也较大。
训练过程通常包括两个部分:<br>
预训练:通常使用自监督的方式,无需人工有监督标注,基于大规模数据和算力获得模型的基础通用表 征能力。<br>
微调训练:通过加载预训练权重参数,使用相对少量任务相关的领域标注数据进行finetuning微调训练, 消耗的算力资源也将答复降低。
Transformer模型的推理过程如下:<br>
推理输入:文本序列,文本序列可以为单句文本,也可以使用多个文本句子,使用特殊间隔符号拼接<br>
模型计算:encoder负责上下文关系提取表征;decoder负责序列关系提前和生成<br>
推理输出:文本序列,广义上也可以是任意字符序列,由训练样本决定