大模型PEFT技术原理（一）：BitFit、Prefix Tuning、Prompt Tuning_peft中的主流技术方案-程序员宅基地

随着预训练模型的参数越来越大，尤其是175B参数大小的GPT3发布以来，让很多中小公司和个人研究员对于大模型的全量微调望而却步，近年来研究者们提出了各种各样的参数高效迁移学习方法（Parameter-efficient Transfer Learning），即固定住Pretrain Language model（PLM）的大部分参数，仅调整模型的一小部分参数来达到与全部参数的微调接近的效果（调整的可以是模型自有的参数，也可以是额外加入的一些参数）。本文将介绍一些常见的参数高效微调技术，比如：BitFit、Prefix Tuning、Prompt Tuning、P-Tuning、P-Tuning v2、Adapter Tuning及其变体、LoRA、AdaLoRA、QLoRA、MAM Adapter、UniPELT等。

1、BitFit

论文地址：https://aclanthology.org/2022.acl-short.1.pdf

代码地址：https://github.com/benzakenelad/BitFit

BitFIt只对模型的bias进行微调。在小规模-中等规模的训练数据上，BitFit的性能与全量微调的性能相当，甚至有可能超过，在大规模训练数据上，与其他fine-tuning方法也差不多。在大模型中bias存在Q,K,V,MLP,LayerNorm中，具体公式如下：

在Bert-Base/Bert-Large这种模型里，bias参数仅占模型全部参数量的0.08%～0.09%。但是通过在Bert-Large模型上基于GLUE数据集进行了 BitFit、Adapter和Diff-Pruning的效果对比发现，BitFit在参数量远小于Adapter、Diff-Pruning的情况下，效果与Adapter、Diff-Pruning想当，甚至在某些任务上略优于Adapter、Diff-Pruning。

通过Bitfit训练前后的参数对比，发现很多bias参数没有太多变化，例如跟计算key所涉及到的bias参数。发现其中计算query与中间MLP层的bias（将特征维度从N放大到4N的FFN层——将输入从768d转化为到3072d）变化最为明显，只更新这两类bias参数也能达到不错的效果，反之，固定其中任何一者，模型的效果都有较大损失。

作者给出了Hugging Face与BitFit参数的映射关系表，如下所示：

2、Prefix Tuning

论文地址：https://arxiv.org/pdf/2101.00190.pdf

代码地址：https://github.com/XiangLi1999/PrefixTuning

prefix-tuning方法是一个轻量级的fine-tuning方法用于自然语言处理的生成任务。该方法可以保持预训练语言模型参数固定（frozen），而只需要在task-specific vector（称为prefix）上进行优化。即只需要少量（约0.1%）的优化参数，即可以在量和小量数据上达到不错的效果。

针对不同的模型结构，需要构造不同的Prefix。

针对自回归架构模型：在句子前面添加前缀，得到 z = [PREFIX; x; y]，合适的上文能够在固定 LM 的情况下去引导生成下文（比如：GPT3的上下文学习）。
针对编码器-解码器架构模型：Encoder和Decoder都增加了前缀，得到 z = [PREFIX1; x; PREFIX2; y]。Encoder端增加前缀是为了引导输入部分的编码，Decoder 端增加前缀是为了引导后续token的生成。

如上图所示， $P_{idx}$ 表示prefix indices序列， $|P_{idx}|$ 表示prefix的长度。Prefix-tuning通过初始化可训练矩阵 $P_\theta$ (维度为 $|P_{idx} \times dim(h_i)|$ ）来存储prefix参数：

$h_i=\left\{\begin{matrix} P_\theta [i,:], ifi even\\ LM_\phi (z_i,h<i), othervise\end{matrix}\right.$

training objective与Fine-tuning相同，但语言模型的参数 $\phi$ 固定，仅仅prefix参数 $\theta$ 是可训练参数。因此 $h_i$ 是可训练的 $P_\theta$ 的函数，当 $i\in P_{idx}$ 时， $h_i$ 由 $P_\theta$ 直接复制得到，对于 $i\notin P_{idx}$ , 由于prefix activations始终在left context因此可以影响到 $h_i$ 。

在实验上，直接更新 $P_\theta$ 的参数会导致优化的不稳定以及表现上的极具下降。因此通过使用较小的矩阵 ${P}'_\theta$ 通过大型前馈神经网络( $MLP_\theta$ )来reparametrize矩阵 $P_\theta$ :

$P_\theta [i,:] = MLP_\theta ({P}'_\theta [i,:])$

其中， $P_\theta$ 和 ${P}'_\theta$ 在相同的行维度（也就是相同的prefix length）, 但不同的列维度。当训练完成后，reparametrization参数被丢掉，仅仅 $prefix(P_\theta )$ 需要被保存下来。

实验中对比了Fine Tuning和Prefix Tuning在E2E、WebNLG和DART三个table-to-text任务上的效果：

3、Prompt Tuning

论文地址：https://arxiv.org/pdf/2104.08691.pdf

代码地址：https://github.com/google-research/prompt-tuning

Prompt Tuning可以看作是Prefix Tuning的简化版本，面向NLU任务，进行了更全面的效果对比，并且在大模型上成功打平了LM微调的效果，它给每个任务定义了自己的Prompt，然后拼接到数据上作为输入，但只在输入层加入prompt tokens，并且不需要加入 MLP 进行调整来解决难训练的问题。通过反向传播更新参数来学习prompts，而不是人工设计prompts；同时冻结模型原始权重，只训练prompts参数，训练完以后，用同一个模型可以做多任务推理。

对比Prefix-Tunning，prompt-tuning的主要差异如下，

论文使用100个prefix token作为默认参数，大于以上prefix-tuning默认的10个token，不过差异在于prompt-Tunning只对输入层(Embedding)进行微调，而Prefix是对虚拟Token对应的上游layer全部进行微调。因此Prompt-Tunning的微调参数量级要更小，且不需要修改原始模型结构，这是“简化”的来源。相同的prefix长度，Prompt-Tunning(<0.01%)微调的参数量级要比Prefix-Tunning(0.1%~1%)小10倍以上，如下图所示

为什么上面prefix-tuning只微调embedding层效果就不好，放在prompt-tuning这里效果就好了呢？因为评估的任务不同无法直接对比，个人感觉有两个因素，一个是模型规模，另一个是继续预训练，前者的可能更大些，在下面的消融实验中会提到

效果&消融实验

在SuperGLUE任务上，随着模型参数的上升，PromptTunning快速拉近和模型微调的效果，110亿的T5模型(上面prefix-tuning使用的是15亿的GPT2)，已经可以打平在下游多任务联合微调的LM模型，并且远远的甩开了Prompt Design（GPT3 few-shot）

作者也做了全面的消融实验，包括以下4个方面，最核心的感受就是只要模型足够够大一切都好说

prompt长度(a)：固定其他参数，作者尝试了{1，5，20，100，150}, Prompt token 的长度在20左右时的表现已经不错（超过20之后，提升Prompt token长度，对模型的性能提升不明显了），同样的，这个gap也会随着模型参数规模的提升而减小（即对于超大规模模型而言，即使 Prompt token 长度很短，对性能也不会有太大的影响）；
Prompt初始化(b): 作者尝试了随机uniform初始化，用标签文本空间初始化，和用Top5K高频词采样初始化，在10^8规模，类标签词初始化效果最好。作者发现预测label也会在对应prompt空间内。不过到百亿规模后，初始化带来的影响就会消失；
T5继续预训练(c):作者认为T5本身的Span Corruption预训练目标和掩码词，并不适合冻结LM的场景，因为在微调中模型可以调整预训练目标和下游目标的差异，而只使用prompt可能无法弥合差异。其实这里已经能看出En-Dn框架在生成场景下没有GPT这样的Decoder来的自然。因此作者基于LM目标对T5进行继续预训练；
继续预训练step(d)：以上的继续预训练steps，继续预训练步数越高，模型效果在不同模型规模上越单调；

可解释性

考虑Prompt-Tunning使用Embedding来表征指令，可解释性较差。作者使用cosine距离来搜索prompt embedding对应的Top5近邻。发现如下：

embedding的近邻出现语义相似的cluster，例如{ Technology / technology / Technologies/ technological / technologies }, 说明连续prompt实际可能是相关离散prompt词的聚合语义
当连续prompt较长（len=100）, 存在多个prompt token的KNN相同：个人认为这和prefix-tuning使用MLP那里我的猜测相似，prompt应该是一个整体
使用标签词初始化，微调后标签词也大概率会出现在prompt的KNN中，说明初始化可以提供更好的prior信息加速收敛

本文链接：https://blog.csdn.net/wshzd/article/details/135509519

原作者删帖不实内容删帖广告或垃圾文章投诉

智能推荐

FTP命令字和返回码_ftp 登录返回230-程序员宅基地

文章浏览阅读3.5k次，点赞2次，收藏13次。为了从FTP服务器下载文件，需要要实现一个简单的FTP客户端。FTP（文件传输协议）是 TCP/IP 协议组中的应用层协议。FTP协议使用字符串格式命令字，每条命令都是一行字符串，以“\r\n”结尾。客户端发送格式是：命令+空格+参数+"\r\n"的格式服务器返回格式是以：状态码+空格+提示字符串+"\r\n"的格式，代码只要解析状态码就可以了。读写文件需要登陆服务器，特殊用..._ftp 登录返回230

centos7安装rabbitmq3.6.5_centos7 安装rabbitmq3.6.5-程序员宅基地

文章浏览阅读648次。前提：systemctl stop firewalld 关闭防火墙关闭selinux查看getenforce临时关闭setenforce 0永久关闭sed-i'/SELINUX/s/enforcing/disabled/'/etc/selinux/configselinux的三种模式enforcing：强制模式，SELinux 运作中，且已经正确的开始限制..._centos7 安装rabbitmq3.6.5

idea导入android工程,idea怎样导入Android studio 项目？-程序员宅基地

文章浏览阅读5.8k次。满意答案s55f2avsx2017.09.05采纳率：46%等级：12已帮助：5646人新版Android Studio/IntelliJ IDEA可以直接导入eclipse项目,不再推荐使用eclipse导出gradle的方式2启动Android Studio/IntelliJ IDEA，选择 import project3选择eclipse 项目4选择 create project f..._android studio 项目导入idea 看不懂安卓项目

浅谈AI大模型技术：概念、发展和应用_ai大模型应用开发-程序员宅基地

文章浏览阅读860次，点赞2次，收藏6次。AI大模型技术已经在自然语言处理、计算机视觉、多模态交互等领域取得了显著的进展和成果，同时也引发了一系列新的挑战和问题，如数据质量、计算效率、知识可解释性、安全可靠性等。城市运维涉及到多个方面，如交通管理、环境监测、公共安全、社会治理等，它们需要处理和分析大量的多模态数据，如图像、视频、语音、文本等，并根据不同的场景和需求，提供合适的决策和响应。知识搜索有多种形式，如语义搜索、对话搜索、图像搜索、视频搜索等，它们可以根据用户的输入和意图，从海量的数据源中检索出最相关的信息，并以友好的方式呈现给用户。_ai大模型应用开发

非常详细的阻抗测试基础知识_阻抗实部和虚部-程序员宅基地

文章浏览阅读8.2k次，点赞12次，收藏121次。为什么要测量阻抗呢？阻抗能代表什么？阻抗测量的注意事项... ...很多人可能会带着一系列的问题来阅读本文。不管是数字电路工程师还是射频工程师，都在关注各类器件的阻抗，本文非常值得一读。全文13000多字，认真读完大概需要2小时。一、阻抗测试基本概念阻抗定义：阻抗是元器件或电路对周期的交流信号的总的反作用。AC 交流测试信号 (幅度和频率)。包括实部和虚部。图1 阻抗的定义阻抗是评测电路、元件以及制作元件材料的重要参数。那么什么是阻抗呢？让我们先来看一下阻抗的定义。首先阻抗是一个矢量。通常，阻抗是_阻抗实部和虚部

小学生python游戏编程arcade----基本知识1_arcade语言 like-程序员宅基地

文章浏览阅读955次。前面章节分享试用了pyzero,pygame但随着想增加更丰富的游戏内容，好多还要进行自己编写类，从今天开始解绍一个新的python游戏库arcade模块。通过此次的《连连看》游戏实现，让我对swing的相关知识有了进一步的了解，对java这门语言也有了比以前更深刻的认识。java的一些基本语法，比如数据类型、运算符、程序流程控制和数组等，理解更加透彻。java最核心的核心就是面向对象思想，对于这一个概念，终于悟到了一些。_arcade语言 like

随便推点

【增强版短视频去水印源码】去水印微信小程序+去水印软件源码_去水印机要增强版-程序员宅基地

文章浏览阅读1.1k次。源码简介与安装说明：2021增强版短视频去水印源码去水印微信小程序源码网站去水印软件源码安装环境（需要材料）：备案域名–服务器安装宝塔-安装 Nginx 或者 Apachephp5.6 以上-安装 sg11 插件小程序已自带解析接口，支持全网主流短视频平台，搭建好了就能用注：接口是公益的，那么多人用解析慢是肯定的，前段和后端源码已经打包，上传服务器之后在配置文件修改数据库密码。然后输入自己的域名，进入后台，创建小程序，输入自己的小程序配置即可安装说明：上传源码，修改data/_去水印机要增强版