Menu

自监督学习

post on 04 Jul 2026 about 2116words require 8min
CC BY 4.0 (除特别声明或转载文章外)
如果这些文字帮助到你,可以请我喝一杯咖啡~

自监督学习 (SSL) 是一种机器学习范式,在这种范式中,系统通过从数据本身生成监督信号来学习理解数据,而不是依赖外部人工提供的标签。在传统的 监督学习 中,模型需要海量的人工标注数据(例如标记为“猫”或“狗”的图像),而这通常既昂贵又费时。SSL 通过创建“预设任务”(pretext tasks)绕过了这一瓶颈,在这些任务中,模型必须预测输入数据中隐藏或缺失的部分,从而有效地让自身学习到执行复杂任务(如 目标检测 和分类)所需的底层结构和特征。

SSL的核心思想在于遮盖或者隐藏部分数据,强迫神经网络对其进行重建,或预测同一数据的不同视图之间的关系。这一过程创建了丰富、通用的特征表示,随后可以针对特定的下游应用进行微调。

自监督学习用于训练各种复杂的深度学习架构,以执行各种任务,从 BERT 和 GPT 等基于 Transformer 的大型语言模型 (LLM) 到变分自编码器 (VAE) 和生成式对抗网络 (GAN) 等图像合成模型,再到 SimCLR 和动量对比 (MoCo) 等计算机视觉模型。

SSL 中有两种常用方法:

  • 生成式方法,模型学习生成像素或单词来填补空白。自然语言处理 (NLP) 中的一个经典例子是预测句子中的下一个单词。在计算机视觉中,诸如 掩码自编码器 (MAE) 之类的技术会遮挡图像的随机块,并要求模型重建丢失的像素,从而迫使模型“理解”视觉上下文。从未标记数据的底层结构中学习有意义表示的过程:“假装输入中有一部分你不知道并预测出来。”
  • 对比学习,这种方法教会模型区分相似和不相似的数据点。通过对图像应用 数据增强 技术(如裁剪、色彩抖动或旋转),模型会了解到这些修改后的版本代表同一个对象(正样本对),同时将其他图像视为不同的对象(负样本对)。像 SimCLR 这样流行的框架在很大程度上依赖于这一原则。

区分 SSL 与无监督和半监督(参见:弱监督学习):

  • 虽然SSL和无监督都利用了无标注数据,但是无监督学习通常侧重于发现隐藏模式或聚类,没有特定的预测任务,而SSL作为一个监督任务,根据标准答案优化性能,其中的标签数据根据数据本身自动生成。这种与传统机器学习范式的不完美契合导致了现在统称为“自监督学习”的各种技术有了自己的分类。
  • 半监督学习结合了少量的标注数据和大量的未标注数据,而纯SSL在进行任何微调之前,完全从未标注数据中自行创建标签即假托任务。比如CLIP中的创建的NxN样本对,只有对角线上的才是正样本,其他的都是负样本。

自监督学习如何运作

本质上,假托任务从未标记数据中产生“伪标签”,这里的伪标签是与监督学习中的人工标注的标签相区分,和半监督中的伪标签技术不一样。“假托”一词意味着训练任务本身并没有(不一定)有用:它之所以有用,仅仅是因为它向模型传授了对后续下游任务有用的数据表示。因此,假托任务通常也被称为表示学习/表征学习。

使用 SSL 预训练的模型通常会针对其特定的下游任务进行微调:这种微调通常涉及真正的监督学习(尽管仅使用监督学习训练模型所需的一小部分标记数据)。

自编码器

自编码器是一种经过训练的神经网络,可以压缩(或编码)输入数据,然后使用该压缩表示形式重建(或解码)原始输入数据。他们经过训练,使用原始输入本身作为参考标准来最大限度地减少重建错误。其实就是Transformer中的编码和解码器,还有VAE变分自编码器VAE。

对比学习

对比自监督学习方法为模型提供多个数据样本,并要求它们预测这些样本之间的关系。使用这些方法训练的模型通常是判别模型,而不是生成式模型。

对比模型通常使用数据-数据对进行训练,可以训练模型来区分相似和不相似事物。这些配对通常通过数据增强创建:对未标记的数据应用不同类型的转换或干扰,以创建新的实例或增强视图。但是CLIP使用的是文本-图像对。

自监督学习配图 1

实例判别

基于实例判别的模型将训练设为一系列二元分类任务:使用一个数据样本作为目标(或“锚点”),其他数据样本被确定为“正面”(匹配)或“负面”(不匹配)。比如CLIP,SimCLR,MoCo。

非对比学习

有点违背直觉的是,“非对比学习”是指与对比学习密切相关的方法(而不是像人们可能猜测的那样,是对非对比学习方法的笼统概括)。模型只使用正对进行训练,学习如何最大限度地减少它们之间的差异,因此_是非对比性的_。

与对比学习相比,非对比方法相对简单:因为它们仅对正样本进行操作,所以它们使用较小的批量大小来进行训练周期,并且不需要存储库来存储负样本。这样可以节省预训练期间的内存和计算成本。

非对比模型,如 Bootstrap Your Own Latent (BYOL) 6 和 Barlow Twins7 取得了与对比和纯监督结果相当的成绩。

多模态学习

给定不同类型(模态)的数据点,对比方法可以学习这些模态之间的映射。例如,对比语言-图像预训练 (CLIP) 联合训练图像编码器和文本编码器,使用从互联网收集的数百万个现成的未标记(图像、文本)配对来预测哪个标题与哪个图像对应。预训练后,自然语言处理 (NLP) 用于参考训练中的视觉概念学习(甚至描述新的视觉概念),使得 CLIP 训练的模型对于各种迁移学习应用非常有用。

参考资料

自监督学习核心机制 IBM-自监督学习 自监督学习与伪标签

Related posts

Loading comments...