自监督学习
本页介绍深度学习近十年最重要的范式变革——自监督学习(Self-Supervised Learning, SSL):让模型从无标注数据中自己构造学习信号,摆脱对人工标注的依赖。它是 BERT、GPT、CLIP 等现代预训练模型的共同基石,也是深度学习概览到生成式 AI 演进的关键桥梁。
自监督学习的核心是——让学生自己出题、自己做题:
传统监督学习需要人工标注:“这张图是猫""这句话是正面情感”。标注成本极高,互联网上的海量数据(文本、图片、视频)绝大多数是无标注的。自监督学习巧妙地从数据本身构造”题目”:
- 掩码预测(Masking)= 完形填空:把句子里 15% 的词挡住,让模型猜——挡住的词就是”天然答案”。这就是 BERT 的核心思想。图像领域同理:把图片大部分打码,让模型重建(MAE)。
- 预测下一词(Next Token)= 续写:给前半句,让模型预测下一个词——这几乎是所有 GPT 系大模型的预训练目标。看似简单,但模型要”续写得好”,就必须理解语法、事实、推理。
- 对比学习(Contrastive)= 找同类、排异类:对同一张图做两次不同数据增强(裁剪、翻转、变色),得到两个”视角”——它们是正样本对(应该相似);不同图之间是负样本对(应该远)。模型学会”同一物体的不同样子应该特征相近”。SimCLR、MoCo、CLIP 都是这一路线。
- 联合嵌入预测(Joint-Embedding Predictive, JEPA)= 在抽象空间预测:不做像素级重建,也不做对比,而是让模型在特征空间中预测”被遮挡部分的表征”。这是 Yann LeCun(图灵奖得主)力推的新路线——I-JEPA(图像)和 V-JEPA 2(视频)代表了 2024-2025 年最前沿的方向,避免了像素重建的浪费和对比学习对大批负样本的依赖。
自监督的魔力在于:互联网有无限的无标注数据。一旦解决了”自己出题”,模型就能在几乎所有数据上学习——这正是 GPT 和 BERT 能做到”大数据涌现智能”的前提。
三大谱系的技术内核
Section titled “三大谱系的技术内核”自监督方法按”题目类型”分为三大谱系,它们在架构设计、损失函数、训练稳定性上各有特点:
1. 对比学习(Contrastive Learning)
核心思想是”拉近正样本、推远负样本”。以 SimCLR 为例,训练流程为:
- 取一张图 x,施加两次随机数据增强(随机裁剪到 224×224、色彩抖动、高斯模糊),得到两个”视角” x₁、x₂。
- 两个视角分别过同一个编码器 f(·)(通常是 ResNet 或 ViT),得到特征向量 h₁、h₂。
- 特征再过一个投影头 g(·)(两层 MLP),得到嵌入向量 z₁、z₂——投影头只在训练时用,推理时丢弃。
- 一个 mini-batch(batch size = N)产生 2N 个嵌入,其中同一张图的两个嵌入为正样本对,其余 2(N-1) 个为负样本。
- 计算 InfoNCE 损失,让正样本对的余弦相似度远大于负样本对。
InfoNCE 损失的数学形式(纯文本表达):
其中:
- (余弦相似度,衡量两个向量方向的一致性)
- :温度系数(temperature),通常
- 遍历 batch 中所有其他样本(负样本)
- 是指数函数
直觉理解:这就是一个 softmax 分类——把”从一堆候选中找出正样本”当作 N-1 分类问题,正确配对的概率应该最大。温度系数 τ 控制分布的”尖锐度”:τ 越小,模型越关注最难的负样本。
对比学习的核心挑战是负样本数量:负样本越多,学到的表征越好,但 batch size 受显存限制。MoCo 用”动态字典”(维护一个缓慢更新的特征队列)巧妙地解耦了 batch size 和负样本数——即使 batch size 只有 256,也能用到 65536 个负样本。
2. 掩码预测(Masked Modeling)
核心思想是”遮挡再重建”。以 MAE(Masked Autoencoder)为例:
- 把输入图像分成 16×16 的 patch(小块),随机遮挡 75% 的 patch——这个极高的掩码率是关键创新。
- 编码器(ViT)只处理可见的 25% patch——这大幅减少了计算量。
- 被遮挡位置加入一个共享的掩码 token(mask embedding,一个可学习的向量),加上位置编码后送入解码器。
- 解码器重建被遮挡 patch 的原始像素值。
- 损失函数是 MSE(均方误差),只在被遮挡位置计算:
其中 是被遮挡的 patch 集合, 是其数量。
MAE 的关键洞察:图像的信息冗余度远高于文本——一张图大部分像素可以从邻居推断,所以 75% 掩码率不仅可行,还能迫使编码器理解全局结构而非记忆局部。相比之下,BERT 掩码率只有 15%,因为文本信息密度高。
3. 联合嵌入预测架构(JEPA)
这是 LeCun 提出的自监督新范式,核心区别在于预测发生在特征空间而非像素空间:
- 将图像分为可见区域(context)和遮挡区域(target)。
- 用上下文编码器处理可见区域,得到上下文表征 sₓ。
- 用目标编码器(参数是上下文编码器的指数移动平均 EMA)处理完整图像,得到目标表征 sᵧ。
- 用一个轻量级预测器网络,根据 sₓ 和”目标位置编码”来预测 sᵧ。
- 损失是预测表征与目标表征之间的 L2 距离:
其中 表示 stop-gradient(停止梯度),防止模型坍缩到平凡解。
JEPA 的优势:不浪费算力在像素重建上(像素级细节往往不重要),也不需要大量负样本(对比学习的痛点)。I-JEPA(Meta, 2023)在 ImageNet 上超越了 MAE 和对比方法;V-JEPA 2(Meta, 2025)将此范式扩展到视频,并在理解和生成任务上展现出强大潜力。
编码器架构:从 CNN 到 ViT
Section titled “编码器架构:从 CNN 到 ViT”自监督方法的编码器经历了从 CNN 到 Vision Transformer 的迁移:
- CNN 时代(2019-2021):SimCLR、MoCo v1/v2 用 ResNet-50 作为编码器,输出 2048 维全局特征。CNN 的平移不变性天然适合对比学习。
- ViT 时代(2021 至今):MAE、DINOv2、I-JEPA 全面转向 Vision Transformer。ViT 的 patch 级处理更适合掩码预测(直接遮挡 patch),且全局注意力使特征质量更高。
- ViT 架构要点:输入图像 224×224 → 切分为 14×14 个 16×16 的 patch → 每个 patch 线性映射为 D 维向量 → 加入位置编码 → 过 L 层 Transformer encoder(多头自注意力 + MLP)。输出为 [CLS] token 或全局平均池化后的 D 维向量。
防止表征坍缩的关键技术
Section titled “防止表征坍缩的关键技术”自监督学习(尤其是非对比方法)面临一个核心难题——表征坍缩(Representation Collapse):如果所有输入都映射到同一个特征向量,损失可能为零,但学到的表征毫无意义。解决方案包括:
- 对比学习中的负样本:负样本天然阻止坍缩——所有图不能映射到同一点。
- BYOL 的 stop-gradient + EMA target encoder:BYOL(Bootstrap Your Own Latent)不用负样本,而是用”在线网络”预测”目标网络”的输出,目标网络的参数是在线网络的 EMA。stop-gradient 阻止梯度回传到目标网络,加上 EMA 的缓慢更新,阻止了坍缩。
- SimSiam 的 stop-gradient:SimSiam 进一步证明,仅靠 stop-gradient 和批量归一化(BatchNorm 隐式引入了负样本信息)就能防止坍缩。
- DINO/ViT 中的 centering + sharpening:DINO 在教师-学生蒸馏框架中,通过对教师输出做 centering(减去滑动平均)和 sharpening(降低温度),防止输出分布退化。
自监督方法三大谱系
Section titled “自监督方法三大谱系”对比学习核心流程(SimCLR)
Section titled “对比学习核心流程(SimCLR)”MAE 掩码自编码器流程
Section titled “MAE 掩码自编码器流程”训练技巧与工程细节
Section titled “训练技巧与工程细节”自监督训练远比监督训练”娇贵”,以下实践经验至关重要:
数据增强策略(对比学习专用)
Section titled “数据增强策略(对比学习专用)”对比学习对数据增强极度敏感。SimCLR 的消融实验表明,随机裁剪 + 色彩抖动(color jittering) 是最有效的增强组合。具体来说:
- 随机裁剪:从原图中随机裁取 8%~100% 面积的区域,再 resize 到 224×224。这是最关键的增强。
- 色彩抖动:随机改变亮度(±0.4)、对比度(±0.4)、饱和度(±0.4)、色相(±0.1)。之所以如此重要,是因为如果不加色彩抖动,模型容易走捷径——靠颜色直方图区分不同图像,而非学到语义特征。
- 高斯模糊:以 50% 概率施加,核大小取决于分辨率。对 ImageNet 帮助较大。
- MAE 和 JEPA 则不需要强增强——因为它们的题目(掩码/遮挡)本身就是挑战,数据增强反而引入噪声。
温度系数 τ 的选择
Section titled “温度系数 τ 的选择”InfoNCE 损失中的温度系数 τ 是对比学习最关键的超参数:
- τ 太大(如 1.0):损失对困难负样本不够敏感,学到的特征区分度低。
- τ 太小(如 0.01):梯度集中在极少数最难的负样本上,训练不稳定。
- 推荐值:SimCLR 用 0.5,MoCo 用 0.07,DINO 用 0.04(学生)/ 0.04
0.1(教师)。一般从 0.10.2 起调。
Batch Size 与训练时长
Section titled “Batch Size 与训练时长”对比学习对 batch size 非常敏感——更大的 batch 意味着更多负样本,特征质量更高。SimCLR 原论文用了 batch size = 4096(8×128 张 TPU),这在实际中很难复制。MoCo 的动态队列设计就是为了让小 batch size 也能用到大量负样本。
掩码预测(MAE)对 batch size 不敏感(因为不需要负样本),但对训练轮次要求高——MAE 通常预训练 1600 个 epoch(是监督训练的 4~8 倍),才能充分学习。
EMA 动量系数
Section titled “EMA 动量系数”BYOL、MoCo、DINO、I-JEPA 都使用 EMA(Exponential Moving Average,指数移动平均)目标编码器。EMA 的动量系数 m 控制”教师网络”跟随”学生网络”的速度:
通常取 (越接近 1,教师更新越慢)。
MoCo 用 m=0.999,BYOL 用 m=0.99,DINO 在训练过程中从 0.996 线性退火到 1.0。太快的更新(小 m)会导致训练不稳定,太慢的更新(大 m)会导致学到的特征滞后。
投影头(Projection Head)的设计
Section titled “投影头(Projection Head)的设计”SimCLR 发现:编码器输出的特征(h)经过两层 MLP 的”投影头”后再计算对比损失,效果远好于直接在 h 上计算。原因是投影头让对比损失只”指导”特征空间的变化方向,而不破坏编码器学到的通用信息。推理时只用编码器输出 h,丢弃投影头——h 是迁移到下游任务的最终特征。
ViT 训练的特殊技巧
Section titled “ViT 训练的特殊技巧”自监督 ViT 训练比 CNN 更难稳定。关键技术:
- LayerNorm 代替 BatchNorm:ViT 中 BatchNorm 在大 batch 和小 batch 间表现差异大,LayerNorm 更稳定。
- 余弦学习率退火(Cosine Annealing):学习率从初始值按余弦曲线缓慢降到接近 0,最后做一段很小的恒定学习率(DINO 称之为 “teacher temperature warmup”)。
- 随机深度(Stochastic Depth):训练时以一定概率跳过某些 Transformer 层,相当于对网络的深度做正则化,防止过拟合。
SimCLR 对比学习概念代码
Section titled “SimCLR 对比学习概念代码”import torchimport torch.nn as nnimport torch.nn.functional as F
class SimCLRLoss(nn.Module): """SimCLR 的 InfoNCE 损失:同一样例两视角应相似""" def __init__(self, temperature=0.5): super().__init__() self.temperature = temperature
def forward(self, z1, z2): batch_size = z1.size(0) # L2 归一化:使点积 = 余弦相似度 z1 = F.normalize(z1, dim=1) z2 = F.normalize(z2, dim=1) # 拼接所有 2N 个嵌入 z = torch.cat([z1, z2], dim=0) # [2N, D] # 计算所有 pair 的相似度矩阵 [2N, 2N] sim = torch.mm(z, z.T) / self.temperature # 对角线(自己和自己)的相似度设为极小值,排除 sim.fill_diagonal_(-1e9) # 正样本的索引:z_i 的正样本是 z_{i+N},反之亦然 labels = torch.cat([ torch.arange(batch_size, 2 * batch_size), # z1[i] 的正样本是 z2[i] torch.arange(0, batch_size) # z2[i] 的正样本是 z1[i] ], dim=0).to(z.device) # 交叉熵:让正样本对的相似度得分最高 return F.cross_entropy(sim, labels)
# 使用示例# encoder = resnet50() # 编码器:ResNet-50# projection = nn.Sequential( # 投影头:2 层 MLP# nn.Linear(2048, 512), nn.ReLU(), nn.Linear(512, 128)# )# criterion = SimCLRLoss(temperature=0.5)# z1 = projection(encoder(aug1(images))) # 视角 1# z2 = projection(encoder(aug2(images))) # 视角 2# loss = criterion(z1, z2)# loss.backward()MAE 掩码图像建模概念代码
Section titled “MAE 掩码图像建模概念代码”import torchimport torch.nn as nn
class MAE(nn.Module): """MAE 简化版:掩码 → 编码可见 patch → 解码重建""" def __init__(self, encoder, decoder_dim=512, mask_ratio=0.75): super().__init__() self.encoder = encoder # ViT 编码器 self.mask_ratio = mask_ratio # 解码器:比编码器浅得多(如 4 层 Transformer vs 24 层编码器) self.decoder = nn.TransformerEncoder( nn.TransformerEncoderLayer(d_model=decoder_dim, nhead=8), num_layers=4 ) self.mask_token = nn.Parameter(torch.zeros(1, 1, decoder_dim)) # 可学习的掩码 token self.decoder_pos_embed = nn.Parameter(...) # 位置编码
def patchify(self, imgs, patch_size=16): """将 [B, 3, H, W] 切分为 [B, num_patches, patch_size²×3]""" # 例如 224×224 图像 → 196 个 patch,每个 patch 展开为 768 维向量 ...
def forward(self, imgs): patches = self.patchify(imgs) # [B, N, D] B, N, D = patches.shape # 随机选择 mask_ratio 的 patch 遮挡 num_masked = int(N * self.mask_ratio) shuffle = torch.rand(B, N).argsort() mask_idx = shuffle[:, :num_masked] keep_idx = shuffle[:, num_masked:] # 编码器只处理可见 patch(省 75% 算力) visible = patches[torch.arange(B)[:, None], keep_idx] encoded = self.encoder(visible) # [B, N_keep, D] # 解码器:把 mask token 插入被遮挡位置,过解码器 mask_tokens = self.mask_token.expand(B, num_masked, -1) full_tokens = torch.cat([encoded, mask_tokens], dim=1) decoded = self.decoder(full_tokens) # 只在遮挡位置计算 MSE 损失 pred = decoded[:, -num_masked:] # 预测的被遮挡 patch target = patches[torch.arange(B)[:, None], mask_idx] loss = ((pred - target) ** 2).mean() return loss用 HuggingFace 跑掩码语言建模
Section titled “用 HuggingFace 跑掩码语言建模”from transformers import pipeline
# BERT 做完形填空(预训练任务直接体验)unmasker = pipeline("fill-mask", model="bert-base-chinese")for r in unmasker("北京是[MASK]国的首都。"): print(f"{r['token_str']}: {r['score']:.2%}")# 输出: 中: 99.2% (模型"猜"出了被遮挡的词)2025-2026 最新进展
Section titled “2025-2026 最新进展”自监督学习在 2024-2025 年经历了深刻的技术范式更迭,以下是最重要的进展:
JEPA 路线崛起:从像素重建到特征预测
Section titled “JEPA 路线崛起:从像素重建到特征预测”Meta 首席 AI 科学家 Yann LeCun 长期批评像素级重建(如 MAE)“浪费算力在不重要的细节上”。他提出的 JEPA(Joint-Embedding Predictive Architecture) 范式在 2023-2025 年快速成熟:
- I-JEPA(2023):图像版 JEPA,在不依赖负样本和像素重建的前提下,在 ImageNet linear probing 上超越了 MAE 和 iBOT。它用 EMA 目标编码器和 stop-gradient 避免坍缩,用宽而浅的 ViT 作为编码器。
- V-JEPA 2(2025):视频版 JEPA,在海量视频上自监督预训练后,可以作为世界模型(World Model)——理解物理世界的时间因果关系(如”球从桌面掉落会怎样”),对机器人规划和视频理解有重要意义。V-JEPA 2 在多个视频理解基准上达到了 SOTA(State of the Art,当前最优),且不需要任何标注视频。
DINOv2 / DINOv3:视觉基础模型
Section titled “DINOv2 / DINOv3:视觉基础模型”Meta 的 DINOv2(2023)将对比学习(iBOT)和自蒸馏(DINO)融合,在 1.42 亿张图像上训练 ViT(最大 ViT-g,10 亿参数),产出的通用特征可以直接用于分类、分割、深度估计、检索——不需要微调,线性探测就能接近全监督水平。DINOv2 已成为许多视觉任务的默认特征提取器。
2024-2025 年,DINOv3 系列在更大规模、更高质量的数据上进一步扩展,特征质量持续提升,尤其在细粒度识别和医学影像迁移上表现突出。
SigLIP:CLIP 的继任者
Section titled “SigLIP:CLIP 的继任者”Google 的 SigLIP(Sigmoid Loss for Language Image Pre-training, 2023)改进了 CLIP 的训练方式:用 sigmoid 损失 代替对比学习的 softmax 损失,不再需要全局 batch 内的 softmax 归一化。这意味着:
- 训练可以更容易地扩展到超大 batch size。
- 对负样本的需求降低,训练更稳定。
- SigLIP 2 系列(2024-2025)在图文检索、零样本分类、VLM(视觉语言模型)的视觉编码器等场景中,正在取代原始 CLIP 成为新的默认选择。
视频与多模态自监督
Section titled “视频与多模态自监督”- VideoMAE V2(2023-2024):把 MAE 的高掩码率策略(90% 以上)成功扩展到视频,证明了视频的信息冗余度比图像更高。
- V-JEPA 2(2025):如前所述,将 JEPA 推广到视频域并展现出世界模型能力。
- 音频自监督:HuBERT、wav2vec 2.0 等在无标注语音上做掩码预测,学习通用声学表征,是 Whisper 等语音识别模型的隐含先驱。
- 多模态对齐:ImageBind(Meta)尝试用一个编码器对齐 6 种模态(图像、文本、音频、深度、热成像、 IMU),核心思想仍是对比学习。
自监督学习与 Scaling Laws
Section titled “自监督学习与 Scaling Laws”2024-2025 年的研究(如 Meta 的 scaling laws for SSL)表明,自监督学习也有类似 LLM 的 scaling law——模型参数量、数据量、计算量三者同步增长时,下游任务性能可预测地提升。这意味着自监督的”天花板”远未触达,更大的 ViT 和更多的无标注数据仍将持续带来收益。
- ImageNet 预训练(SimCLR / MoCo / MAE / DINOv2):先用自监督在海量无标注图像上学到通用特征,再用少量标注数据微调,就能达到甚至超过全监督训练的效果——Meta 的 DINOv2、MAE 是计算机视觉研究的新基座。
- BERT 语言模型预训练:Google 的 BERT 在整个维基百科 + BookCorpus 上做掩码语言建模预训练,仅加一个分类头就能横扫 11 项 NLP 基准——自监督彻底改变了 NLP 的训练范式。
- GPT 系列预训练:OpenAI 的 GPT-2/3/4 以”预测下一词”为预训练目标,在海量互联网文本上训练,涌现出指令遵循、推理、代码生成等能力——这就是大语言模型的根技术。
- CLIP / SigLIP 图文对齐:OpenAI 的 CLIP 用 4 亿图文对做对比学习(文本与对应图像拉近),实现零样本图像分类——也是 DALL-E、Stable Diffusion 等生成模型的文本编码器。SigLIP 正在取代 CLIP 成为新一代视觉语言模型的标准视觉编码器。
- 医学图像预训练:医学影像标注需专家、成本极高,自监督(如 MoCo-CXR)能在无标注胸片上学到通用表征,用极少标注即可训练高质量疾病检测模型。
- 视频理解与世界模型:V-JEPA 2 在无标注视频上学习物理世界的因果关系,为机器人操作、自动驾驶的仿真预测提供基础。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| HuggingFace Transformers | Python | 提供 BERT/GPT/CLIP/SigLIP 等主流预训练模型与训练/微调工具 |
| timm | Python | PyTorch 图像模型库,收录大量预训练 CNN/ViT(含 DINOv2 等自监督权重) |
| solo-learn | Python | 专注自监督对比学习的开源库,集成 SimCLR/MoCo/BYOL/DINO 等 |
| DINOv2 / DINOv3 (Meta) | Python | Meta 开源的视觉自监督大模型,特征质量极高,可直接用于下游任务 |
| fairseq | Python | Meta 的序列建模工具库,早期自监督 NLP(如 RoBERTa、HuBERT)的核心实验平台 |
| I-JEPA / V-JEPA (Meta) | Python | JEPA 范式的官方实现,代表了自监督的前沿方向 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 自监督学习 | Self-Supervised Learning | 从无标注数据中构造代理任务自动生成监督信号的学习范式 |
| 对比学习 | Contrastive Learning | 拉近正样本对、推远负样本对的特征学习方法 |
| 正样本对 | Positive Pair | 应该在特征空间中相近的样本对(如同图的两个增强视角) |
| 负样本 | Negative Sample | 在对比学习中不应该相似的样本,用于防止特征坍缩 |
| InfoNCE 损失 | InfoNCE Loss | 对比学习核心损失函数,基于 softmax 把正样本与负样本区分 |
| 温度系数 | Temperature (τ) | InfoNCE 中控制分布尖锐度的超参数,越小越关注困难负样本 |
| 掩码语言建模 | Masked Language Modeling (MLM) | 随机遮挡部分 token 让模型预测,BERT 的预训练任务 |
| 掩码图像建模 | Masked Image Modeling (MIM) | 遮挡图像区块让模型重建,MAE 的预训练任务 |
| 代理任务 | Pretext Task | 为自监督设计的辅助任务(如遮挡/旋转预测),本身不是最终目标 |
| 预训练表征 | Pretrained Representation | 自监督阶段学到的通用特征,可迁移到下游任务微调 |
| 表征坍缩 | Representation Collapse | 所有输入映射到同一特征向量的退化现象,是非对比自监督的核心风险 |
| 投影头 | Projection Head | 对比学习中编码器之后的两层 MLP,仅在训练时使用,推理时丢弃 |
| 动量编码器 | Momentum Encoder | 参数通过 EMA(指数移动平均)缓慢更新的编码器,用于提供稳定的训练目标 |
| 联合嵌入预测 | Joint-Embedding Predictive Arch. (JEPA) | 在特征空间预测遮挡区域表征的自监督范式,不需要像素重建或负样本 |
| 指数移动平均 | EMA (Exponential Moving Average) | θ_target ← m × θ_target + (1-m) × θ_online,使目标网络缓慢跟随在线网络 |
| 停止梯度 | Stop-Gradient | 阻止梯度从某一节点回传,是防止表征坍缩的关键技术 |
| 线性探测 | Linear Probing | 冻结预训练编码器只训练一个线性分类器,用于评估特征质量 |
- SimCLR:Chen et al., “A Simple Framework for Contrastive Learning of Visual Representations”, ICML 2020. 用数据增强 + InfoNCE 损失确立对比学习范式。
- MAE:He et al., “Masked Autoencoders Are Scalable Vision Learners”, CVPR 2022. 把 BERT 式掩码重建搬到视觉,证明了”高掩码率 + ViT”的强大。
- BERT:Devlin et al., “BERT: Pre-training of Deep Bidirectional Transformers”, NAACL 2019. 掩码语言建模预训练的里程碑,自监督在 NLP 的奠基作。
- CLIP:Radford et al., “Learning Transferable Visual Models from Natural Language Supervision”, ICML 2021. 4 亿图文对对比学习,打通语言与视觉。
- MoCo:He et al., “Momentum Contrast for Unsupervised Visual Representation Learning”, CVPR 2020. 动态字典对比学习,视觉自监督的工程突破。
- DINOv2:Oquab et al., “DINOv2: Learning Robust Visual Features without Supervision”, TMLR 2024. 数据和模型规模同时扩展的视觉基础模型。
- I-JEPA:Assran et al., “Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture”, CVPR 2023. JEPA 范式的图像版,LeCun 路线的标志性成果。
- SigLIP:Zhai et al., “Sigmoid Loss for Language Image Pre-Training”, ICCV 2023. 用 sigmoid 代替 softmax 的图文对齐,CLIP 的改进继任者。
- BYOL:Grill et al., “Bootstrap Your Own Latent”, NeurIPS 2020. 不用负样本的自监督,证明 stop-gradient + EMA 即可防止坍缩。
- V-JEPA 2:Bardes et al., “V-JEPA 2: Self-Supervised Video Models for Understanding and Simulation”, Meta AI 2025. 视频自预训练的世界模型,JEPA 在视频域的最新突破。