Skip to content

自监督学习

本页介绍深度学习近十年最重要的范式变革——自监督学习(Self-Supervised Learning, SSL):让模型从无标注数据中自己构造学习信号,摆脱对人工标注的依赖。它是 BERT、GPT、CLIP 等现代预训练模型的共同基石,也是深度学习概览到生成式 AI 演进的关键桥梁。

自监督学习的核心是——让学生自己出题、自己做题:

传统监督学习需要人工标注:“这张图是猫""这句话是正面情感”。标注成本极高,互联网上的海量数据(文本、图片、视频)绝大多数是无标注的。自监督学习巧妙地从数据本身构造”题目”:

  • 掩码预测(Masking)= 完形填空:把句子里 15% 的词挡住,让模型猜——挡住的词就是”天然答案”。这就是 BERT 的核心思想。图像领域同理:把图片大部分打码,让模型重建(MAE)。
  • 预测下一词(Next Token)= 续写:给前半句,让模型预测下一个词——这几乎是所有 GPT 系大模型的预训练目标。看似简单,但模型要”续写得好”,就必须理解语法、事实、推理。
  • 对比学习(Contrastive)= 找同类、排异类:对同一张图做两次不同数据增强(裁剪、翻转、变色),得到两个”视角”——它们是正样本对(应该相似);不同图之间是负样本对(应该远)。模型学会”同一物体的不同样子应该特征相近”。SimCLR、MoCo、CLIP 都是这一路线。
  • 联合嵌入预测(Joint-Embedding Predictive, JEPA)= 在抽象空间预测:不做像素级重建,也不做对比,而是让模型在特征空间中预测”被遮挡部分的表征”。这是 Yann LeCun(图灵奖得主)力推的新路线——I-JEPA(图像)和 V-JEPA 2(视频)代表了 2024-2025 年最前沿的方向,避免了像素重建的浪费和对比学习对大批负样本的依赖。

自监督的魔力在于:互联网有无限的无标注数据。一旦解决了”自己出题”,模型就能在几乎所有数据上学习——这正是 GPT 和 BERT 能做到”大数据涌现智能”的前提。

自监督方法按”题目类型”分为三大谱系,它们在架构设计、损失函数、训练稳定性上各有特点:

1. 对比学习(Contrastive Learning)

核心思想是”拉近正样本、推远负样本”。以 SimCLR 为例,训练流程为:

  1. 取一张图 x,施加两次随机数据增强(随机裁剪到 224×224、色彩抖动、高斯模糊),得到两个”视角” x₁、x₂。
  2. 两个视角分别过同一个编码器 f(·)(通常是 ResNet 或 ViT),得到特征向量 h₁、h₂。
  3. 特征再过一个投影头 g(·)(两层 MLP),得到嵌入向量 z₁、z₂——投影头只在训练时用,推理时丢弃。
  4. 一个 mini-batch(batch size = N)产生 2N 个嵌入,其中同一张图的两个嵌入为正样本对,其余 2(N-1) 个为负样本。
  5. 计算 InfoNCE 损失,让正样本对的余弦相似度远大于负样本对。

InfoNCE 损失的数学形式(纯文本表达):

L(i,j)=−log⁡exp⁡(sim(zi,zj)/τ)∑kexp⁡(sim(zi,zk)/τ)L(i,j) = -\log \frac{\exp(\text{sim}(z_i, z_j) / \tau)}{\sum_k \exp(\text{sim}(z_i, z_k) / \tau)}

其中:

  • sim(a,b)=a⋅b∥a∥×∥b∥\text{sim}(a, b) = \frac{a \cdot b}{\|a\| \times \|b\|}(余弦相似度,衡量两个向量方向的一致性)
  • τ\tau:温度系数(temperature),通常 0.1∼0.50.1 \sim 0.5
  • ∑k\sum_k 遍历 batch 中所有其他样本(负样本)
  • exp⁡(⋅)\exp(\cdot) 是指数函数 exe^x

直觉理解:这就是一个 softmax 分类——把”从一堆候选中找出正样本”当作 N-1 分类问题,正确配对的概率应该最大。温度系数 τ 控制分布的”尖锐度”:τ 越小,模型越关注最难的负样本。

对比学习的核心挑战是负样本数量:负样本越多,学到的表征越好,但 batch size 受显存限制。MoCo 用”动态字典”(维护一个缓慢更新的特征队列)巧妙地解耦了 batch size 和负样本数——即使 batch size 只有 256,也能用到 65536 个负样本。

2. 掩码预测(Masked Modeling)

核心思想是”遮挡再重建”。以 MAE(Masked Autoencoder)为例:

  1. 把输入图像分成 16×16 的 patch(小块),随机遮挡 75% 的 patch——这个极高的掩码率是关键创新。
  2. 编码器(ViT)只处理可见的 25% patch——这大幅减少了计算量。
  3. 被遮挡位置加入一个共享的掩码 token(mask embedding,一个可学习的向量),加上位置编码后送入解码器。
  4. 解码器重建被遮挡 patch 的原始像素值。
  5. 损失函数是 MSE(均方误差),只在被遮挡位置计算:
LMAE=1∣M∣∑p∈M(x^p−xp)2L_{\text{MAE}} = \frac{1}{|M|} \sum_{p \in M} (\hat{x}_p - x_p)^2

其中 MM 是被遮挡的 patch 集合,∣M∣|M| 是其数量。

MAE 的关键洞察:图像的信息冗余度远高于文本——一张图大部分像素可以从邻居推断,所以 75% 掩码率不仅可行,还能迫使编码器理解全局结构而非记忆局部。相比之下,BERT 掩码率只有 15%,因为文本信息密度高。

3. 联合嵌入预测架构(JEPA)

这是 LeCun 提出的自监督新范式,核心区别在于预测发生在特征空间而非像素空间:

  1. 将图像分为可见区域(context)和遮挡区域(target)。
  2. 用上下文编码器处理可见区域,得到上下文表征 sₓ。
  3. 用目标编码器(参数是上下文编码器的指数移动平均 EMA)处理完整图像,得到目标表征 sᵧ。
  4. 用一个轻量级预测器网络,根据 sₓ 和”目标位置编码”来预测 sᵧ。
  5. 损失是预测表征与目标表征之间的 L2 距离:
LJEPA=∥predictor(sx,postarget)−sg(sy)∥2L_{\text{JEPA}} = \|\text{predictor}(s_x, \text{pos}_{\text{target}}) - \text{sg}(s_y)\|^2

其中 sg(⋅)\text{sg}(\cdot) 表示 stop-gradient(停止梯度),防止模型坍缩到平凡解。

JEPA 的优势:不浪费算力在像素重建上(像素级细节往往不重要),也不需要大量负样本(对比学习的痛点)。I-JEPA(Meta, 2023)在 ImageNet 上超越了 MAE 和对比方法;V-JEPA 2(Meta, 2025)将此范式扩展到视频,并在理解和生成任务上展现出强大潜力。

自监督方法的编码器经历了从 CNN 到 Vision Transformer 的迁移:

  • CNN 时代(2019-2021):SimCLR、MoCo v1/v2 用 ResNet-50 作为编码器,输出 2048 维全局特征。CNN 的平移不变性天然适合对比学习。
  • ViT 时代(2021 至今):MAE、DINOv2、I-JEPA 全面转向 Vision Transformer。ViT 的 patch 级处理更适合掩码预测(直接遮挡 patch),且全局注意力使特征质量更高。
  • ViT 架构要点:输入图像 224×224 → 切分为 14×14 个 16×16 的 patch → 每个 patch 线性映射为 D 维向量 → 加入位置编码 → 过 L 层 Transformer encoder(多头自注意力 + MLP)。输出为 [CLS] token 或全局平均池化后的 D 维向量。

自监督学习(尤其是非对比方法)面临一个核心难题——表征坍缩(Representation Collapse):如果所有输入都映射到同一个特征向量,损失可能为零,但学到的表征毫无意义。解决方案包括:

  • 对比学习中的负样本:负样本天然阻止坍缩——所有图不能映射到同一点。
  • BYOL 的 stop-gradient + EMA target encoder:BYOL(Bootstrap Your Own Latent)不用负样本,而是用”在线网络”预测”目标网络”的输出,目标网络的参数是在线网络的 EMA。stop-gradient 阻止梯度回传到目标网络,加上 EMA 的缓慢更新,阻止了坍缩。
  • SimSiam 的 stop-gradient:SimSiam 进一步证明,仅靠 stop-gradient 和批量归一化(BatchNorm 隐式引入了负样本信息)就能防止坍缩。
  • DINO/ViT 中的 centering + sharpening:DINO 在教师-学生蒸馏框架中,通过对教师输出做 centering(减去滑动平均)和 sharpening(降低温度),防止输出分布退化。

自监督训练远比监督训练”娇贵”,以下实践经验至关重要:

数据增强策略(对比学习专用)

Section titled “数据增强策略(对比学习专用)”

对比学习对数据增强极度敏感。SimCLR 的消融实验表明,随机裁剪 + 色彩抖动(color jittering) 是最有效的增强组合。具体来说:

  • 随机裁剪:从原图中随机裁取 8%~100% 面积的区域,再 resize 到 224×224。这是最关键的增强。
  • 色彩抖动:随机改变亮度(±0.4)、对比度(±0.4)、饱和度(±0.4)、色相(±0.1)。之所以如此重要,是因为如果不加色彩抖动,模型容易走捷径——靠颜色直方图区分不同图像,而非学到语义特征。
  • 高斯模糊:以 50% 概率施加,核大小取决于分辨率。对 ImageNet 帮助较大。
  • MAE 和 JEPA 则不需要强增强——因为它们的题目(掩码/遮挡)本身就是挑战,数据增强反而引入噪声。

InfoNCE 损失中的温度系数 τ 是对比学习最关键的超参数:

  • τ 太大(如 1.0):损失对困难负样本不够敏感,学到的特征区分度低。
  • τ 太小(如 0.01):梯度集中在极少数最难的负样本上,训练不稳定。
  • 推荐值:SimCLR 用 0.5,MoCo 用 0.07,DINO 用 0.04(学生)/ 0.040.1(教师)。一般从 0.10.2 起调。

对比学习对 batch size 非常敏感——更大的 batch 意味着更多负样本,特征质量更高。SimCLR 原论文用了 batch size = 4096(8×128 张 TPU),这在实际中很难复制。MoCo 的动态队列设计就是为了让小 batch size 也能用到大量负样本。

掩码预测(MAE)对 batch size 不敏感(因为不需要负样本),但对训练轮次要求高——MAE 通常预训练 1600 个 epoch(是监督训练的 4~8 倍),才能充分学习。

BYOL、MoCo、DINO、I-JEPA 都使用 EMA(Exponential Moving Average,指数移动平均)目标编码器。EMA 的动量系数 m 控制”教师网络”跟随”学生网络”的速度:

θtarget←m×θtarget+(1−m)×θonline\theta_{\text{target}} \leftarrow m \times \theta_{\text{target}} + (1 - m) \times \theta_{\text{online}}

mm 通常取 0.99∼0.9990.99 \sim 0.999(越接近 1,教师更新越慢)。

MoCo 用 m=0.999,BYOL 用 m=0.99,DINO 在训练过程中从 0.996 线性退火到 1.0。太快的更新(小 m)会导致训练不稳定,太慢的更新(大 m)会导致学到的特征滞后。

SimCLR 发现:编码器输出的特征(h)经过两层 MLP 的”投影头”后再计算对比损失,效果远好于直接在 h 上计算。原因是投影头让对比损失只”指导”特征空间的变化方向,而不破坏编码器学到的通用信息。推理时只用编码器输出 h,丢弃投影头——h 是迁移到下游任务的最终特征。

自监督 ViT 训练比 CNN 更难稳定。关键技术:

  • LayerNorm 代替 BatchNorm:ViT 中 BatchNorm 在大 batch 和小 batch 间表现差异大,LayerNorm 更稳定。
  • 余弦学习率退火(Cosine Annealing):学习率从初始值按余弦曲线缓慢降到接近 0,最后做一段很小的恒定学习率(DINO 称之为 “teacher temperature warmup”)。
  • 随机深度(Stochastic Depth):训练时以一定概率跳过某些 Transformer 层,相当于对网络的深度做正则化,防止过拟合。
import torch
import torch.nn as nn
import torch.nn.functional as F
class SimCLRLoss(nn.Module):
"""SimCLR 的 InfoNCE 损失:同一样例两视角应相似"""
def __init__(self, temperature=0.5):
super().__init__()
self.temperature = temperature
def forward(self, z1, z2):
batch_size = z1.size(0)
# L2 归一化:使点积 = 余弦相似度
z1 = F.normalize(z1, dim=1)
z2 = F.normalize(z2, dim=1)
# 拼接所有 2N 个嵌入
z = torch.cat([z1, z2], dim=0) # [2N, D]
# 计算所有 pair 的相似度矩阵 [2N, 2N]
sim = torch.mm(z, z.T) / self.temperature
# 对角线(自己和自己)的相似度设为极小值,排除
sim.fill_diagonal_(-1e9)
# 正样本的索引:z_i 的正样本是 z_{i+N},反之亦然
labels = torch.cat([
torch.arange(batch_size, 2 * batch_size), # z1[i] 的正样本是 z2[i]
torch.arange(0, batch_size) # z2[i] 的正样本是 z1[i]
], dim=0).to(z.device)
# 交叉熵:让正样本对的相似度得分最高
return F.cross_entropy(sim, labels)
# 使用示例
# encoder = resnet50() # 编码器:ResNet-50
# projection = nn.Sequential( # 投影头:2 层 MLP
# nn.Linear(2048, 512), nn.ReLU(), nn.Linear(512, 128)
# )
# criterion = SimCLRLoss(temperature=0.5)
# z1 = projection(encoder(aug1(images))) # 视角 1
# z2 = projection(encoder(aug2(images))) # 视角 2
# loss = criterion(z1, z2)
# loss.backward()
import torch
import torch.nn as nn
class MAE(nn.Module):
"""MAE 简化版:掩码 → 编码可见 patch → 解码重建"""
def __init__(self, encoder, decoder_dim=512, mask_ratio=0.75):
super().__init__()
self.encoder = encoder # ViT 编码器
self.mask_ratio = mask_ratio
# 解码器:比编码器浅得多(如 4 层 Transformer vs 24 层编码器)
self.decoder = nn.TransformerEncoder(
nn.TransformerEncoderLayer(d_model=decoder_dim, nhead=8),
num_layers=4
)
self.mask_token = nn.Parameter(torch.zeros(1, 1, decoder_dim)) # 可学习的掩码 token
self.decoder_pos_embed = nn.Parameter(...) # 位置编码
def patchify(self, imgs, patch_size=16):
"""将 [B, 3, H, W] 切分为 [B, num_patches, patch_size²×3]"""
# 例如 224×224 图像 → 196 个 patch,每个 patch 展开为 768 维向量
...
def forward(self, imgs):
patches = self.patchify(imgs) # [B, N, D]
B, N, D = patches.shape
# 随机选择 mask_ratio 的 patch 遮挡
num_masked = int(N * self.mask_ratio)
shuffle = torch.rand(B, N).argsort()
mask_idx = shuffle[:, :num_masked]
keep_idx = shuffle[:, num_masked:]
# 编码器只处理可见 patch(省 75% 算力)
visible = patches[torch.arange(B)[:, None], keep_idx]
encoded = self.encoder(visible) # [B, N_keep, D]
# 解码器:把 mask token 插入被遮挡位置,过解码器
mask_tokens = self.mask_token.expand(B, num_masked, -1)
full_tokens = torch.cat([encoded, mask_tokens], dim=1)
decoded = self.decoder(full_tokens)
# 只在遮挡位置计算 MSE 损失
pred = decoded[:, -num_masked:] # 预测的被遮挡 patch
target = patches[torch.arange(B)[:, None], mask_idx]
loss = ((pred - target) ** 2).mean()
return loss
from transformers import pipeline
# BERT 做完形填空(预训练任务直接体验)
unmasker = pipeline("fill-mask", model="bert-base-chinese")
for r in unmasker("北京是[MASK]国的首都。"):
print(f"{r['token_str']}: {r['score']:.2%}")
# 输出: 中: 99.2% (模型"猜"出了被遮挡的词)

自监督学习在 2024-2025 年经历了深刻的技术范式更迭,以下是最重要的进展:

JEPA 路线崛起:从像素重建到特征预测

Section titled “JEPA 路线崛起:从像素重建到特征预测”

Meta 首席 AI 科学家 Yann LeCun 长期批评像素级重建(如 MAE)“浪费算力在不重要的细节上”。他提出的 JEPA(Joint-Embedding Predictive Architecture) 范式在 2023-2025 年快速成熟:

  • I-JEPA(2023):图像版 JEPA,在不依赖负样本和像素重建的前提下,在 ImageNet linear probing 上超越了 MAE 和 iBOT。它用 EMA 目标编码器和 stop-gradient 避免坍缩,用宽而浅的 ViT 作为编码器。
  • V-JEPA 2(2025):视频版 JEPA,在海量视频上自监督预训练后,可以作为世界模型(World Model)——理解物理世界的时间因果关系(如”球从桌面掉落会怎样”),对机器人规划和视频理解有重要意义。V-JEPA 2 在多个视频理解基准上达到了 SOTA(State of the Art,当前最优),且不需要任何标注视频。

Meta 的 DINOv2(2023)将对比学习(iBOT)和自蒸馏(DINO)融合,在 1.42 亿张图像上训练 ViT(最大 ViT-g,10 亿参数),产出的通用特征可以直接用于分类、分割、深度估计、检索——不需要微调,线性探测就能接近全监督水平。DINOv2 已成为许多视觉任务的默认特征提取器。

2024-2025 年,DINOv3 系列在更大规模、更高质量的数据上进一步扩展,特征质量持续提升,尤其在细粒度识别和医学影像迁移上表现突出。

Google 的 SigLIP(Sigmoid Loss for Language Image Pre-training, 2023)改进了 CLIP 的训练方式:用 sigmoid 损失 代替对比学习的 softmax 损失,不再需要全局 batch 内的 softmax 归一化。这意味着:

  • 训练可以更容易地扩展到超大 batch size。
  • 对负样本的需求降低,训练更稳定。
  • SigLIP 2 系列(2024-2025)在图文检索、零样本分类、VLM(视觉语言模型)的视觉编码器等场景中,正在取代原始 CLIP 成为新的默认选择。
  • VideoMAE V2(2023-2024):把 MAE 的高掩码率策略(90% 以上)成功扩展到视频,证明了视频的信息冗余度比图像更高。
  • V-JEPA 2(2025):如前所述,将 JEPA 推广到视频域并展现出世界模型能力。
  • 音频自监督:HuBERT、wav2vec 2.0 等在无标注语音上做掩码预测,学习通用声学表征,是 Whisper 等语音识别模型的隐含先驱。
  • 多模态对齐:ImageBind(Meta)尝试用一个编码器对齐 6 种模态(图像、文本、音频、深度、热成像、 IMU),核心思想仍是对比学习。

2024-2025 年的研究(如 Meta 的 scaling laws for SSL)表明,自监督学习也有类似 LLM 的 scaling law——模型参数量、数据量、计算量三者同步增长时,下游任务性能可预测地提升。这意味着自监督的”天花板”远未触达,更大的 ViT 和更多的无标注数据仍将持续带来收益。

  • ImageNet 预训练(SimCLR / MoCo / MAE / DINOv2):先用自监督在海量无标注图像上学到通用特征,再用少量标注数据微调,就能达到甚至超过全监督训练的效果——Meta 的 DINOv2、MAE 是计算机视觉研究的新基座。
  • BERT 语言模型预训练:Google 的 BERT 在整个维基百科 + BookCorpus 上做掩码语言建模预训练,仅加一个分类头就能横扫 11 项 NLP 基准——自监督彻底改变了 NLP 的训练范式。
  • GPT 系列预训练:OpenAI 的 GPT-2/3/4 以”预测下一词”为预训练目标,在海量互联网文本上训练,涌现出指令遵循、推理、代码生成等能力——这就是大语言模型的根技术。
  • CLIP / SigLIP 图文对齐:OpenAI 的 CLIP 用 4 亿图文对做对比学习(文本与对应图像拉近),实现零样本图像分类——也是 DALL-E、Stable Diffusion 等生成模型的文本编码器。SigLIP 正在取代 CLIP 成为新一代视觉语言模型的标准视觉编码器。
  • 医学图像预训练:医学影像标注需专家、成本极高,自监督(如 MoCo-CXR)能在无标注胸片上学到通用表征,用极少标注即可训练高质量疾病检测模型。
  • 视频理解与世界模型:V-JEPA 2 在无标注视频上学习物理世界的因果关系,为机器人操作、自动驾驶的仿真预测提供基础。
类库语言说明
HuggingFace TransformersPython提供 BERT/GPT/CLIP/SigLIP 等主流预训练模型与训练/微调工具
timmPythonPyTorch 图像模型库,收录大量预训练 CNN/ViT(含 DINOv2 等自监督权重)
solo-learnPython专注自监督对比学习的开源库,集成 SimCLR/MoCo/BYOL/DINO 等
DINOv2 / DINOv3 (Meta)PythonMeta 开源的视觉自监督大模型,特征质量极高,可直接用于下游任务
fairseqPythonMeta 的序列建模工具库,早期自监督 NLP(如 RoBERTa、HuBERT)的核心实验平台
I-JEPA / V-JEPA (Meta)PythonJEPA 范式的官方实现,代表了自监督的前沿方向
术语英文解释
自监督学习Self-Supervised Learning从无标注数据中构造代理任务自动生成监督信号的学习范式
对比学习Contrastive Learning拉近正样本对、推远负样本对的特征学习方法
正样本对Positive Pair应该在特征空间中相近的样本对(如同图的两个增强视角)
负样本Negative Sample在对比学习中不应该相似的样本,用于防止特征坍缩
InfoNCE 损失InfoNCE Loss对比学习核心损失函数,基于 softmax 把正样本与负样本区分
温度系数Temperature (τ)InfoNCE 中控制分布尖锐度的超参数,越小越关注困难负样本
掩码语言建模Masked Language Modeling (MLM)随机遮挡部分 token 让模型预测,BERT 的预训练任务
掩码图像建模Masked Image Modeling (MIM)遮挡图像区块让模型重建,MAE 的预训练任务
代理任务Pretext Task为自监督设计的辅助任务(如遮挡/旋转预测),本身不是最终目标
预训练表征Pretrained Representation自监督阶段学到的通用特征,可迁移到下游任务微调
表征坍缩Representation Collapse所有输入映射到同一特征向量的退化现象,是非对比自监督的核心风险
投影头Projection Head对比学习中编码器之后的两层 MLP,仅在训练时使用,推理时丢弃
动量编码器Momentum Encoder参数通过 EMA(指数移动平均)缓慢更新的编码器,用于提供稳定的训练目标
联合嵌入预测Joint-Embedding Predictive Arch. (JEPA)在特征空间预测遮挡区域表征的自监督范式,不需要像素重建或负样本
指数移动平均EMA (Exponential Moving Average)θ_target ← m × θ_target + (1-m) × θ_online,使目标网络缓慢跟随在线网络
停止梯度Stop-Gradient阻止梯度从某一节点回传,是防止表征坍缩的关键技术
线性探测Linear Probing冻结预训练编码器只训练一个线性分类器,用于评估特征质量
  • SimCLR:Chen et al., “A Simple Framework for Contrastive Learning of Visual Representations”, ICML 2020. 用数据增强 + InfoNCE 损失确立对比学习范式。
  • MAE:He et al., “Masked Autoencoders Are Scalable Vision Learners”, CVPR 2022. 把 BERT 式掩码重建搬到视觉,证明了”高掩码率 + ViT”的强大。
  • BERT:Devlin et al., “BERT: Pre-training of Deep Bidirectional Transformers”, NAACL 2019. 掩码语言建模预训练的里程碑,自监督在 NLP 的奠基作。
  • CLIP:Radford et al., “Learning Transferable Visual Models from Natural Language Supervision”, ICML 2021. 4 亿图文对对比学习,打通语言与视觉。
  • MoCo:He et al., “Momentum Contrast for Unsupervised Visual Representation Learning”, CVPR 2020. 动态字典对比学习,视觉自监督的工程突破。
  • DINOv2:Oquab et al., “DINOv2: Learning Robust Visual Features without Supervision”, TMLR 2024. 数据和模型规模同时扩展的视觉基础模型。
  • I-JEPA:Assran et al., “Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture”, CVPR 2023. JEPA 范式的图像版,LeCun 路线的标志性成果。
  • SigLIP:Zhai et al., “Sigmoid Loss for Language Image Pre-Training”, ICCV 2023. 用 sigmoid 代替 softmax 的图文对齐,CLIP 的改进继任者。
  • BYOL:Grill et al., “Bootstrap Your Own Latent”, NeurIPS 2020. 不用负样本的自监督,证明 stop-gradient + EMA 即可防止坍缩。
  • V-JEPA 2:Bardes et al., “V-JEPA 2: Self-Supervised Video Models for Understanding and Simulation”, Meta AI 2025. 视频自预训练的世界模型,JEPA 在视频域的最新突破。