头版Folia Daily Briefing
← 返回头版
科技人工智能

LeCun团队提出VISReg方法,破解自监督学习表征坍塌难题

LeCun团队推出的自监督学习新方法VISReg通过将表征正则项解耦为尺度与形状两个独立目标,成功攻克了JEPA世界模型的表征坍塌核心问题[1]。该方法无需采用任何启发式训练技巧,在15个数据集上的综合表现超越MoCoV3、DINO、iBOT、I-JEPA、MAE、data2vec等主流自监督学习方法[1]。

在具体性能指标上,VISReg展现了显著优势[1]。ViT-B/16模型在域内线性探测精度达到75.7%,超过MAE的75.1%;ViT-L/14进一步提升至77.0%,超过LeJEPA的75.6%[1]。在分布外泛化能力方面,ViT-B/16的VISReg在6个分布外数据集上平均精度为70.19%,ViT-L/14为70.63%[1]。更引人瞩目的是,VISReg在ImageNet-22K上预训练后,分布外平均精度达72.94%,与用10倍数据规模(LVD-142M)训练的DINOv2基本持平[1]。在ADE20K线性语义分割任务上,ViT-B/16的mIoU达到30.16,也高于DINO的29.40和MAE的23.60[1]。

Yann LeCun对该研究成果进行了转发评价[1]。从算法层面看,VISReg的正则部分计算复杂度为O(NBK),对所有扩展因子都是线性的[1]。


VISReg自监督学习表征坍塌Yann LeCunJEPA世界模型