DINOv2: How self-supervised visual features transfer across tasks
A practical guide to "DINOv2: Learning Robust Visual Features without Supervision"
DINOv2 trains Vision Transformer encoders on 142 million curated images without using labels or captions in its pretraining objective. This guide explains how image-level self-distillation, masked patch prediction, feature-spreading regularization, data curation, and distillation combine to produce features that transfer across classification, retrieval, segmentation, and depth estimation.
more ...
Michał Chromiak's blog