25M params
138M params
4M params
5M params
Concept: Use pre-trained model as starting point instead of training from scratch
Benefits: Faster training, needs less data, better performance, proven architectures
Process: Freeze early layers (feature extraction), train final layers on your data
When to use: Limited data, similar domain (e.g., images), want faster results