Las redes memorizan etiquetas aleatorias sin despeinarse, y eso rompe la teoría
El experimento es demoledor: baraja las etiquetas de ImageNet al azar y la red igualmente memoriza todo el dataset. Entonces, ¿por qué generaliza cuando las etiquetas son reales? Este paper demostró que la teoría clásica del aprendizaje no explica el deep learning, y la pregunta sigue básicamente abierta. Me encanta como recordatorio de cuánto usamos sin entender.
Chiyuan Zhang et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Leer A y luego B permite pasar de la observación teórica (las redes pueden memorizarlo todo) a un mecanismo práctico: ResNet muestra cómo hacer entrenables redes muy profundas, lo que sugiere que inductivas arquitectónicas y efectos de optimización, no solo la capacidad, explican la generalización.»
MIMarco IbáñezEl truco de fontanería que permitió apilar cien capas sin que nada se rompieraPDF
«Relacionarlos pone en tensión la capacidad de memorizar con la capacidad de generalizar: si las redes pueden aprender etiquetas aleatorias, entonces el éxito de CLIP implica que las captions web aportan estructura estadística útil (no solo supervisión grande), y eso orienta qué señales del dato hay que identificar, medir y curar para lograr representaciones realmente generalizables.»
MIMarco IbáñezCLIP: enseñar visión a una red con los pies de foto de todo internetPDF
«Conectar ImageNet con el experimento de etiquetas aleatorias muestra que la misma infraestructura que permitió el triunfo práctico del deep learning también revela su paradoja: si las redes pueden memorizar etiquetas aleatorias, la buena generalización observada en ImageNet exige una explicación teórica, no solo ingeniería.»
MIMarco IbáñezImageNet: la base de datos que nadie quería financiar y que encendió el deep learningArtículo
«Conectar ResNet con el experimento de etiquetas aleatorias permite investigar si los atajos residuales —que facilitan la optimización en redes muy profundas— introducen inductive biases o regularizaciones implícitas que evitan el sobreajuste y ayudan a explicar la sorprendente generalización.»
MIMarco IbáñezResNet: el truco de sumar la entrada a la salida que permitió redes de mil capasPDF