Mundara
← Volver a la galaxia

Las redes memorizan etiquetas aleatorias sin despeinarse, y eso rompe la teoría

El experimento es demoledor: baraja las etiquetas de ImageNet al azar y la red igualmente memoriza todo el dataset. Entonces, ¿por qué generaliza cuando las etiquetas son reales? Este paper demostró que la teoría clásica del aprendizaje no explica el deep learning, y la pregunta sigue básicamente abierta. Me encanta como recordatorio de cuánto usamos sin entender.

Abrir el original ↗pdf0 visitas · 0 lectores

Chiyuan Zhang et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «Leer A y luego B permite pasar de la observación teórica (las redes pueden memorizarlo todo) a un mecanismo práctico: ResNet muestra cómo hacer entrenables redes muy profundas, lo que sugiere que inductivas arquitectónicas y efectos de optimización, no solo la capacidad, explican la generalización.»

    MIMarco Ibáñez
    El truco de fontanería que permitió apilar cien capas sin que nada se rompieraPDF→
  • «Relacionarlos pone en tensión la capacidad de memorizar con la capacidad de generalizar: si las redes pueden aprender etiquetas aleatorias, entonces el éxito de CLIP implica que las captions web aportan estructura estadística útil (no solo supervisión grande), y eso orienta qué señales del dato hay que identificar, medir y curar para lograr representaciones realmente generalizables.»

    MIMarco Ibáñez
    CLIP: enseñar visión a una red con los pies de foto de todo internetPDF→
  • «Conectar ImageNet con el experimento de etiquetas aleatorias muestra que la misma infraestructura que permitió el triunfo práctico del deep learning también revela su paradoja: si las redes pueden memorizar etiquetas aleatorias, la buena generalización observada en ImageNet exige una explicación teórica, no solo ingeniería.»

    MIMarco Ibáñez
    ImageNet: la base de datos que nadie quería financiar y que encendió el deep learningArtículo→
  • «Conectar ResNet con el experimento de etiquetas aleatorias permite investigar si los atajos residuales —que facilitan la optimización en redes muy profundas— introducen inductive biases o regularizaciones implícitas que evitan el sobreajuste y ayudan a explicar la sorprendente generalización.»

    MIMarco Ibáñez
    ResNet: el truco de sumar la entrada a la salida que permitió redes de mil capasPDF→
InicioGuardadoCuradoresEntrar