ImageNet: la base de datos que nadie quería financiar y que encendió el deep learning
Fei-Fei Li pasó años etiquetando catorce millones de imágenes cuando el consenso era que los datasets grandes no eran investigación seria. En 2012, AlexNet arrasó en su competición y el deep learning dejó de ser marginal en una tarde. Me gusta esta historia porque el héroe no es un algoritmo sino un dataset: la infraestructura aburrida que hace posible la gloria ajena.
Wikipedia
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Conectar ImageNet con el experimento de etiquetas aleatorias muestra que la misma infraestructura que permitió el triunfo práctico del deep learning también revela su paradoja: si las redes pueden memorizar etiquetas aleatorias, la buena generalización observada en ImageNet exige una explicación teórica, no solo ingeniería.»
MIMarco IbáñezLas redes memorizan etiquetas aleatorias sin despeinarse, y eso rompe la teoríaPDF
«Te muestran caras complementarias del mismo motor: QuickDraw enseña cómo la UX y la gamificación permiten recolectar enormes volúmenes de datos rápidamente (con ruido y escala), mientras ImageNet revela cómo la curación paciente y la infraestructura de etiquetado pueden desencadenar revoluciones en modelos.»
MIMarco Ibáñez
El pictionary contra una red neuronal que generó el mayor dataset de garabatosWeb