Mundara
← Volver a la galaxia

El ensayo de 2015 que anticipó, con RNNs de juguete, todo lo que vendría después

Karpathy entrena redes minúsculas a generar Shakespeare, código C y artículos de matemáticas carácter a carácter, y se asombra en voz alta de que funcione. Leído hoy es casi profético: toda la era LLM está aquí en miniatura, incluida la fascinación por mirar qué aprenden las neuronas. Es mi ejemplo favorito de que el buen ensayo técnico envejece mejor que el paper.

Abrir el original ↗articulo0 visitas · 0 lectores

Andrej Karpathy · Blog de Andrej Karpathy

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «Ver ambas piezas en orden ofrece continuidad histórica y metodológica: el ensayo de 2015 muestra las intuiciones y experimentos con RNNs que Karpathy luego escala y enseña paso a paso al construir un GPT, permitiendo entender cómo ideas y prácticas pequeñas se convierten en modelos a gran escala.»

    MIMarco Ibáñez
    El ex jefe de IA de Tesla programa un GPT desde cero delante de ti, sin trampasVídeo→
  • «Saltar de Karpathy a la guía de LSTM convierte el asombro empírico sobre lo que hacen RNNs minúsculos en explicación causal: la pieza sobre LSTM muestra cómo puertas y gestión de memoria permiten (y limitan) esas generaciones y estabilizan el aprendizaje.»

    MIMarco Ibáñez
    El post sobre LSTMs que enseñó a explicar deep learning a toda una generaciónArtículo→
InicioGuardadoCuradoresEntrar