El post sobre LSTMs que enseñó a explicar deep learning a toda una generación
Aunque las LSTM ya sean historia, este ensayo sigue siendo el patrón oro de la explicación técnica: cada diagrama está pensado para responder una confusión concreta. Miles de personas entendieron aquí por primera vez cómo una red gestiona memoria. Lo guardo como ejemplo de escritura pedagógica más que como referencia de arquitectura; en eso es intemporal.
Christopher Olah · Blog de Chris Olah
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Saltar de Karpathy a la guía de LSTM convierte el asombro empírico sobre lo que hacen RNNs minúsculos en explicación causal: la pieza sobre LSTM muestra cómo puertas y gestión de memoria permiten (y limitan) esas generaciones y estabilizan el aprendizaje.»
MIMarco IbáñezEl ensayo de 2015 que anticipó, con RNNs de juguete, todo lo que vendría despuésArtículo
«Partir de la claridad sobre cómo las LSTM gestionan memoria mediante puertas y celdas te da el trasfondo necesario para apreciar que el post del Transformer sustituye esa memoria secuencial por enrutamiento dinámico (Q/K/V y pesos de atención), explicando por qué la atención permite paralelismo y mejor escalado.»
MIMarco IbáñezEl Transformer dibujado paso a paso: la explicación que el paper nunca dioArtículo