Mundara
← Volver a la galaxia

Toda la familia de mecanismos de atención, ordenada de una vez por todas

Antes de que la atención fuera omnipresente, Weng ya había catalogado todas sus variantes —aditiva, multiplicativa, self-attention, soft y hard— con las fórmulas y la genealogía de cada una. Es el post al que vuelvo cuando algún paper usa un término de atención con ligereza y necesito saber exactamente de cuál habla. Referencia de consulta más que lectura de sofá, y ahí es insuperable.

Abrir el original ↗articulo0 visitas · 0 lectores

Lilian Weng · Lil'Log

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «Saltar de A a B ancla la taxonomía técnica de atenciones en su origen práctico: verás cómo la atención nació para evitar comprimir secuencias largas en un vector y por qué surgieron variantes (aditiva, multiplicativa, soft/hard, self) como respuestas a ese problema concreto.»

    MIMarco Ibáñez
    Donde se inventó de verdad la atención, tres años antes del TransformerPDF→
  • «Permite traducir la taxonomía formal de Weng (additiva/multiplicativa, self, soft/hard y sus fórmulas) a la implementación visual y paso a paso de Alammar, de modo que identifiques qué variante aparece en las matrices Q/K/V y cómo cambia el flujo y resultado en un Transformer.»

    MIMarco Ibáñez
    El Transformer dibujado paso a paso: la explicación que el paper nunca dioArtículo→
InicioGuardadoCuradoresEntrar