Toda la familia de mecanismos de atención, ordenada de una vez por todas
Antes de que la atención fuera omnipresente, Weng ya había catalogado todas sus variantes —aditiva, multiplicativa, self-attention, soft y hard— con las fórmulas y la genealogía de cada una. Es el post al que vuelvo cuando algún paper usa un término de atención con ligereza y necesito saber exactamente de cuál habla. Referencia de consulta más que lectura de sofá, y ahí es insuperable.
Lilian Weng · Lil'Log
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Saltar de A a B ancla la taxonomía técnica de atenciones en su origen práctico: verás cómo la atención nació para evitar comprimir secuencias largas en un vector y por qué surgieron variantes (aditiva, multiplicativa, soft/hard, self) como respuestas a ese problema concreto.»
MIMarco IbáñezDonde se inventó de verdad la atención, tres años antes del TransformerPDF
«Permite traducir la taxonomía formal de Weng (additiva/multiplicativa, self, soft/hard y sus fórmulas) a la implementación visual y paso a paso de Alammar, de modo que identifiques qué variante aparece en las matrices Q/K/V y cómo cambia el flujo y resultado en un Transformer.»
MIMarco IbáñezEl Transformer dibujado paso a paso: la explicación que el paper nunca dioArtículo