CLIP: enseñar visión a una red con los pies de foto de todo internet
En vez de etiquetar millones de imágenes a mano, OpenAI usó los pares imagen-texto que ya existían en la web y alineó ambos mundos en un espacio común. CLIP es la bisagra silenciosa de la era generativa: sin él no habría DALL-E ni Stable Diffusion tal y como los conocemos. Me gusta como ejemplo de que el dato barato y abundante gana al dato caro y perfecto.
Alec Radford et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Relacionarlos pone en tensión la capacidad de memorizar con la capacidad de generalizar: si las redes pueden aprender etiquetas aleatorias, entonces el éxito de CLIP implica que las captions web aportan estructura estadística útil (no solo supervisión grande), y eso orienta qué señales del dato hay que identificar, medir y curar para lograr representaciones realmente generalizables.»
MIMarco IbáñezLas redes memorizan etiquetas aleatorias sin despeinarse, y eso rompe la teoríaPDF
«Al pasar de CLIP a BERT comprendes que el avance real viene de preentrenar con datos masivos y objetivos simples: contraste imagen‑texto en CLIP vs enmascarado en BERT; así se obtienen representaciones transferibles que facilitan fine‑tuning, multimodalidad y generación.»
MIMarco IbáñezBERT o cómo leer una frase en ambos sentidos cambió el procesamiento del lenguajePDF