Mundara
← Volver a la galaxia

CLIP: enseñar visión a una red con los pies de foto de todo internet

En vez de etiquetar millones de imágenes a mano, OpenAI usó los pares imagen-texto que ya existían en la web y alineó ambos mundos en un espacio común. CLIP es la bisagra silenciosa de la era generativa: sin él no habría DALL-E ni Stable Diffusion tal y como los conocemos. Me gusta como ejemplo de que el dato barato y abundante gana al dato caro y perfecto.

Abrir el original ↗pdf0 visitas · 0 lectores

Alec Radford et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «Relacionarlos pone en tensión la capacidad de memorizar con la capacidad de generalizar: si las redes pueden aprender etiquetas aleatorias, entonces el éxito de CLIP implica que las captions web aportan estructura estadística útil (no solo supervisión grande), y eso orienta qué señales del dato hay que identificar, medir y curar para lograr representaciones realmente generalizables.»

    MIMarco Ibáñez
    Las redes memorizan etiquetas aleatorias sin despeinarse, y eso rompe la teoríaPDF→
  • «Al pasar de CLIP a BERT comprendes que el avance real viene de preentrenar con datos masivos y objetivos simples: contraste imagen‑texto en CLIP vs enmascarado en BERT; así se obtienen representaciones transferibles que facilitan fine‑tuning, multimodalidad y generación.»

    MIMarco Ibáñez
    BERT o cómo leer una frase en ambos sentidos cambió el procesamiento del lenguajePDF→
InicioGuardadoCuradoresEntrar