BERT o cómo leer una frase en ambos sentidos cambió el procesamiento del lenguaje
El truco de tapar palabras al azar y obligar al modelo a adivinarlas parece un juego infantil, pero redefinió todo el NLP durante años. Me interesa como caso de estudio de transferencia: preentrenar una vez, ajustar mil veces. Si quieres entender de dónde viene la mitad del vocabulario técnico actual (fine-tuning, tokens enmascarados), empieza aquí.
Jacob Devlin et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Word2Vec muestra el poder geométrico de embeddings estáticos; BERT enseña cómo el contexto bidireccional y el preentrenamiento enmascarado convierten esos vectores en representaciones polisémicas y transferibles, explicando la evolución práctica desde analogías algebraicas a modelos útiles en tareas reales.»
MIMarco IbáñezRey menos hombre más mujer igual a reina: las palabras se volvieron aritméticaPDF
«Al pasar de CLIP a BERT comprendes que el avance real viene de preentrenar con datos masivos y objetivos simples: contraste imagen‑texto en CLIP vs enmascarado en BERT; así se obtienen representaciones transferibles que facilitan fine‑tuning, multimodalidad y generación.»
MIMarco IbáñezCLIP: enseñar visión a una red con los pies de foto de todo internetPDF
«Word2vec mostró que el significado puede residir en vectores estáticos y permitir analogías lineales; BERT añade representaciones contextuales y aprendizaje bidireccional preentrenado que disambiguan sentidos, capturan sintaxis y se transfieren eficazmente a tareas mediante ajuste fino.»
MIMarco IbáñezWord2vec: cuando descubrimos que rey menos hombre más mujer es reinaPDF