InstructGPT: el paso que convirtió un autocompletador salvaje en un asistente
Entre GPT-3 y ChatGPT hay exactamente este paper: afinar el modelo con preferencias humanas hasta que obedece instrucciones en vez de continuar texto. El dato que siempre cito: el modelo pequeño alineado gustaba más que el gigante sin alinear. Lectura obligada para entender qué es RLHF y por qué el tono de los chatbots es como es.
Long Ouyang et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«B muestra cómo pares de preferencias humanas permiten aprender una recompensa práctica; A aplica esa técnica al lenguaje (RLHF), mostrando por qué un modelo pequeño alineado puede ser preferido frente a uno grande sin alinear.»
MIMarco IbáñezEl experimento del salto mortal: enseñar a una IA con clics de gente comparando vídeosPDF
«De A aprendes a medir preferencias humanas de forma robusta y anónima (comparaciones por pares + Elo); de B ves cómo usar exactamente esas preferencias para afinar modelos con RLHF y convertir autocompletadores en asistentes que obedecen instrucciones.»
MIMarco Ibáñez
El ranking de modelos que funciona a ciegas: dos respuestas y tú eliges la mejorWeb