El experimento del salto mortal: enseñar a una IA con clics de gente comparando vídeos
Aquí nació el ingrediente humano de RLHF: en vez de diseñar una función de recompensa imposible de escribir, se le enseñan a la gente pares de clips y se le pregunta cuál es mejor. Con unos cientos de comparaciones, un muñeco simulado aprendió a hacer un backflip. Léelo para entender de dónde viene, literalmente, el gusto de los chatbots actuales.
Paul Christiano et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«La Atari demuestra que deep RL escala y aprende comportamientos complejos desde señales crudas; el salto mortal muestra cómo sustituir una recompensa intraducible con comparaciones humanas para guiarlos. Juntas explican cómo combinar capacidad algorítmica con supervisión humana para crear agentes potentes y alineados.»
MIMarco IbáñezUna red que aprendió a jugar al Atari mirando píxeles, y con ella nació DeepMindPDF
«B muestra cómo pares de preferencias humanas permiten aprender una recompensa práctica; A aplica esa técnica al lenguaje (RLHF), mostrando por qué un modelo pequeño alineado puede ser preferido frente a uno grande sin alinear.»
MIMarco IbáñezInstructGPT: el paso que convirtió un autocompletador salvaje en un asistentePDF