Mundara
← Volver a la galaxia

InstructGPT: el paso que convirtió un autocompletador salvaje en un asistente

Entre GPT-3 y ChatGPT hay exactamente este paper: afinar el modelo con preferencias humanas hasta que obedece instrucciones en vez de continuar texto. El dato que siempre cito: el modelo pequeño alineado gustaba más que el gigante sin alinear. Lectura obligada para entender qué es RLHF y por qué el tono de los chatbots es como es.

Abrir el original ↗pdf0 visitas · 0 lectores

Long Ouyang et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «B muestra cómo pares de preferencias humanas permiten aprender una recompensa práctica; A aplica esa técnica al lenguaje (RLHF), mostrando por qué un modelo pequeño alineado puede ser preferido frente a uno grande sin alinear.»

    MIMarco Ibáñez
    El experimento del salto mortal: enseñar a una IA con clics de gente comparando vídeosPDF→
  • «De A aprendes a medir preferencias humanas de forma robusta y anónima (comparaciones por pares + Elo); de B ves cómo usar exactamente esas preferencias para afinar modelos con RLHF y convertir autocompletadores en asistentes que obedecen instrucciones.»

    MIMarco Ibáñez
    El ranking de modelos que funciona a ciegas: dos respuestas y tú eliges la mejorWeb→
InicioGuardadoCuradoresEntrar