Mundara
← Volver a la galaxia

El experimento del salto mortal: enseñar a una IA con clics de gente comparando vídeos

Aquí nació el ingrediente humano de RLHF: en vez de diseñar una función de recompensa imposible de escribir, se le enseñan a la gente pares de clips y se le pregunta cuál es mejor. Con unos cientos de comparaciones, un muñeco simulado aprendió a hacer un backflip. Léelo para entender de dónde viene, literalmente, el gusto de los chatbots actuales.

Abrir el original ↗pdf0 visitas · 0 lectores

Paul Christiano et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «La Atari demuestra que deep RL escala y aprende comportamientos complejos desde señales crudas; el salto mortal muestra cómo sustituir una recompensa intraducible con comparaciones humanas para guiarlos. Juntas explican cómo combinar capacidad algorítmica con supervisión humana para crear agentes potentes y alineados.»

    MIMarco Ibáñez
    Una red que aprendió a jugar al Atari mirando píxeles, y con ella nació DeepMindPDF→
  • «B muestra cómo pares de preferencias humanas permiten aprender una recompensa práctica; A aplica esa técnica al lenguaje (RLHF), mostrando por qué un modelo pequeño alineado puede ser preferido frente a uno grande sin alinear.»

    MIMarco Ibáñez
    InstructGPT: el paso que convirtió un autocompletador salvaje en un asistentePDF→
InicioGuardadoCuradoresEntrar