Mundara
← Volver a la galaxia

Una red que aprendió a jugar al Atari mirando píxeles, y con ella nació DeepMind

Aquí está el momento en que el aprendizaje por refuerzo dejó de ser un juguete académico: la misma red, sin cambiar una línea, aprende Breakout, Pong y Space Invaders solo con la pantalla y la puntuación. Me fascina lo corto que es y lo poco que necesita para funcionar. Es el paper que convenció a Google de comprar DeepMind, y se nota por qué.

Abrir el original ↗pdf0 visitas · 0 lectores

Volodymyr Mnih et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «Pasa de demostrar que una red puede aprender políticas reactivas desde píxeles a mostrar que, mediante autojuego y búsqueda (MCTS+redes), una máquina puede construir representaciones y principios estratégicos abstractos capaces de generar conocimiento y estilos de juego inéditos.»

    MIMarco Ibáñez
    AlphaZero: cuatro horas de autoaprendizaje contra siglos de teoría ajedrecísticaPDF→
  • «La Atari demuestra que deep RL escala y aprende comportamientos complejos desde señales crudas; el salto mortal muestra cómo sustituir una recompensa intraducible con comparaciones humanas para guiarlos. Juntas explican cómo combinar capacidad algorítmica con supervisión humana para crear agentes potentes y alineados.»

    MIMarco Ibáñez
    El experimento del salto mortal: enseñar a una IA con clics de gente comparando vídeosPDF→
InicioGuardadoCuradoresEntrar