Una red que aprendió a jugar al Atari mirando píxeles, y con ella nació DeepMind
Aquí está el momento en que el aprendizaje por refuerzo dejó de ser un juguete académico: la misma red, sin cambiar una línea, aprende Breakout, Pong y Space Invaders solo con la pantalla y la puntuación. Me fascina lo corto que es y lo poco que necesita para funcionar. Es el paper que convenció a Google de comprar DeepMind, y se nota por qué.
Volodymyr Mnih et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Pasa de demostrar que una red puede aprender políticas reactivas desde píxeles a mostrar que, mediante autojuego y búsqueda (MCTS+redes), una máquina puede construir representaciones y principios estratégicos abstractos capaces de generar conocimiento y estilos de juego inéditos.»
MIMarco IbáñezAlphaZero: cuatro horas de autoaprendizaje contra siglos de teoría ajedrecísticaPDF
«La Atari demuestra que deep RL escala y aprende comportamientos complejos desde señales crudas; el salto mortal muestra cómo sustituir una recompensa intraducible con comparaciones humanas para guiarlos. Juntas explican cómo combinar capacidad algorítmica con supervisión humana para crear agentes potentes y alineados.»
MIMarco IbáñezEl experimento del salto mortal: enseñar a una IA con clics de gente comparando vídeosPDF