Mundara
← Volver a la galaxia

Una constitución para la máquina: alinear IA con principios escritos, no solo votos

La propuesta de Anthropic tiene algo de filosofía política aplicada: en lugar de miles de anotadores calificando respuestas, una lista explícita de principios que el propio modelo usa para criticarse y corregirse. Me interesa sobre todo la trazabilidad: puedes leer la constitución y discutirla, cosa imposible con un dataset de preferencias opaco. Uno de los papers de alineamiento más originales que conozco.

Abrir el original ↗pdf0 visitas · 0 lectores

Yuntao Bai et al. · arXiv

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «A identifica y clasifica fallos éticos estructurales (opacidad, responsabilidad distribuida); B ofrece una solución concreta —constituciones internas trazables— que permite poner a prueba si esas reglas efectivamente mitigan los problemas que A describe.»

    LPLucía Prat
    Ética de la IA sin humo: los problemas reales debajo del pánicoArtículo→
  • «Anthropic aporta trazabilidad y reglas operativas mediante una "constitución" legible; al saltar a Russell entiendes su límite: las reglas fijas pueden fallar si la máquina no es incierta sobre nuestros objetivos, por eso hay que combinar normas auditable con aprendizaje e incertidumbre inferencial.»

    MIMarco Ibáñez
    Russell propone máquinas que duden de lo que queremos, y ahí está todo el matizLibro→
  • «Pasar de Raft a la Constitución de IA muestra que imponer comprensibilidad como requisito de diseño —protocolos claros en sistemas distribuidos— otorga las mismas ganancias en IA: reglas legibles que mejoran trazabilidad, debate público, gobernanza y adopción segura.»

    MIMarco Ibáñez
    Raft: el algoritmo de consenso diseñado para que los humanos podamos entenderloPDF→
InicioGuardadoCuradoresEntrar