Una constitución para la máquina: alinear IA con principios escritos, no solo votos
La propuesta de Anthropic tiene algo de filosofía política aplicada: en lugar de miles de anotadores calificando respuestas, una lista explícita de principios que el propio modelo usa para criticarse y corregirse. Me interesa sobre todo la trazabilidad: puedes leer la constitución y discutirla, cosa imposible con un dataset de preferencias opaco. Uno de los papers de alineamiento más originales que conozco.
Yuntao Bai et al. · arXiv
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«A identifica y clasifica fallos éticos estructurales (opacidad, responsabilidad distribuida); B ofrece una solución concreta —constituciones internas trazables— que permite poner a prueba si esas reglas efectivamente mitigan los problemas que A describe.»
LPLucía PratÉtica de la IA sin humo: los problemas reales debajo del pánicoArtículo
«Anthropic aporta trazabilidad y reglas operativas mediante una "constitución" legible; al saltar a Russell entiendes su límite: las reglas fijas pueden fallar si la máquina no es incierta sobre nuestros objetivos, por eso hay que combinar normas auditable con aprendizaje e incertidumbre inferencial.»
MIMarco Ibáñez
Russell propone máquinas que duden de lo que queremos, y ahí está todo el matizLibro«Pasar de Raft a la Constitución de IA muestra que imponer comprensibilidad como requisito de diseño —protocolos claros en sistemas distribuidos— otorga las mismas ganancias en IA: reglas legibles que mejoran trazabilidad, debate público, gobernanza y adopción segura.»
MIMarco IbáñezRaft: el algoritmo de consenso diseñado para que los humanos podamos entenderloPDF