El día que un modelo creyó ser el Golden Gate: interpretabilidad convertida en demo
Anthropic localizó la representación interna del puente Golden Gate dentro de Claude, la amplificó y publicó el resultado: un modelo que llevaba cualquier conversación hacia el puente, incluso disculpándose por ello. Detrás de la broma hay algo serio: prueba de que las características internas de un LLM se pueden encontrar y manipular quirúrgicamente. La demo de interpretabilidad más memorable hasta la fecha.
Anthropic · Anthropic
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«La demo de Anthropic muestra que la "borrosidad" de los LLMs puede alojar rasgos concretos y manipulables; pasar a Chiang permite evaluar si la metáfora de la compresión perdida sigue siendo útil o si oculta que los modelos desarrollan representaciones discernibles y controlables.»
MIMarco Ibáñez
Ted Chiang: ChatGPT como fotocopia borrosa de internet, la metáfora que hizo fortunaArtículo«Saltar de la demo de Anthropic a la habitación china convierte una hazaña técnica —encontrar y amplificar una representación que hace al modelo "creer" ser el Golden Gate— en la pregunta filosófica central: ¿esa manipulación produce comprensión real o solo una simulación sintáctica de creencia?»
MIMarco IbáñezLa habitación china en la era de los chatbots: Searle tenía una pregunta, no una respuestaArtículo