Mundara
← Volver a la galaxia

El día que un modelo creyó ser el Golden Gate: interpretabilidad convertida en demo

Anthropic localizó la representación interna del puente Golden Gate dentro de Claude, la amplificó y publicó el resultado: un modelo que llevaba cualquier conversación hacia el puente, incluso disculpándose por ello. Detrás de la broma hay algo serio: prueba de que las características internas de un LLM se pueden encontrar y manipular quirúrgicamente. La demo de interpretabilidad más memorable hasta la fecha.

Abrir el original ↗articulo0 visitas · 0 lectores

Anthropic · Anthropic

MIMarco Ibáñez

Conexiones

Trazadas y explicadas por personas: la razón es lo que las hace valiosas.

  • «La demo de Anthropic muestra que la "borrosidad" de los LLMs puede alojar rasgos concretos y manipulables; pasar a Chiang permite evaluar si la metáfora de la compresión perdida sigue siendo útil o si oculta que los modelos desarrollan representaciones discernibles y controlables.»

    MIMarco Ibáñez
    Ted Chiang: ChatGPT como fotocopia borrosa de internet, la metáfora que hizo fortunaArtículo→
  • «Saltar de la demo de Anthropic a la habitación china convierte una hazaña técnica —encontrar y amplificar una representación que hace al modelo "creer" ser el Golden Gate— en la pregunta filosófica central: ¿esa manipulación produce comprensión real o solo una simulación sintáctica de creencia?»

    MIMarco Ibáñez
    La habitación china en la era de los chatbots: Searle tenía una pregunta, no una respuestaArtículo→
InicioGuardadoCuradoresEntrar