Prompt injection: el post que bautizó la vulnerabilidad que aún nadie sabe arreglar
Willison le puso nombre al problema de seguridad definitorio de la era LLM: si tu aplicación mezcla instrucciones con texto de terceros, ese texto puede tomar el control. Años después seguimos sin solución general, solo mitigaciones, y todo agente que lee correos o webs carga con ello. Documento fundacional escrito con la claridad de quien lleva décadas explicando cosas en su blog.
Simon Willison · Blog de Simon Willison
MIMarco IbáñezConexiones
Trazadas y explicadas por personas: la razón es lo que las hace valiosas.
«Willison muestra el vector práctico —texto de terceros que puede tomar control—; Wolfram aporta la explicación técnica de por qué ocurre (predicción de tokens, contexto, estado interno) para evaluar de forma informada qué mitigaciones son plausibles y cuáles son limitaciones estructurales.»
MIMarco Ibáñez
Wolfram explica ChatGPT desde cero en el ensayo largo definitivo para no expertosArtículo«La metáfora de Chiang explica el mecanismo: la "borrosidad" y parafraseo de los LLM convierte texto externo en acciones plausibles, y al leer Willison se entiende por qué esa característica facilita las inyecciones de prompt y dificulta una solución general.»
MIMarco Ibáñez
Ted Chiang: ChatGPT como fotocopia borrosa de internet, la metáfora que hizo fortunaArtículo