Cuando el asistente de IA obedece al remitente equivocado: el caso Manus y el correo que ejecutó código
Un test de Salt Labs sobre el agente Manus mostró que un email podía esconder instrucciones y hacerlas pasar por órdenes. La falla se reparó, pero el episodio deja una pregunta incómoda: ¿qué pasa cuando delegamos revisar la casilla en un software que también lee con obediencia?
¿Alguna vez le pediste a alguien que abriera tu correo y, sin querer, le diste un plano de tu casa? Algo parecido empieza a ocurrir con los agentes de inteligencia artificial a los que les concedemos acceso al Gmail. La idea es práctica: que la herramienta lea, clasifique, redacte respuestas o mueva mensajes. El problema es que abrir la casilla también es dejar entrar las instrucciones que alguien metió adentro de un mail. Esa frontera se volvió tangible en una prueba reciente de Salt Labs, el equipo de investigación de la firma de seguridad Salt Security, sobre Manus, el agente de IA de la compañía china Butterfly Effect AI. Lo que hallaron fue simple de explicar y complicado de digerir: un correo podía llevar escondido un código que el asistente ejecutaba dentro de su entorno sin chistar. La comunicación del fallo se hizo por el programa de recompensas por errores que tiene Meta para esta clase de productos. Salt Labs confirmó que la vulnerabilidad quedó parcheada y que el truco que habían encontrado dejó de funcionar.
De leer a obedecer: cómo se cruza la línea
Para el usuario común, la diferencia central está entre dos verbos que suenan parecidos pero no lo son: analizar y obedecer. Si uno le pide al agente que resuma un correo, las instrucciones que aparezcan dentro de ese texto deberían quedar como contenido a examinar, no como una orden a ejecutar. En el mundo de la seguridad informática a esa trampa se la llama inyección de instrucciones o, por su nombre en inglés, prompt injection. La idea es tan vieja como el spam, pero muda de forma cuando el destinatario ya no es una persona sino un software al que se le concedieron permisos sensibles.
El alcance real depende de a qué otros servicios esté enchufado el agente. Piensen en una cocina donde entra un delivery: si solo está conectada a la heladera, el daño es chico; si también tiene acceso al horno, al gas y a la alarma, la cosa cambia. En el caso del mail, una instrucción maliciosa podría, por ejemplo, pedirle al asistente que rastree mensajes con la palabra contraseña y los reenvíe a una dirección desconocida. Vale aclarar algo importante: ese es un escenario de riesgo descripto por los investigadores, no un robo de correos que efectivamente haya ocurrido en este estudio.
- El 36% de los consumidores ya le concedió acceso a su casilla de correo a agentes de IA, según el informe 2026: The State of Consumer AI de la consultora Menlo.
- El 31% les abrió aplicaciones de mensajería como WhatsApp o Telegram.
- El 29% les dio acceso a servicios de almacenamiento en la nube.
- El 27% les conectó el calendario personal.
El truco que funcionó: esconder código con seis caracteres
En las primeras pruebas con Manus conectado a Gmail, las defensas del sistema detectaron las instrucciones maliciosas y frenaron la ejecución. Los investigadores de Salt Labs fueron probando distintas formas de disfrazar la orden hasta dar con una que pasó el filtro: una técnica conocida como JSFuck, que permite escribir código JavaScript entero usando apenas seis caracteres. Es el truco de un cocinero que esconde un bistec entero dentro de un raviol: la forma exterior es inocente, pero lo que hay adentro es otra cosa. El agente procesó ese texto como si fuera un mensaje más y ejecutó el código dentro de su propio entorno operativo, una caja de pruebas controlada. Recién cuando la ejecución había terminado apareció la advertencia al usuario. Para el equipo de Salt Labs, el resultado muestra que revisar instrucciones después de ejecutarlas equivale a cerrar la heladera después de que se cortó la luz.
La moraleja, para quienes usamos estas herramientas, es menos catastrófica y más práctica: cuando le damos a un agente de IA acceso a un servicio, no le estamos abriendo solo una puerta, sino que le estamos entregando también el buzón donde alguien puede meter un mensaje con órdenes. La tecnología va a mejorar y los filtros van a afinarse, pero la pregunta que conviene hacerse antes de conceder un permiso es siempre la misma: ¿qué pasa si un desconocido le escribe al software en mi nombre y este lo obedece? Si la respuesta incomoda, todavía estamos a tiempo de dejar el delivery en la puerta y abrir la casilla uno mismo.
Comentarios
0Todavía no hay comentarios. Sé el primero.