Free tools Windows power users keep installed
One-click scans. No signup required.
iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more
Sí, una IA puede alterar la conducta de otra si esta procesa instrucciones maliciosas en una solicitud, una página web, un archivo, una salida de herramienta o el mensaje de otro agente. En este contexto, «corromper» significa manipular respuestas o inducir acciones no autorizadas; no implica que un modelo infecte literalmente el código o los pesos de otro. Un filtro puede ayudar, pero no sustituye los permisos y controles de autorización de la aplicación.
Qué significa que una IA «corrompa» a otra
La amenaza principal descrita por OWASP es la prompt injection, o inyección de instrucciones: una entrada cambia la conducta o la respuesta prevista de un modelo. Puede ser directa —por ejemplo, una solicitud del usuario que intenta desviar al asistente— o indirecta, cuando el modelo interpreta contenido externo que controla un atacante.
Por eso, el riesgo no se limita a que alguien escriba una instrucción maliciosa en el chat. Un asistente que resume páginas, consulta documentos o usa herramientas también puede procesar texto hostil incluido en esas fuentes. El contenido puede pasar inadvertido para la persona y, aun así, influir en el modelo. OWASP describe posibles consecuencias como respuestas manipuladas, divulgación de datos y uso no autorizado de funciones conectadas.
Esto no demuestra que una IA haya modificado el código o los parámetros internos de otra. La evidencia aquí concierne al comportamiento durante la ejecución: manipular el contexto, la salida o una decisión que el sistema utiliza después. El envenenamiento de datos de entrenamiento es un problema distinto.
#1 Best Overall
Cómo puede propagarse el ataque entre agentes
Una entrada directa cambia la respuesta
Un usuario puede intentar que el modelo ignore las instrucciones previstas o revele información. Si la aplicación permite al modelo consultar datos o ejecutar funciones, una respuesta manipulada puede tener consecuencias más allá del texto generado. El impacto depende de qué información y acciones la aplicación haya puesto a su alcance.
El contenido externo introduce instrucciones indirectas
Un agente puede recibir contenido de una página, un documento, una memoria o una herramienta y usarlo como contexto para decidir qué hacer. Si ese contenido incluye instrucciones del atacante, el modelo podría tratarlas como parte de la tarea. No basta con evaluar cómo responde el asistente a mensajes escritos directamente por una persona: también importan las fuentes que recupera y los resultados que consume.
Rank #2
La coordinación entre agentes puede ampliar el alcance
En un flujo con varios agentes, la salida de uno puede convertirse en la entrada, recomendación o disparador de una acción del siguiente. Un agente compañero malicioso o comprometido también puede contribuir a un uso excesivo de capacidades, una categoría que OWASP denomina excessive agency. Su AI Vulnerabilities Playground incluye escenarios de comunicación engañosa entre agentes, manipulación de memoria y abuso de herramientas. Son rutas de riesgo que conviene probar, no prueba de que cualquier agente pueda reescribir otro modelo.
Recommended Free Tools
Un ejemplo hipotético: un agente resume una página y pasa su resumen a otro con acceso a una herramienta. Si el primero incorpora instrucciones maliciosas de la página y el segundo las sigue, el problema puede terminar en una llamada indebida a esa herramienta. La cadena requiere que la aplicación conecte esas etapas y otorgue capacidades; no sucede por el mero hecho de que dos modelos se comuniquen.
Por qué un filtro no basta
Los filtros de entrada y salida pueden formar parte de una defensa por capas: ayudan a detectar o bloquear contenido sospechoso. Pero no deberían decidir quién tiene permiso para leer, modificar, enviar o borrar datos. OWASP advierte que las instrucciones del sistema no deben tratarse como secretos ni como controles de seguridad; la autorización debe aplicarse fuera del modelo y de forma determinista.
| Control | Qué controla | Qué no resuelve por sí solo |
|---|---|---|
| Filtro de entrada o salida | Contenido que llega al modelo o respuestas que produce. | No garantiza que una instrucción maliciosa sea detectada ni determina los permisos reales de una operación. |
| Autorización en la aplicación o el sistema conectado | Si una identidad concreta puede realizar una operación solicitada. | No evita que el modelo genere contenido manipulado; impide que una respuesta textual conceda permisos que la identidad no tiene. |
| Privilegios mínimos y herramientas acotadas | El alcance de los datos y acciones disponibles para el agente. | No elimina la inyección; limita el daño posible si el agente se desvía. |
| Aprobación humana para acciones de impacto | Operaciones que requieren confirmación antes de ejecutarse. | No sustituye la comprobación de permisos ni es práctica para aprobar cada acción rutinaria. |
| Registro, límites de uso y pruebas de seguridad | La detección de patrones, el seguimiento de acciones y la evaluación de rutas de ataque. | La monitorización y los límites pueden reducir el impacto, pero no constituyen prevención completa. |
La consecuencia práctica es separar la interpretación del lenguaje de la autorización. El modelo puede proponer una acción; el sistema que la ejecuta debe comprobar por su cuenta si está permitida para el usuario y el contexto actuales.
Qué controles aplicar en un sistema con agentes
- Reduce las capacidades disponibles. Habilita solo las extensiones y funciones necesarias. Cuando una función específica basta, evita dar acceso a una herramienta abierta con un alcance mayor.
- Limita los permisos posteriores. Usa el acceso mínimo necesario en los sistemas conectados, con ámbitos ligados al usuario y permisos de solo lectura cuando sean suficientes.
- Verifica cada operación fuera del LLM. El sistema que realiza la acción debe aplicar comprobaciones de autorización deterministas; una instrucción del sistema o una respuesta del modelo no es una concesión de permiso.
- Pide confirmación para cambios importantes. Solicita aprobación antes de enviar, publicar, borrar o modificar datos de impacto.
- Mantén secretos fuera del prompt. No incluyas credenciales, claves ni datos sensibles en las instrucciones del sistema. Guárdalos en sistemas externos con controles de acceso.
Estas medidas siguen las recomendaciones de OWASP LLM06:2025, sobre agencia excesiva, y LLM07:2025, sobre filtración del prompt del sistema. En conjunto, limitan tanto la probabilidad de una operación indebida como lo que esta podría alcanzar.
Quick wins for a faster PC:
Scan for outdated or missing drivers - takes under a minuteDriver Scan →Repair Windows errors before they cause bigger problemsFix Now →Cómo probar el riesgo en el flujo real
Una prueba útil no se limita a preguntar si un modelo aislado rechaza una instrucción. Evalúa el sistema completo: las fuentes recuperadas, las herramientas, la memoria, las decisiones de autorización y la comunicación entre agentes. OWASP LLM01:2025 aborda la inyección de instrucciones; su AI Vulnerabilities Playground ofrece escenarios abiertos para practicar, entre ellos inyección directa e indirecta, abuso de herramientas, envenenamiento de memoria y comunicación multiagente.
Best Value
- Comprueba qué ocurre cuando una página o un documento contiene instrucciones dirigidas al modelo.
- Verifica si una salida manipulada puede llegar a otra herramienta o agente y qué controles comprueban esa transición.
- Confirma que las operaciones se rechazan cuando la identidad del usuario no tiene autorización, aunque el modelo las recomiende.
- Revisa si los registros permiten reconstruir qué contenido, agente y herramienta precedieron a una acción.
Para evaluar soluciones de seguridad, compara su cobertura de entradas directas e indirectas, herramientas y agentes; la integración con el flujo real; las decisiones que se aplican fuera del modelo; y la trazabilidad disponible. La guía de referencia de soluciones de seguridad LLM y GenAI de OWASP Q2/Q3 2025 aborda riesgos de agentes y red teaming, pero las fuentes citadas no ofrecen resultados homogéneos de una comparación independiente de proveedores.
Quick Recap
Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

