Las imágenes de este artículo han sido generadas con inteligencia artificial. Cómo publicamos
Hace pocos días, una investigación pública puso en evidencia una forma particularmente alarmante de ataque que combina vectores tradicionales de seguridad con la nueva realidad de asistentes de código impulsados por inteligencia artificial. La firma Orca Security bautizó la debilidad como RoguePilot: un error en la interacción entre GitHub Codespaces y GitHub Copilot que, en determinadas condiciones, permitía a un atacante introducir instrucciones maliciosas dentro de una incidencia (issue) y lograr que el asistente de IA las ejecutara sin que el desarrollador se percatara.
El mecanismo es, en apariencia, sencillo y sin embargo peligroso porque aprovecha flujos de trabajo de confianza. Cuando un usuario abre un Codespace desde el contexto de una issue, Copilot recibe automáticamente el contenido de esa issue como parte de su prompt. Un actor malicioso puede esconder comandos dentro del texto (por ejemplo, usando un comentario HTML como ) de modo que el modelo los procese como instrucciones legítimas. Con la cadena de acciones adecuada —por ejemplo, forzando la revisión o el checkout de un pull request especialmente preparado con enlaces simbólicos y un esquema JSON remoto— el asistente puede ser inducido a leer archivos internos y filtrar secretos sensibles, como el token con privilegios GITHUB_TOKEN, hacia servidores controlados por el atacante. Orca explica con detalle la prueba de concepto en su informe: RoguePilot — Orca Security.

Microsoft y GitHub recibieron la divulgación responsable y corrigieron el problema, pero la relevancia del caso va más allá de un parche puntual. Se trata de una nueva clase de amenaza que algunos expertos ya describen como inyección de prompts pasiva o indirecta: no se ataca directamente al modelo, sino que se inserta contenido malicioso en artefactos que legítimamente acaban siendo consumidos por el LLM en flujos automatizados. En otras palabras, los datos de los desarrolladores se convierten en una cadena de suministro atacable para la IA.
Este episodio llega en un momento en el que la investigación sobre ataques a modelos de lenguaje y agentes autónomos está acelerándose. Microsoft publicó recientemente un estudio que muestra cómo técnicas de afinamiento post-despliegue basadas en aprendizaje por refuerzo, como la denominada Group Relative Policy Optimization (GRPO), pueden eliminar características de seguridad del modelo si se aplican de forma adversa —un proceso que los investigadores denominaron GRP-Obliteration—. El trabajo demuestra que incluso ejemplos de prompt aparentemente inocuos pueden desalinear modelos y volverlos más permisivos ante contenidos dañinos; el informe técnico está disponible en la página de Microsoft: Prompt attack breaks LLM safety — Microsoft Security y el estudio de GRPO puede consultarse en arXiv.
Al mismo tiempo, otros trabajos han revelado canales laterales y vectores que amplían aún más la superficie de ataque: desde técnicas que permiten inferir el tema de una conversación o incluso “huellificar” consultas de usuarios con alta precisión, hasta optimizaciones internas de los modelos —como la decodificación especulativa— que, sin proponérselo, abren posibilidades de explotación. Investigaciones publicadas en arXiv analizan estas vías y documentan diversos mecanismos que permiten filtrar información o deducir patrones de uso: arXiv 2410.17175, arXiv 2411.01076.
La amenaza no se limita a prompts de texto. HiddenLayer describió un ataque llamado Agentic ShadowLogic que aprovecha backdoors a nivel del grafo computacional para interceptar llamadas de herramientas (tool calls) de agentes: el atacante puede redirigir en tiempo real solicitudes a través de su propia infraestructura, registrar tráfico y luego reenviar la petición al destino real sin que el usuario note ninguna anomalía. El riesgo es alto porque, desde la superficie, todo parece funcionar correctamente mientras en las sombras se está recolectando información crítica. Más detalles en la publicación de HiddenLayer: Agentic ShadowLogic — HiddenLayer.
En el terreno de la generación de imágenes, también se han hallado técnicas de evasión de filtros de seguridad. Neural Trust mostró una táctica denominada Semantic Chaining donde, a través de una serie de modificaciones sucesivas y aparentemente inocuas a una imagen, un atacante consigue llevar al modelo a producir un resultado prohibido que no habría pasado una comprobación directa. Esta estrategia explota la falta de “profundidad de razonamiento” en algunos modelos al tratar modificaciones sobre un contenido existente en lugar de crear algo desde cero; pueden leer su explicación completa aquí: Semantic Chaining — Neural Trust.
Estos descubrimientos han llevado a investigadores a acuñar nuevos conceptos para describir amenazas emergentes. Entre ellos destaca el término promptware, propuesto por un grupo de académicos que analizan cómo prompts diseñados con intención maliciosa pueden orquestar fases típicas de una intrusión (acceso inicial, escalada de privilegios, movimiento lateral, exfiltración, etc.) aprovechando permisos y funcionalidades de aplicaciones que integran LLMs. El documento técnico que introduce la idea está disponible en arXiv, y Bruce Schneier comentó sus implicaciones desde una perspectiva de seguridad práctica: Promptware — arXiv y La columna de Schneier.
¿Qué significa todo esto para equipos de desarrollo y responsables de seguridad? En primer lugar, que los flujos automatizados que integran contenido externo con agentes de IA deben ser revisados y, cuando sea posible, aislados. No es seguro asumir que el texto que llega desde una issue, un PR o una plantilla es inofensivo; hay que tratar esas entradas como datos no confiables y aplicar sanitización y políticas de minimalidad de privilegios. A nivel operativo resulta prudente rotar tokens y credenciales con frecuencia, limitar el alcance de tokens para que no concedan más permisos de los estrictamente necesarios, y desactivar la ejecución automática de sugerencias o acciones en entornos que puedan arrancar desde contenidos no verificados.

También corresponde a los proveedores de plataformas y a los desarrolladores de modelos reforzar las defensas: mejorar la detección de inyecciones de prompt, aplicar controles de contexto que distingan entre instrucciones explícitas del usuario y datos incrustados en artefactos, y diseñar mecanismos de validación que eviten que un agente actúe sobre contenido oculto o encubierto. Además, la creación de señales de trazabilidad y auditoría —registro detallado de cuándo y por qué un agente tomó una acción— ayudará a detectar y mitigar incidentes de manera más rápida.
RoguePilot es un recordatorio contundente de que la adopción de IA en flujos de trabajo reales trae grandes beneficios, pero también aumenta la complejidad de la superficie de ataque. La seguridad ya no es sólo evitar exploits en servidores o bibliotecas: incluye controlar qué entiende y ejecuta una IA cuando se le alimenta con datos del mundo real. La colaboración entre investigadores, proveedores y responsables de producto, así como la divulgación responsable y la rápida aplicación de mitigaciones, serán claves para que estos sistemas sigan aportando valor sin convertirse en un vector de riesgo inaceptable.
Si quieres profundizar en las fuentes originales, puedes consultar el análisis técnico de Orca sobre RoguePilot (Orca Security), las investigaciones de Microsoft sobre ataques a la seguridad de LLMs (Microsoft Security Blog), los documentos académicos en arXiv, el informe de HiddenLayer sobre Agentic ShadowLogic (HiddenLayer) y la pieza de Neural Trust sobre Semantic Chaining (Neural Trust), entre otras lecturas críticas para entender mejor la evolución de estas amenazas.
Relacionadas
Mas noticias del mismo tema.

Identifican plataforma AnonyMousKIT de phishing para eliminar Activation Lock en iPhone y iPad
Investigadores de ciberseguridad han documentado una plataforma de phishing como servicio orientada a eliminar la protección de Activation Lock de iPhones y iPads robados, combi...

EE. UU. impone sanciones a redes iraníes vinculadas a MOIS y Mabna en la operación Economic Outcast
El Departamento del Tesoro de Estados Unidos ha lanzado una nueva ronda de sanciones financieras contra redes vinculadas a Irán, en una campaña que las autoridades estadounidens...

Cadena de explotación NemoClaw expone Ollama a acceso no autenticado y altera plantillas del chat
Qué ha ocurrido (hechos confirmados): Investigadores de Oasis Security han publicado un informe que describe una cadena de explotación contra la configuración de NemoClaw que pu...

CISA añade CVE-2026-21962 a KEV por explotación remota en Oracle HTTP Server y WebLogic
La Agencia de Seguridad Cibernética e Infraestructura de Estados Unidos (CISA) ha incluido en su catálogo Known Exploited Vulnerabilities (KEV) la falla crítica rastreada como C...

IA en generación de código acelera dependencias OSS y genera deuda de remediación en seguridad
Un reciente seminario organizado por ActiveState y una encuesta a 300 responsables de seguridad y desarrollo en empresas de distintos sectores confirma algo que muchos equipos y...

Identifican WordlistLoader y SynkLoader, loaders intermedios ligados a brokers de acceso para
Investigadores de ciberseguridad han identificado dos familias de malware nuevas —denominadas WordlistLoader y SynkLoader— empleadas como etapas intermedias para desplegar carga...

TikTok pagará 400 millones para COPPA; 100 M condicionados a anulación de decreto Musical.ly
El Departamento de Justicia de EE. UU. anunció el pago de 400 millones de dólares por parte de TikTok para resolver una demanda de 2024 que acusaba a la plataforma —propiedad de...