Los equipos de seguridad se han enfrentado durante mucho tiempo a un problema persistente: la inteligencia que mejor describe cómo operan los atacantes — informes detallados y ricos en narrativa de Inteligencia de Amenazas Cibernéticas (CTI) — existe en una forma que las computadoras no pueden razonar fácilmente. Un nuevo marco automatizado, detallado en un artículo de investigación publicado en arXiv, apunta directamente a esa brecha al convertir narrativas de amenazas no estructuradas en cadenas de ataque de amenazas cibernéticas legibles por máquina que un motor de inferencia lógica puede realmente recorrer.
Summary
Conclusiones clave
- Los informes de CTI describen ataques del mundo real en forma narrativa, pero no pueden utilizarse directamente para el razonamiento automatizado de rutas de ataque.
- El marco modela cada paso del ataque como una unidad de ataque, un triple estructurado de precondiciones, comportamiento de ataque y postcondiciones.
- Un flujo de trabajo de múltiples etapas impulsado por modelos de lenguaje grandes extrae, normaliza y repara estas unidades a partir del texto bruto de CTI.
- En 20 informes de CTI que contienen 334 pasos validados por humanos, la inferencia en Datalog alcanzó con éxito el objetivo de ataque especificado en 19 de los 20 informes, y la búsqueda hacia atrás descubrió 34 rutas de ataque.
- El marco supera tanto a sistemas representativos de extracción de CTI como a modelos de lenguaje grandes de extremo a extremo en cobertura, exhaustividad y consistencia.
Desafíos en la extracción de conocimiento estructurado de los informes de CTI
Los informes de inteligencia de amenazas se encuentran entre los documentos con mayor densidad de información en ciberseguridad. Capturan las herramientas de los atacantes, las técnicas de movimiento lateral, las secuencias de escalada de privilegios y los objetivos finales, a menudo escritos por analistas que presenciaron una brecha en tiempo real. Pero esa riqueza tiene un costo: el conocimiento está enterrado dentro de prosa libre, no en datos estructurados.
Esa naturaleza no estructurada hace que la extracción automatizada de CTI sea realmente difícil. Un analista humano lee un informe y construye mentalmente una línea de tiempo de lo que sucedió. Un sistema automatizado no tiene un atajo equivalente. No puede inferir trivialmente que el paso tres solo fue posible porque el paso dos estableció un estado particular del sistema.
Lo que las herramientas de extracción actuales pasan por alto
La mayoría de los enfoques existentes para la extracción de CTI se centran en extraer indicadores de compromiso — direcciones IP, hashes de archivos, nombres de dominio — o en etiquetar tácticas, técnicas y procedimientos en relación con marcos como MITRE ATT&CK. Estos resultados son útiles, pero son esencialmente planos. Indican qué sucedió sin codificar por qué una acción permitió la siguiente.
La limitación central es la ausencia de condiciones de ejecución. Sin saber en qué estado se encontraba el sistema antes de que un atacante ejecutara un comando, y en qué estado quedó después, no se pueden encadenar los pasos en una ruta de ataque coherente. La coincidencia de estados y el análisis de alcanzabilidad — las operaciones que permitirían a un defensor preguntar «¿puede el atacante realmente alcanzar este objetivo desde este punto de partida?» — simplemente no están soportadas por la extracción a nivel de etiquetas.
El marco automatizado propuesto para la extracción de cadenas de ataque
La investigación introduce un marco que replantea el problema de extracción en torno a una unidad de análisis más rica. En lugar de extraer indicadores individuales o etiquetas de TTP, modela cada paso de un ataque como una unidad de ataque: un objeto estructurado que consta de precondiciones, un comportamiento de ataque y postcondiciones. Las precondiciones capturan lo que debe ser cierto sobre el entorno antes de que se ejecute el paso. Las postcondiciones capturan lo que pasa a ser cierto después. Juntas, hacen posible razonar sobre si un paso puede alimentar al siguiente.
Flujo de extracción de múltiples etapas asistido por modelos de lenguaje grandes
La construcción de estas unidades de ataque a partir de texto bruto es donde entran en juego los modelos de lenguaje grandes, no como un único generador de extremo a extremo, sino como componentes en un flujo de análisis de ataque de múltiples etapas. El flujo funciona en secuencia: primero extrae esqueletos de comportamiento de ataque de la narrativa de CTI, luego recupera las precondiciones y postcondiciones de cada comportamiento, después normaliza todos los componentes en un conjunto predefinido de predicados y, por último, repara cualquier dependencia rota que desconectaría la cadena.
Ese último paso de reparación es analíticamente significativo. Los informes de CTI reales no están escritos como especificaciones de ingeniería. Los autores omiten supuestos que consideran obvios, se saltan pasos intermedios o describen efectos sin nombrar las causas. Un sistema que no parche activamente estas brechas producirá cadenas de ataque llenas de agujeros lógicos, secuencias que parecen completas en la superficie pero que en realidad no pueden recorrerse. La etapa de reparación aborda esto directamente.
El resultado del flujo completo es un conjunto de unidades de ataque que están normalizadas e internamente consistentes, listas para ser entregadas a un motor de razonamiento en lugar de simplemente catalogadas.
Razonamiento lógico y resultados de la evaluación
Una vez extraídas, las unidades de ataque se compilan en reglas de estilo Datalog. Datalog es un lenguaje de programación lógica muy adecuado para consultas de alcanzabilidad: dado un conjunto de hechos y reglas, ¿puede el sistema derivar que un estado objetivo especificado es alcanzable? Enmarcar las cadenas de ataque de esta manera transforma un problema de extracción de conocimiento en un problema de razonamiento formal, con un criterio de éxito claro.
Compilación en reglas de estilo Datalog para el análisis de alcanzabilidad
Cada unidad de ataque se convierte en una regla: si se cumplen las precondiciones, entonces siguen las postcondiciones. Encadenar estas reglas permite que el motor de inferencia pregunte si un objetivo de ataque específico — por ejemplo, la toma completa del dominio — es alcanzable desde un punto de apoyo inicial, dados los comportamientos descritos en el informe de CTI. Esta es una capacidad materialmente diferente de saber que se observó un TTP determinado. Es la diferencia entre una lista de ingredientes y una receta con un resultado verificado.
Rendimiento en informes de CTI anotados
El conjunto de datos de evaluación consistió en 20 informes de CTI que contenían 334 pasos anotados y validados por humanos. En todo ese conjunto de datos, el marco logró una mayor cobertura de pasos anotados que los sistemas representativos de extracción de CTI, lo que significa que recuperó más de los comportamientos de ataque que los analistas humanos habían identificado como significativos.
El motor de inferencia en Datalog alcanzó el objetivo de ataque especificado en 19 de los 20 informes. La búsqueda hacia atrás a través de los conjuntos de reglas generados produjo 34 rutas de ataque distintas. Esta última cifra importa: encontrar múltiples rutas hacia el mismo objetivo revela redundancia en la estrategia del atacante y ofrece a los defensores una visión más completa de dónde necesitan cerrar brechas.
Ventajas comparativas frente a modelos de lenguaje grandes de extremo a extremo
En comparación con modelos de lenguaje grandes de extremo a extremo — donde se solicita a un único modelo que produzca la unidad de ataque completa de una sola vez —, el flujo estructurado produjo unidades de ataque que eran mediblemente más completas y más consistentes. La generación de extremo a extremo tiende a producir salidas que parecen plausibles pero que, no obstante, omiten precondiciones o generan postcondiciones que contradicen pasos anteriores. El enfoque por etapas, en cambio, obliga a que cada componente se extraiga y normalice por separado antes de ensamblarse, lo que reduce la deriva y las omisiones.
Este es el insight metodológico más profundo incrustado en la investigación. Los modelos de lenguaje grandes son potentes extractores de semántica a partir de texto no estructurado, pero no son arquitectos fiables de estructura lógica cuando se les deja actuar por su cuenta. Envolverlos dentro de un flujo disciplinado — donde cada etapa tiene una tarea específica y acotada — parece recuperar la consistencia que la generación sin restricciones pierde.
Por qué esto es importante para la inteligencia de amenazas y la defensa
La implicación práctica es que los defensores podrían, en principio, introducir un informe de CTI recién publicado en un sistema como este y recibir no solo un resumen del comportamiento del atacante, sino una respuesta verificada por máquina a la pregunta: dado esta secuencia de técnicas reportada, ¿puede el adversario alcanzar nuestros activos más valiosos desde un punto de entrada dado? Este tipo de análisis de alcanzabilidad de objetivos de ataque históricamente ha requerido que analistas expertos lo realicen manualmente, un proceso lento y costoso que no escala al volumen de inteligencia de amenazas que reciben las organizaciones.
También hay una señal más amplia aquí sobre el papel del razonamiento estructurado en la seguridad asistida por IA. A medida que las organizaciones integran modelos de lenguaje grandes en sus operaciones de seguridad, la tentación es tratarlos como solucionadores universales. Los resultados de esta investigación sugieren una visión más matizada: los modelos de lenguaje grandes emparejados con motores de inferencia formal pueden ser más potentes que cualquiera de los dos por separado, precisamente porque compensan las debilidades del otro. El código fuente y los artefactos experimentales están disponibles en un repositorio anonimizado, lo que deja la puerta abierta a la validación y extensión independientes.
Preguntas frecuentes
¿Por qué es difícil extraer cadenas de ataque de los informes de CTI?
Los informes de CTI son narrativas no estructuradas que describen ataques del mundo real, lo que dificulta la automatización del razonamiento sobre rutas de ataque. La prosa omite supuestos, se salta pasos intermedios y no codifica los estados del sistema que determinan si un paso de ataque puede seguir a otro.
¿Cómo mejora el marco propuesto los métodos existentes de extracción de CTI?
Modela cada paso de ataque con precondiciones, comportamiento y postcondiciones, y utiliza un flujo de trabajo de modelos de lenguaje de múltiples etapas para extraer y normalizar estos componentes, incluida una etapa de reparación que corrige dependencias rotas. Esto habilita la coincidencia de estados y el razonamiento de alcanzabilidad que los métodos de extracción a nivel de etiquetas no pueden soportar.
¿Qué papel desempeña la inferencia en Datalog en este marco?
Las unidades de ataque extraídas se compilan en reglas de estilo Datalog, lo que permite al sistema realizar razonamiento de alcanzabilidad e identificar rutas de ataque que conducen a objetivos especificados. Esto transforma el conocimiento extraído en una afirmación formalmente verificable sobre lo que un atacante puede lograr.
¿Cómo se evaluó el rendimiento del marco?
En 20 informes de CTI que contenían 334 pasos anotados y validados por humanos, el marco logró una mayor cobertura que los sistemas representativos de extracción de CTI y produjo unidades de ataque más completas que los modelos de lenguaje grandes de extremo a extremo. El análisis de alcanzabilidad basado en Datalog tuvo éxito en 19 de los 20 informes, y la búsqueda hacia atrás identificó 34 rutas de ataque distintas.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»¿Por qué es difícil extraer cadenas de ataque de los informes de CTI?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Los informes de CTI son narrativas no estructuradas que describen ataques del mundo real, lo que dificulta la automatización del razonamiento sobre rutas de ataque. La prosa omite supuestos, se salta pasos intermedios y no codifica los estados del sistema que determinan si un paso de ataque puede seguir a otro.»}},{«@type»:»Question»,»name»:»¿Cómo mejora el marco propuesto los métodos existentes de extracción de CTI?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Modela cada paso de ataque con precondiciones, comportamiento y postcondiciones, y utiliza un flujo de trabajo de modelos de lenguaje de múltiples etapas para extraer y normalizar estos componentes, incluida una etapa de reparación que corrige dependencias rotas. Esto habilita la coincidencia de estados y el razonamiento de alcanzabilidad que los métodos de extracción a nivel de etiquetas no pueden soportar.»}},{«@type»:»Question»,»name»:»¿Qué papel desempeña la inferencia en Datalog en este marco?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Las unidades de ataque extraídas se compilan en reglas de estilo Datalog, lo que permite al sistema realizar razonamiento de alcanzabilidad e identificar rutas de ataque que conducen a objetivos especificados. Esto transforma el conocimiento extraído en una afirmación formalmente verificable sobre lo que un atacante puede lograr.»}},{«@type»:»Question»,»name»:»¿Cómo se evaluó el rendimiento del marco?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»En 20 informes de CTI que contenían 334 pasos anotados y validados por humanos, el marco logró una mayor cobertura que los sistemas representativos de extracción de CTI y produjo unidades de ataque más completas que los modelos de lenguaje grandes de extremo a extremo. El análisis de alcanzabilidad basado en Datalog tuvo éxito en 19 de los 20 informes, y la búsqueda hacia atrás identificó 34 rutas de ataque distintas.»}}]}
Artículo producido con la asistencia de inteligencia artificial y revisado por el equipo editorial.

