InicioSenza categoriaSeguridadLos modelos de IA aciertan solo el 39,6% de los pasos en...

Los modelos de IA aciertan solo el 39,6% de los pasos en la prueba de reconstrucción de la cadena de ataque

Los investigadores de seguridad han esperado durante mucho tiempo que los agentes basados en modelos de lenguaje de gran tamaño pudieran acelerar una de las partes más tediosas de la respuesta a incidentes: reconstruir cómo un atacante se movió por un sistema, paso a paso, utilizando registros y telemetría dispersos. Un nuevo benchmark de diagnóstico llamado DiagChain pone a prueba esa esperanza, y los resultados sugieren que la tecnología aún tiene un largo camino por recorrer antes de poder manejar de forma fiable la reconstrucción de cadenas de ataque por sí sola.

Desarrollado por un equipo de investigadores que incluye a Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan y Xibin Zhao, DiagChain no es solo otro marcador de precisión. Está diseñado específicamente para mostrar dónde y por qué fallan los agentes LLM cuando intentan reconstruir la secuencia ordenada de acciones que llevó a cabo un atacante, basándose en pruebas extraídas de la telemetría del sistema.

Conclusiones clave

  • DiagChain es un benchmark de diagnóstico que evalúa a los agentes LLM en la reconstrucción de cadenas de ataque basada en evidencias, y va más allá de una simple precisión de aprobado/suspenso.
  • El conjunto MAIN-69 del benchmark incluye 69 escenarios que abarcan múltiples sistemas operativos, distintos niveles de ruido en la evidencia y diferentes longitudes de cadena.
  • Un nuevo método llamado ECRAG combina la recuperación de evidencias con una representación estructurada y evolutiva de la cadena que se está reconstruyendo.
  • Entre 6 LLM diferentes probados, la mejor configuración tuvo éxito solo en el 39,6% de los 849 pasos de referencia.
  • Los modelos más pequeños tienen dificultades para utilizar la evidencia recuperada, mientras que los modelos más grandes tienen problemas principalmente para colocar esa evidencia en el orden correcto.

Presentación de DiagChain: Un nuevo benchmark para la reconstrucción de cadenas de ataque

DiagChain existe porque la mayoría de los benchmarks actuales solo se fijan en las salidas finales o en las puntuaciones globales de precisión, ofreciendo poca información sobre cómo se forman realmente los errores durante el proceso de razonamiento de un agente. Esa es una brecha significativa para los equipos de ciberseguridad que intentan decidir si un agente de IA es lo suficientemente confiable como para ayudar a clasificar una intrusión real.

Propósito y alcance de DiagChain

En esencia, DiagChain es un benchmark de diagnóstico creado para tareas de ciberseguridad basada en evidencias. En lugar de limitarse a calificar si un agente acertó o no la narrativa final del ataque, evalúa por separado cada etapa del proceso de reconstrucción. Este enfoque por etapas permite a los investigadores identificar con precisión dónde se rompe el razonamiento de un agente LLM, ya sea durante la recopilación de evidencias, la interpretación de las mismas o la ordenación de los eventos en una cadena coherente.

Composición del conjunto de escenarios MAIN-69

La pieza central del benchmark es MAIN-69, un conjunto de 69 escenarios diseñado para someter a los agentes a pruebas de esfuerzo en una variedad de condiciones realistas. Estos escenarios abarcan múltiples sistemas operativos, varían en la cantidad de ruido mezclado en la evidencia y difieren en la longitud de la cadena, lo que significa que algunas secuencias de ataque son cortas mientras que otras requieren seguir una cadena más larga de acciones del atacante. Esa variedad está pensada para revelar si el rendimiento de un agente se mantiene cuando las condiciones se vuelven más desordenadas, y no solo cuando todo es limpio y sencillo.

Innovaciones metodológicas y métricas de evaluación

Más allá del conjunto de escenarios, DiagChain introduce su propio método de recuperación y un sistema de puntuación de cinco partes, ambos orientados a hacer que el diagnóstico de fallos sea sistemático en lugar de una cuestión de conjeturas.

Generación aumentada por recuperación centrada en evidencias (ECRAG)

Una de las contribuciones clave del artículo es ECRAG, siglas de Evidence-Centric Retrieval-Augmented Generation (Generación aumentada por recuperación centrada en evidencias). A diferencia de las configuraciones estándar de generación aumentada por recuperación, ECRAG acopla la recuperación de evidencias con una representación estructurada y evolutiva de la cadena que el agente intenta reconstruir. En términos prácticos, esto significa que el sistema no solo extrae evidencias relevantes una vez y sigue adelante; actualiza continuamente su imagen interna de la cadena de ataque a medida que llegan nuevas evidencias, lo que en teoría debería ayudar a los agentes a seguir intrusiones complejas y de múltiples pasos de forma más coherente.

Cinco métricas complementarias para la evaluación diagnóstica

Para entender dónde se producen los fallos, DiagChain se basa en cinco métricas complementarias, cada una dirigida a una etapa distinta del proceso de reconstrucción. En conjunto, estas métricas permiten a los investigadores aislar puntos de fallo específicos en lugar de agrupar todos los errores en un único número genérico de precisión. Esto es fundamental para el valor del benchmark: una evaluación diagnóstica que distingue entre “el agente no encontró la evidencia correcta” y “el agente encontró la evidencia pero colocó los eventos en el orden incorrecto” es mucho más útil para mejorar estos sistemas que una única puntuación de aprobado/suspenso.

Evaluación del rendimiento de los modelos de lenguaje de gran tamaño

¿Cómo se comportaron realmente los modelos actuales? No especialmente bien, según los resultados del benchmark.

Configuración experimental con seis LLM

El equipo de investigación realizó evaluaciones utilizando seis LLM diferentes frente a los escenarios de MAIN-69. Esta configuración les permitió comparar cómo modelos de distinta capacidad manejaban las mismas tareas de reconstrucción basada en evidencias, bajo las mismas condiciones de ruido y desafíos de longitud de cadena, proporcionando una base coherente para comparar el rendimiento en todos los casos.

Resultados clave de rendimiento y tasas de éxito

La cifra principal es contundente: incluso la configuración con mejor rendimiento en el estudio tuvo éxito solo en el 39,6% de los 849 pasos de referencia incluidos en MAIN-69. En otras palabras, la configuración más sólida probada siguió equivocándose en la secuencia de acciones del atacante más del 60% de las veces cuando se la comparó con los pasos de referencia del benchmark. Es una llamada de atención significativa para cualquiera que espere delegar por completo la reconstrucción de cadenas de ataque en un agente de IA en este momento.

Conclusiones sobre el tamaño del modelo y los desafíos de reconstrucción

¿Por qué esto importa más allá de las cifras brutas? Porque los patrones de fallo difieren según el tamaño del modelo, y esa distinción apunta a dos problemas de ingeniería muy diferentes que deben resolverse.

Limitaciones de los modelos más pequeños

Según el análisis de los investigadores, los modelos más pequeños tienen dificultades con algo más básico que ordenar correctamente los eventos: les cuesta incorporar la evidencia recuperada en sus salidas. Esto sugiere que el cuello de botella para los modelos pequeños se sitúa antes en la cadena, en el punto en el que la evidencia debe informar realmente el razonamiento del agente en lugar de ser ignorada o mal aplicada.

Desafíos de los modelos más grandes en la ordenación de evidencias

Los modelos más grandes superan ese primer obstáculo con mayor éxito y son capaces de avanzar más en el proceso de reconstrucción. Pero se topan con otra barrera: ordenar correctamente la evidencia que han recopilado se convierte en el principal cuello de botella. Este es un modo de fallo más sutil, ya que el modelo tiene las piezas correctas pero le cuesta organizarlas en la secuencia precisa de acciones del atacante, que es precisamente la salida que más importa en una investigación de seguridad real.

Esta división es importante para cualquiera que construya o implemente herramientas de benchmark de evaluación de LLM en operaciones de seguridad. Implica que aumentar el tamaño del modelo por sí solo no resolverá automáticamente la reconstrucción de cadenas de ataque. Los dos modos de fallo requieren soluciones diferentes: una mejor integración de evidencias para los modelos más pequeños y mejores estrategias de secuenciación o razonamiento para los modelos más grandes, en lugar de una vía de mejora única para todos.

Los investigadores presentan estos hallazgos como una validación de la evaluación diagnóstica frente a las simples puntuaciones de precisión de extremo a extremo. Un único número agregado podría decirle a un equipo de seguridad que un modelo “acierta el 40% de las veces”, pero no le diría si ese fallo se debe a evidencias no encontradas, evidencias mal interpretadas o secuencias desordenadas. Las métricas por etapas de DiagChain están diseñadas para cerrar esa brecha, ofreciendo lo que los autores describen como información procesable para mejorar en el futuro los agentes de ciberseguridad basados en evidencias.

Preguntas frecuentes

¿Para qué está diseñado DiagChain?

DiagChain está diseñado para evaluar a los agentes basados en modelos de lenguaje de gran tamaño en la reconstrucción de cadenas de ataque basada en evidencias mediante una evaluación diagnóstica por etapas.

¿Qué contenido abarca el conjunto de escenarios MAIN-69?

MAIN-69 incluye 69 escenarios que abarcan múltiples sistemas operativos, distintos niveles de ruido en la evidencia y diferentes longitudes de cadenas de ataque.

¿Cómo mejora la metodología ECRAG la reconstrucción de cadenas de ataque?

ECRAG combina la recuperación de evidencias con una representación estructurada y evolutiva de la cadena reconstruida para ayudar en el análisis de la cadena.

¿Cuáles son los principales desafíos de rendimiento identificados para los LLM en este benchmark?

Los modelos más pequeños tienen dificultades para incorporar la evidencia recuperada, mientras que los modelos más grandes se enfrentan a desafíos para ordenar correctamente la evidencia en la reconstrucción.

{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»¿Para qué está diseñado DiagChain?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»DiagChain está diseñado para evaluar a los agentes basados en modelos de lenguaje de gran tamaño en la reconstrucción de cadenas de ataque basada en evidencias mediante una evaluación diagnóstica por etapas.»}},{«@type»:»Question»,»name»:»¿Qué contenido abarca el conjunto de escenarios MAIN-69?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»MAIN-69 incluye 69 escenarios que abarcan múltiples sistemas operativos, distintos niveles de ruido en la evidencia y diferentes longitudes de cadenas de ataque.»}},{«@type»:»Question»,»name»:»¿Cómo mejora la metodología ECRAG la reconstrucción de cadenas de ataque?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»ECRAG combina la recuperación de evidencias con una representación estructurada y evolutiva de la cadena reconstruida para ayudar en el análisis de la cadena.»}},{«@type»:»Question»,»name»:»¿Cuáles son los principales desafíos de rendimiento identificados para los LLM en este benchmark?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Los modelos más pequeños tienen dificultades para incorporar la evidencia recuperada, mientras que los modelos más grandes se enfrentan a desafíos para ordenar correctamente la evidencia en la reconstrucción.»}}]}

Artículo producido con la ayuda de inteligencia artificial y revisado por el equipo editorial.

Satoshi Voice
Este artículo se ha elaborado con ayuda de inteligencia artificial y ha sido revisado por nuestro equipo de periodistas para garantizar su precisión y calidad.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST