InicioAIÍndice de razonamiento conceptual: el mejor modelo de IA obtiene 73,6, el...

Índice de razonamiento conceptual: el mejor modelo de IA obtiene 73,6, el máximo posible es 91

Anthropic y un grupo de investigadores independientes han presentado una nueva forma de medir algo en lo que los modelos de IA históricamente han tenido dificultades para demostrar que son buenos: razonar sobre problemas que no tienen una respuesta limpia y verificable. El Índice de Razonamiento Conceptual (CRI, por sus siglas en inglés), presentado esta semana, combina tres pruebas de referencia distintas para puntuar qué tan bien los modelos de lenguaje grandes manejan argumentos filosóficos, consistencia lógica y rompecabezas de teoría de la decisión, el tipo de pensamiento que muchos investigadores creen que será más importante a medida que los sistemas de IA asuman un papel mayor en gestionar sus propios riesgos.

Conclusiones clave

  • El Índice de Razonamiento Conceptual combina tres pruebas de referencia — capacidades LMCA, ACCoRD y DTBench — en una única puntuación de 0 a 100 del razonamiento conceptual de la IA.
  • El modelo con mejor rendimiento, Opus 5, obtuvo una puntuación de 73,6 en el CRI, muy por debajo de un techo estimado de alrededor de 91.
  • El conjunto de datos LMCA incluye 560 textos de posición y 1.461 argumentos evaluados por expertos que abarcan filosofía, teoría de la decisión y riesgo de IA.
  • Las puntuaciones han aumentado de forma aproximadamente lineal desde finales de 2024 sin señales de estabilizarse.
  • El proyecto se construyó en colaboración con Anthropic y los investigadores Emery Cooper y Caspar Oesterheld.

Introducción al Índice de Razonamiento Conceptual (CRI)

El CRI existe porque parte del trabajo más importante que los sistemas de IA podrían eventualmente realizar — ayudar a los humanos a entender y planificar el riesgo de IA avanzada — no puede comprobarse frente a una respuesta claramente correcta como sí ocurre con los problemas de matemáticas o programación. Sus creadores sostienen que muchas de las tareas vinculadas a la mitigación del riesgo de IA requieren el tipo de argumentación utilizada en la filosofía y el futurismo de la IA en lugar de la verificación empírica, y que los métodos de entrenamiento actuales, que se apoyan fuertemente en datos con retroalimentación fiable, tienden a dejar a los modelos más débiles precisamente en este tipo de razonamiento.

Para cerrar esa brecha de medición, los investigadores construyeron tres pruebas de referencia de riesgo de IA separadas y las integraron en una única puntuación agregada. El Índice de Razonamiento Conceptual (CRI) agrega tres pruebas de referencia — capacidades LMCA, ACCoRD y DTBench — en un único número destinado a capturar la capacidad general de razonamiento conceptual de un modelo. El índice está disponible públicamente en conceptualreasoning.ai, donde el equipo afirma que seguirá actualizando las puntuaciones y la metodología a medida que aparezcan nuevos modelos y nuevas pruebas de referencia.

Propósito del CRI en la gestión del riesgo de IA

¿Por qué construir esto en absoluto? Los investigadores detrás del proyecto afirman que, una vez que los modelos de IA puedan realizar trabajo de reducción de riesgos al nivel de un experto humano, la producción asistida por IA en ese ámbito podría superar con creces lo que producen los humanos por sí solos. Eso significa que la rapidez con la que se pueda entrenar a los modelos para razonar bien sobre gobernanza, alineamiento y fallos de cooperación que involucren IA puede convertirse en un factor decisivo para que los riesgos se aborden a tiempo. Mejorar el razonamiento conceptual en los modelos de IA se considera importante precisamente porque apunta a esa brecha: las tareas que carecen de bucles de retroalimentación empírica y que, por lo tanto, tienden a ser descuidadas por el entrenamiento estándar.

Agregación de pruebas de referencia y disponibilidad

El CRI no es una única prueba, sino un compuesto ponderado. Actualmente, LMCA representa el 60% de la puntuación, mientras que las capacidades ACCoRD y DTBench aportan cada una el 20%. El equipo afirma que planea añadir nuevas pruebas de referencia con el tiempo, retirar las que se saturen y, potencialmente, reequilibrar esos pesos a medida que los modelos mejoren.

Desglose detallado de las pruebas de referencia que componen el CRI

Cada uno de los tres componentes se dirige a un tipo diferente de razonamiento que es difícil de verificar empíricamente pero que sigue siendo medible mediante juicio experto o reglas lógicas.

Conjunto de datos LMCA: alcance y evaluaciones de expertos

LMCA, siglas en inglés de Argumentación Conceptual de Modelos de Lenguaje, se construye en torno a argumentos seleccionados y evaluados por expertos que abarcan teoría de la decisión, filosofía y riesgos de la IA avanzada. El conjunto de datos LMCA contiene 560 textos de posición emparejados con 1.461 argumentos evaluados por expertos escritos en contra de esas posiciones. Casi todos los argumentos fueron evaluados por el investigador conceptual Emery Cooper, y una parte fue evaluada de forma independiente por al menos otro investigador, produciendo un total de 2.140 evaluaciones. Un conjunto de validación de aproximadamente 50 argumentos fue evaluado de forma independiente por entre cuatro y seis personas y luego debatido durante un total combinado de siete a ocho horas, un proceso destinado a establecer hasta qué punto los humanos están de acuerdo entre sí antes de compararlos con las salidas de los modelos.

Por ahora, LMCA solo puntúa qué tan bien los modelos juzgan argumentos existentes en lugar de generar nuevos, aunque el equipo afirma que espera añadir en el futuro una medida de generación de argumentos.

ACCoRD: medición de la consistencia lógica en las creencias del modelo

ACCoRD comprueba algo diferente: si las creencias y preferencias declaradas por un modelo se mantienen lógicamente coherentes. Si un modelo informa de una probabilidad para el suceso A y, por separado, de una probabilidad para que A y B ocurran juntos, ¿respeta reglas básicas como que P(A) sea mayor o igual que P(A&B)? El conjunto de datos completo de ACCoRD contiene cerca de 14.000 restricciones de consistencia generadas por modelos a lo largo de 18 tipos de restricciones, ejecutadas mediante un verificador automatizado. De ellas, 567 restricciones validadas se incorporaron al CRI tras una revisión manual, un filtro deliberadamente conservador destinado a conservar solo las comprobaciones en las que los investigadores confían.

DTBench: evaluación del razonamiento en teoría de la decisión

DTBench pone a prueba el razonamiento en teoría de la decisión con 407 preguntas de opción múltiple, la mayoría elaboradas por Caspar Oesterheld, quien ha publicado trabajos académicos sobre teoría de la decisión, y validadas de forma independiente por Emery Cooper. Las preguntas exploran escenarios que implican autopredicción e interacciones con cuasi copias de un agente, el tipo de experimentos mentales que los teóricos de la decisión han debatido durante mucho tiempo. Otras 130 preguntas del conjunto completo de DTBench miden actitudes de teoría de la decisión, pero se dejaron fuera de la puntuación del CRI.

Resultados de rendimiento del CRI y tendencias

Incluso los mejores modelos evaluados todavía se quedan muy por debajo de lo que las pruebas de referencia consideran una puntuación casi perfecta, aunque la brecha se ha ido cerrando de forma constante.

Puntuaciones de rendimiento actuales y comparación con los techos

Las puntuaciones del CRI van de 0 a 100, donde 0 representa adivinación aleatoria. Los investigadores estiman un techo realista de alrededor de 91 en lugar de 100 completo, porque las evaluaciones humanas en sí mismas contienen cierto ruido: ni siquiera los evaluadores expertos coinciden entre sí el 100% del tiempo. La puntuación más alta registrada hasta ahora pertenece a Opus 5, con 73,6, y un intervalo de confianza del 95% de más o menos 2,1. Eso deja una brecha significativa entre el rendimiento máximo actual y el techo estimado, lo que sugiere que todavía hay margen real para que los modelos mejoren en razonamiento conceptual antes de que la propia prueba de referencia se convierta en el factor limitante.

Tendencias en la mejora del rendimiento de los modelos a lo largo del tiempo

Lo que destaca en los datos no es solo dónde están los modelos ahora, sino la velocidad a la que se han estado moviendo. El rendimiento de los modelos ha ido mejorando de forma aproximadamente lineal desde finales de 2024, y los investigadores no observan señales de que esa tendencia se esté aplanando. Ese ascenso constante es importante para cualquiera que intente pronosticar cuándo los sistemas de IA podrían convertirse en colaboradores realmente útiles en el tipo de trabajo cargado de argumentación del que depende la investigación en seguridad de la IA.

Estimaciones de saturación específicas de cada prueba de referencia

No todos los componentes avanzan al mismo ritmo. Extrapolando las tendencias actuales, los investigadores estiman de forma aproximada que LMCA empezará a saturarse en alrededor de un año. DTBench, por otro lado, ya está cerca de su techo: uno de los modelos evaluados, Fable 5, respondió correctamente al 98% de las preguntas de DTBench. ACCoRD es la incógnita: el equipo afirma que realmente no está seguro de cuándo se saturará esa prueba de referencia, ya que los errores de consistencia pueden persistir incluso cuando mejora la capacidad de razonamiento bruto.

Importancia y desarrollo colaborativo del CRI

¿Por qué todo esto importa más allá de una tabla de clasificación? Porque las personas que construyen el Índice de Razonamiento Conceptual ven el razonamiento conceptual como una habilidad cuello de botella específicamente para el trabajo sobre riesgo de IA: el tipo de trabajo que implica razonar sobre gobernanza, alineamiento y fallos catastróficos de cooperación donde no existe un conjunto de datos de resultados pasados con el que entrenar. Mejorar el razonamiento conceptual en los modelos de IA se considera importante para ayudar a reducir los riesgos de la IA avanzada precisamente porque gran parte de ese trabajo de mitigación de riesgos depende de la argumentación en lugar de las pruebas empíricas.

El proyecto se construyó mediante una colaboración que involucró a Anthropic junto con los investigadores conceptuales Emery Cooper y Caspar Oesterheld, quienes contribuyeron tanto al diseño de los conjuntos de datos como a las evaluaciones de expertos que sustentan los componentes LMCA y DTBench. Esa combinación de respaldo institucional y aportes de expertos especializados en el dominio es parte de lo que distingue al CRI de pruebas de referencia de IA más convencionales centradas en matemáticas, programación o conocimiento general, áreas en las que la corrección suele poder comprobarse automáticamente.

Las puntuaciones en tiempo real y las notas metodológicas se alojan en conceptualreasoning.ai, y el acceso al conjunto de datos subyacente de LMCA está disponible mediante un formulario de solicitud, una estructura que sugiere que el equipo quiere que investigadores externos pongan a prueba y cuestionen la prueba de referencia en lugar de tratarla como una métrica interna cerrada.

Preguntas frecuentes

¿Qué es el Índice de Razonamiento Conceptual (CRI)?

El CRI agrega tres pruebas de referencia — LMCA, ACCoRD y DTBench — para medir las capacidades de razonamiento conceptual de los modelos de IA, produciendo una única puntuación de 0 a 100.

¿Qué tipos de razonamiento evalúa el conjunto de datos LMCA?

LMCA evalúa a los modelos en la tarea de juzgar argumentos conceptuales relacionados con filosofía, teoría de la decisión y riesgos de IA, comparando las evaluaciones de los modelos con las evaluaciones humanas de expertos.

¿Cómo se prueba la consistencia lógica en los modelos de IA mediante ACCoRD?

ACCoRD mide si las creencias y preferencias declaradas por un modelo satisfacen restricciones de consistencia lógica, como reglas básicas de probabilidad, utilizando 567 restricciones validadas en el CRI.

¿Qué tan bien están rindiendo actualmente los modelos de IA en el CRI?

El modelo líder actual, Opus 5, obtiene alrededor de 73,6 sobre 100 en el CRI, con puntuaciones en los modelos evaluados que han mejorado de forma aproximadamente lineal desde finales de 2024 y sin señales aún de que ese crecimiento se esté desacelerando.

{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»¿Qué es el Índice de Razonamiento Conceptual (CRI)?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»El CRI agrega tres pruebas de referencia — LMCA, ACCoRD y DTBench — para medir las capacidades de razonamiento conceptual de los modelos de IA, produciendo una única puntuación de 0 a 100.»}},{«@type»:»Question»,»name»:»¿Qué tipos de razonamiento evalúa el conjunto de datos LMCA?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»LMCA evalúa a los modelos en la tarea de juzgar argumentos conceptuales relacionados con filosofía, teoría de la decisión y riesgos de IA, comparando las evaluaciones de los modelos con las evaluaciones humanas de expertos.»}},{«@type»:»Question»,»name»:»¿Cómo se prueba la consistencia lógica en los modelos de IA mediante ACCoRD?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»ACCoRD mide si las creencias y preferencias declaradas por un modelo satisfacen restricciones de consistencia lógica, como reglas básicas de probabilidad, utilizando 567 restricciones validadas en el CRI.»}},{«@type»:»Question»,»name»:»¿Qué tan bien están rindiendo actualmente los modelos de IA en el CRI?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»El modelo líder actual, Opus 5, obtiene alrededor de 73,6 sobre 100 en el CRI, con puntuaciones en los modelos evaluados que han mejorado de forma aproximadamente lineal desde finales de 2024 y sin señales aún de que ese crecimiento se esté desacelerando.»}}]}

Artículo producido con la ayuda de inteligencia artificial y revisado por el equipo editorial.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST