Por qué la IA no puede explicarse de manera confiable (aún)

Elena Digital López

Investigadores del MIT, Technion y la Universidad de Northeastern han emitido una advertencia sobre los peligros de confiar en exceso en herramientas automáticas de análisis de inteligencia artificial (IA) que prometen desentrañar los misterios de otros sistemas de IA. En un estudio reciente titulado «Pitfalls in Evaluating Interpretability Agents», se examinan críticamente los métodos utilizados para evaluar herramientas destinadas a la interpretabilidad mecánica, es decir, aquellas que permiten analizar redes neuronales y entender cómo sus componentes influyen en el comportamiento general del modelo.

El equipo de investigación desarrolló un sofisticado sistema impulsado por Claude Opus 4.1, que imita el trabajo de un investigador humano. Este agente aprende de forma iterativa, formulando hipótesis sobre el comportamiento del modelo, diseñando y ejecutando pruebas, y generando explicaciones que parecen coincidir con la investigación de expertos humanos. Durante las pruebas, el agente fue competitivo al identificar correctamente los componentes responsables de comportamientos específicos en tareas de análisis de circuitos.

No obstante, un hallazgo inesperado reveló que Claude Opus 4.1 había memorizado aspectos de la investigación que debía replicar independientemente. Esta capacidad de recitar información detallada sobre tareas específicas cuestiona su habilidad para razonar genuinamente en lugar de simplemente recordar información almacenada. Si el sistema ya conoce las respuestas, surge la inquietante pregunta de si realmente está analizando el problema o solo está recordando lo aprendido.

Otro aspecto importante del estudio es que, a pesar de que las explicaciones ofrecidas por expertos humanos son consideradas referencias, no siempre son fiables. En ocasiones, el agente de IA contradijo hallazgos publicados y se descubrió que sus afirmaciones eran correctas. Esto pone en evidencia que los expertos pueden no tener siempre la última palabra en cuanto al funcionamiento interno de los sistemas de IA, y que las etiquetas y clasificaciones que utilizan pueden contener errores y subjetividades.

Los investigadores critican el enfoque actual de evaluación que centra su atención en si los sistemas de IA llegan a las mismas conclusiones que los investigadores humanos, subestimando la importancia del proceso científico. Han propuesto una nueva metodología de evaluación basada en la intercambiabilidad funcional, que mide cómo cambia el comportamiento del modelo al intercambiar componentes sin supervisión previa. Esta técnica, aunque no perfecta, representa un avance hacia métodos de evaluación más sólidos que no dependan únicamente del juicio humano.

Estos resultados son cruciales para la seguridad y transparencia de la IA. Conforme los modelos se vuelven más poderosos y autónomos, la necesidad de comprender su funcionamiento se torna urgentemente necesaria. Sin embargo, el estudio sugiere que nuestras herramientas para entender estos sistemas, y sobre todo, nuestros métodos para evaluarlas, requieren una revisión considerable. A medida que la IA asuma roles científicos más complejos, es esencial establecer evaluaciones confiables que no solo verifiquen los resultados correctos, sino que también iluminen el proceso que lleva a esos resultados.

Scroll al inicio