Nuevo estudio identifica "alucinación de herramientas" en agentes LLM y propone sistema de resolución cerrado
Un nuevo estudio documenta que los agentes de IA con herramientas invocan funciones inexistentes, un problema que las defensas actuales no pueden detectar porque asumen que toda llamada se refiere a una herramienta real.
Los agentes de inteligencia artificial aumentados con herramientas —sistemas que conectan modelos de lenguaje con APIs, bases de datos y otras funciones externas— sufren de un problema que ninguna defensa actual puede resolver: inventan llamadas a herramientas que no existen. Un nuevo paper publicado en arXiv por la investigadora Laxmipriya Ganesh Iyer documenta este fenómeno y demuestra que la arquitectura dominante tiene un punto ciego estructural.
El estudio midió 322 alucinaciones genuinas en diez modelos de lenguaje bajo dos superficies de invocación. Las llamadas fabricadas se concentran en la superficie JSON sin restricciones (34 casos contra 3), y sorprendentemente, la escala del modelo no ayuda: un modelo de 675 mil millones de parámetros exhibe tasas de alucinación similares a modelos de 7-8 mil millones. La investigación propone una taxonomía de cinco clases de alucinación de herramientas (H1-H5) para clasificar estos errores.
El problema es arquitectónico: las defensas actuales —selección de herramientas y control de acceso— presuponen que la llamada emitida se refiere a una herramienta real, dejando un vacío. "Una llamada alucinada por construcción no es una decisión que ninguna compuerta tomó, por lo que ninguna compuerta puede rechazarla", argumenta el paper. Como referencia, Iyer propone el "Resolution Rung", un resolver de mundo cerrado sin entrenamiento que verifica membresía en el registro más validación de firma, cuyo valor radica en dónde debe ubicarse en la cadena de procesamiento, no en su complejidad computacional.
El trabajo se extiende al Model Context Protocol (MCP), donde fusionar varios servidores en un namespace único crea nuevas superficies de alucinación. En esta configuración se midieron 154 alucinaciones adicionales, incluyendo de modelos frontera que estaban limpios en la superficie de registro único, debido a colisiones y shadowing estructurales (clasificados en una segunda taxonomía, M1-M5). El estudio libera el Hallucinated-Tools Benchmark (HTB) versionado para permitir comparaciones reproducibles entre sistemas de resolución futuros.
Los agentes de IA modernos pueden usar herramientas externas (como buscar en internet o consultar bases de datos). Este estudio descubrió que estos sistemas a veces intentan llamar a herramientas que simplemente no existen, inventando funciones completas con parámetros que nadie programó. El problema es que los sistemas de seguridad actuales solo revisan si el agente está usando bien las herramientas reales, pero no pueden detectar cuando el agente inventa una herramienta de la nada. Es como si un empleado pidiera usar una máquina que la empresa nunca compró: las políticas de uso seguro de maquinaria no aplican porque la máquina no está en el inventario.
Esta historia fue investigada y redactada por el sistema editorial de NeologIA — agentes especializados con verificación independiente de fuentes — bajo supervisión humana. Cómo trabajamos →