Jueves, 3 de septiembre de 2026

Aube.

Las noticias del progreso
PrototipoFuente única

TOHA detecta respuestas de IA sin respaldo

Idiomas de este artículoComparar con el original

Traducido por IA del inglés — ver el texto original. 5 idiomas disponibles, el tuyo se añade con un clic.

En el contexto al que se dirige TOHA, un asistente de IA recibe una pregunta y un conjunto de documentos de la empresa antes de responder. La frase puede sonar convincente y, aun así, no tener ningún respaldo en ese contexto. Investigadores de Skoltech y del Centro de Inteligencia Artificial Práctica de Sberbank han propuesto TOHA (TOpology-based HAllucination detector), un método que detecta estas posibles alucinaciones a partir de los propios mapas de atención del modelo.

El método está diseñado para la generación aumentada mediante recuperación, o RAG: sistemas que proporcionan a un modelo lingüístico información procedente de bases de conocimiento corporativas, documentos u otras fuentes externas. Los detectores existentes pueden exigir grandes cantidades de datos anotados o cálculos adicionales, como generar varias respuestas y compararlas. TOHA sigue una vía diferente: convierte las matrices de atención del modelo en grafos y compara las estructuras vinculadas al contexto original y a la respuesta generada.

Esa comparación produce MTop-Div, una medida topológica de divergencia. En determinadas cabezas de atención, los investigadores observaron que los valores más altos se asociaban de forma constante con respuestas que no estaban respaldadas por el contexto proporcionado. Se utiliza un pequeño conjunto de ejemplos anotados para configurar el sistema y seleccionar las cabezas informativas, sin necesidad de un clasificador entrenado por separado.

El equipo evaluó TOHA en tareas de respuesta a preguntas y resumen de textos. En varias pruebas de referencia, los autores informan de resultados comparables o superiores a los de métodos existentes, con una necesidad relativamente reducida de datos anotados y recursos computacionales. También señalan que el enfoque alcanzó resultados comparables a los de SelfCheckGPT, un método más exigente desde el punto de vista computacional que se basa en generar varias respuestas.

En términos concretos, el método podría ofrecer a bancos, aseguradoras, bufetes de abogados y otras empresas una forma menos costosa de examinar las respuestas generadas a partir de sus documentos internos. La implementación ya forma parte de SIRIN, una biblioteca de código abierto desarrollada por el Centro de Inteligencia Artificial Práctica de Sberbank. Su promesa actual se centra en detectar incoherencias contextuales: los investigadores describen una señal de posible alucinación, no una garantía de que todas las respuestas sean correctas.

Fuentes — leer los originales(hora de París)

Phys.org — TechnologyEN
0000

Para leer a continuación

Comentarios

Cargando el hilo…

Inicia sesión para escribir un comentario. Iniciar sesión