Jueves, 3 de septiembre de 2026

Aube.

Las noticias del progreso
Original y traducción

TOHA detecta respuestas de IA sin respaldo

Salir de la comparación

Las dos versiones están alineadas bloque a bloque, en el orden del texto: titular, lo esencial y después párrafo a párrafo. Cuando la traducción ha fusionado o dividido un párrafo, la casilla correspondiente queda vacía — nunca emparejamos dos pasajes a ojo.

Original · inglés
TOHA flags unsupported AI answers from attention maps
Traducción · español
TOHA detecta respuestas de IA sin respaldo
Original · inglés
Built for retrieval-augmented systems, TOHA needs no separately trained detector.
Traducción · español
Diseñado para sistemas de generación aumentada con recuperación, TOHA no necesita un detector entrenado por separado.
Original · inglés
It compares graph structures inside attention maps to flag answers unsupported by the supplied context.
Traducción · español
Compara las estructuras de los grafos dentro de los mapas de atención para detectar respuestas sin respaldo en el contexto proporcionado.
Original · inglés
A practical implementation is available in SIRIN, an open-source library for AI systems.
Traducción · español
SIRIN, una biblioteca de código abierto para sistemas de IA, ya ofrece una implementación práctica.
Original · inglés

In the setting TOHA targets, an AI assistant receives a question and a bundle of company documents before it answers. The sentence can sound convincing and still have no support in that context. Researchers at Skoltech and Sberbank’s Center for Practical Artificial Intelligence have proposed TOHA (TOpology-based HAllucination detector), a method that flags these potential hallucinations from the model’s own attention maps.

Traducción · español

En el contexto al que se dirige TOHA, un asistente de IA recibe una pregunta y un conjunto de documentos de la empresa antes de responder. La frase puede sonar convincente y, aun así, no tener ningún respaldo en ese contexto. Investigadores de Skoltech y del Centro de Inteligencia Artificial Práctica de Sberbank han propuesto TOHA (TOpology-based HAllucination detector), un método que detecta estas posibles alucinaciones a partir de los propios mapas de atención del modelo.

Original · inglés

The method is designed for retrieval-augmented generation, or RAG — systems that supply a language model with information from corporate knowledge bases, documents or other external sources. Existing detectors can demand large amounts of annotated data or extra computation, such as generating several answers and comparing them. TOHA takes a different route: it turns the model’s attention matrices into graphs and compares the structures linked to the original context and the generated response.

Traducción · español

El método está diseñado para la generación aumentada mediante recuperación, o RAG: sistemas que proporcionan a un modelo lingüístico información procedente de bases de conocimiento corporativas, documentos u otras fuentes externas. Los detectores existentes pueden exigir grandes cantidades de datos anotados o cálculos adicionales, como generar varias respuestas y compararlas. TOHA sigue una vía diferente: convierte las matrices de atención del modelo en grafos y compara las estructuras vinculadas al contexto original y a la respuesta generada.

Original · inglés

That comparison produces MTop-Div, a topological measure of divergence. For certain attention heads, the researchers found that higher values were consistently associated with responses not supported by the supplied context. A small set of annotated examples is used to configure the system and select the informative heads, with no separately trained classifier required.

Traducción · español

Esa comparación produce MTop-Div, una medida topológica de divergencia. En determinadas cabezas de atención, los investigadores observaron que los valores más altos se asociaban de forma constante con respuestas que no estaban respaldadas por el contexto proporcionado. Se utiliza un pequeño conjunto de ejemplos anotados para configurar el sistema y seleccionar las cabezas informativas, sin necesidad de un clasificador entrenado por separado.

Original · inglés

The team evaluated TOHA on question-answering and text-summarization tasks. Across several benchmarks, the authors report results comparable to or better than existing methods while requiring relatively little annotated data and computational resources. They also say the approach reached results comparable to SelfCheckGPT, a more computationally intensive method based on generating multiple responses.

Traducción · español

El equipo evaluó TOHA en tareas de respuesta a preguntas y resumen de textos. En varias pruebas de referencia, los autores informan de resultados comparables o superiores a los de métodos existentes, con una necesidad relativamente reducida de datos anotados y recursos computacionales. También señalan que el enfoque alcanzó resultados comparables a los de SelfCheckGPT, un método más exigente desde el punto de vista computacional que se basa en generar varias respuestas.

Original · inglés

So, concretely, the method could give banks, insurers, law firms and other companies a less expensive way to screen answers produced from their internal documents. The implementation is already part of SIRIN, an open-source library developed by Sberbank’s Center for Practical Artificial Intelligence. Its current promise is targeted detection of contextual inconsistency: the researchers describe a signal of potential hallucination, not a guarantee that every response is correct.

Traducción · español

En términos concretos, el método podría ofrecer a bancos, aseguradoras, bufetes de abogados y otras empresas una forma menos costosa de examinar las respuestas generadas a partir de sus documentos internos. La implementación ya forma parte de SIRIN, una biblioteca de código abierto desarrollada por el Centro de Inteligencia Artificial Práctica de Sberbank. Su promesa actual se centra en detectar incoherencias contextuales: los investigadores describen una señal de posible alucinación, no una garantía de que todas las respuestas sean correctas.

Volver al artículo