As duas versões estão alinhadas bloco a bloco, pela ordem do texto: título, o essencial e depois parágrafo a parágrafo. Quando a tradução fundiu ou dividiu um parágrafo, a casa correspondente fica vazia — nunca aproximamos duas passagens a olho.
In the setting TOHA targets, an AI assistant receives a question and a bundle of company documents before it answers. The sentence can sound convincing and still have no support in that context. Researchers at Skoltech and Sberbank’s Center for Practical Artificial Intelligence have proposed TOHA (TOpology-based HAllucination detector), a method that flags these potential hallucinations from the model’s own attention maps.
No cenário visado pelo TOHA, um assistente de IA recebe uma pergunta e um conjunto de documentos da empresa antes de responder. A frase pode parecer convincente e, ainda assim, não ter qualquer suporte nesse contexto. Investigadores da Skoltech e do Centro de Inteligência Artificial Prática da Sberbank propuseram o TOHA (TOpology-based HAllucination detector), um método que sinaliza estas potenciais alucinações a partir dos próprios mapas de atenção do modelo.
The method is designed for retrieval-augmented generation, or RAG — systems that supply a language model with information from corporate knowledge bases, documents or other external sources. Existing detectors can demand large amounts of annotated data or extra computation, such as generating several answers and comparing them. TOHA takes a different route: it turns the model’s attention matrices into graphs and compares the structures linked to the original context and the generated response.
O método foi concebido para a geração aumentada por recuperação, ou RAG — sistemas que fornecem a um modelo de linguagem informação proveniente de bases de conhecimento empresariais, documentos ou outras fontes externas. Os detetores existentes podem exigir grandes quantidades de dados anotados ou computação adicional, como gerar várias respostas e compará-las. O TOHA segue uma abordagem diferente: transforma as matrizes de atenção do modelo em grafos e compara as estruturas associadas ao contexto original e à resposta gerada.
That comparison produces MTop-Div, a topological measure of divergence. For certain attention heads, the researchers found that higher values were consistently associated with responses not supported by the supplied context. A small set of annotated examples is used to configure the system and select the informative heads, with no separately trained classifier required.
Essa comparação produz o MTop-Div, uma medida topológica de divergência. Para determinadas cabeças de atenção, os investigadores concluíram que valores mais elevados estavam consistentemente associados a respostas não sustentadas pelo contexto fornecido. Um pequeno conjunto de exemplos anotados é utilizado para configurar o sistema e selecionar as cabeças informativas, sem necessidade de um classificador treinado separadamente.
The team evaluated TOHA on question-answering and text-summarization tasks. Across several benchmarks, the authors report results comparable to or better than existing methods while requiring relatively little annotated data and computational resources. They also say the approach reached results comparable to SelfCheckGPT, a more computationally intensive method based on generating multiple responses.
A equipa avaliou o TOHA em tarefas de perguntas e respostas e de sumarização de texto. Em vários testes de referência, os autores relatam resultados comparáveis ou melhores do que os dos métodos existentes, exigindo simultaneamente relativamente poucos dados anotados e recursos computacionais. Afirmam também que a abordagem alcançou resultados comparáveis aos do SelfCheckGPT, um método mais exigente em termos computacionais que se baseia na geração de várias respostas.
So, concretely, the method could give banks, insurers, law firms and other companies a less expensive way to screen answers produced from their internal documents. The implementation is already part of SIRIN, an open-source library developed by Sberbank’s Center for Practical Artificial Intelligence. Its current promise is targeted detection of contextual inconsistency: the researchers describe a signal of potential hallucination, not a guarantee that every response is correct.
Concretamente, o método poderá proporcionar a bancos, seguradoras, sociedades de advogados e outras empresas uma forma menos dispendiosa de analisar respostas produzidas a partir dos seus documentos internos. A implementação já faz parte do SIRIN, uma biblioteca de código aberto desenvolvida pelo Centro de Inteligência Artificial Prática da Sberbank. A promessa atual é a deteção direcionada de inconsistências contextuais: os investigadores descrevem um sinal de potencial alucinação, não uma garantia de que todas as respostas estejam corretas.