Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
LaboSource unique

SlideAgent améliore la lecture des documents complexes par l’IA

Langues de cet articleComparer à l’original

Traduit par IA, langue d’origine : anglais — voir le texte original. 2 langues disponibles, la vôtre s’ajoute en un clic.

Une note de bas de page disparaît dans le coin d’une diapositive surchargée. Un nombre est mal compté dans un graphique. Pour une IA qui lit une présentation financière, ces petites erreurs peuvent avoir des conséquences sur le reporting, l’évaluation des risques ou les décisions stratégiques. Des chercheurs de Georgia Tech et de J.P. Morgan affirment que leur nouveau framework, SlideAgent, a amélioré jusqu’à 10 % la précision sur des documents visuels complexes.

L’idée est de faire lire l’IA davantage comme un humain. Les grands modèles de langage multimodaux actuels — des systèmes capables de traiter à la fois du texte et des images — analysent souvent une page entière en une seule fois. SlideAgent demande au contraire à des agents distincts d’étudier trois niveaux : le document complet, les pages individuelles et les éléments comme les graphiques, les tableaux et les blocs de texte. Leurs conclusions sont ensuite combinées en une compréhension structurée, qui peut servir à comparer des informations entre plusieurs pages.

L’équipe a testé le framework sur des présentations financières réelles, des diapositives techniques et des jeux de données de questions-réponses visuelles. SlideAgent a enregistré une amélioration de 7,9 % par rapport à son modèle de base propriétaire et une amélioration de 9,8 % par rapport aux modèles de base open source évalués, selon le chercheur principal Yiqiao (Ahren) Jin. Les progrès les plus importants ont été observés dans les tâches nécessitant de comparer des informations entre plusieurs diapositives ou de relier des éléments visuels présents sur une même page.

Et après ? Pour les personnes qui travaillent sur des rapports denses, la promesse pratique est plus limitée, mais utile : manquer moins de détails lorsqu’une IA résume un document ou répond à des questions à son sujet. Cela pourrait réduire l’effort mental nécessaire pour parcourir de longues présentations, tout en donnant aux utilisateurs une meilleure base pour vérifier des informations à forts enjeux. Cette étude n’établit pas que SlideAgent est déjà déployé dans des bureaux ; elle rend compte des résultats d’une évaluation.

Le projet a été accepté pour une présentation lors de la conférence annuelle de l’Association for Computational Linguistics, ACL 2026, organisée à San Diego du 2 au 7 juillet. Jin, doctorant à Georgia Tech, a développé SlideAgent pendant un stage chez J.P. Morgan AI Research. Le prochain défi de l’équipe est clairement défini : améliorer l’efficacité de calcul sans sacrifier la précision ni l’interprétabilité.

9,8%Amélioration par rapport aux modèles de base open source évalués

Sources — lire les originaux(heure de Paris)

Phys.org — TechnologyEN
0000

À lire ensuite

Commentaires

Chargement du fil…

Connectez-vous pour écrire un commentaire. Se connecter