Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A Reddit thread can begin with a symptom and end somewhere deeper: a family conflict, isolation or another root cause. At Victoria University, Associate Professor Khandakar Ahmed and Saima Rani spent two years teaching AI to look for those themes across one million health-related Reddit threads. In tests on new posts, PaLM 2 matched human judgments in 80% of cases.
Un fil Reddit peut commencer par un symptôme et aboutir à quelque chose de plus profond : un conflit familial, l’isolement ou une autre cause profonde. À l’Université Victoria, le professeur associé Khandakar Ahmed et Saima Rani ont consacré deux ans à apprendre à une IA à repérer ces thèmes dans un million de fils Reddit liés à la santé. Lors de tests sur de nouvelles publications, PaLM 2 a égalé les jugements humains dans 80 % des cas.
The team first built a mental-health narrative database. Psychiatrist and University of Melbourne honorary associate professor Manjula O’Connor manually classified 800 threads, linking the language people used to root-cause categories from Healthdirect Australia. That expert-verified data was then fed into two AI models, PaLM 2 and AutoML, which evaluated new threads separately from human raters.
L’équipe a d’abord constitué une base de données de récits de santé mentale. La psychiatre et professeure associée honoraire de l’Université de Melbourne Manjula O’Connor a classé manuellement 800 fils, en reliant le vocabulaire employé par les internautes aux catégories de causes profondes de Healthdirect Australia. Ces données vérifiées par des experts ont ensuite alimenté deux modèles d’IA, PaLM 2 et AutoML, qui ont évalué de nouveaux fils indépendamment des évaluateurs humains.
The results were not identical. AutoML matched the human raters in 68% of cases, compared with PaLM 2’s 80%. The models were not simply checking for a list of symptoms: the researchers tested whether they could identify deeper emotional themes and possible causes in people’s own words. The paper appears in JMIR AI.
Les résultats n’étaient pas identiques. AutoML a égalé les évaluateurs humains dans 68 % des cas, contre 80 % pour PaLM 2. Les modèles ne se contentaient pas de rechercher une liste de symptômes : les chercheurs ont vérifié s’ils pouvaient repérer des thèmes émotionnels plus profonds et des causes possibles dans les propres mots des personnes. L’article est publié dans JMIR AI.
In practical terms, the method could give mental-health services another way to sort incoming narratives, support screening and triage, onboard patients, review their stories or power digital services. That could help professionals prioritize attention and personalize the first step in care, but the study presents those uses as possibilities. It does not establish a deployed clinical system, and the researchers acknowledge limitations.
Concrètement, cette méthode pourrait offrir aux services de santé mentale un autre moyen de trier les récits entrants, de contribuer au dépistage et au triage, d’intégrer les patients, d’examiner leurs récits ou d’alimenter des services numériques. Elle pourrait aider les professionnels à hiérarchiser les besoins et à personnaliser la première étape des soins, mais l’étude présente ces usages comme des possibilités. Elle n’établit pas l’existence d’un système clinique déployé, et les chercheurs reconnaissent certaines limites.
The finding is therefore a measured one: an AI model aligned with human judgment in four out of five test cases after training on expert-verified material. Ahmed’s team has shown a research pathway for reading large volumes of personal narratives; health-care organizations would still need to determine how such systems perform beyond this evaluation and how they fit into real patient care.
La conclusion doit donc être mesurée : un modèle d’IA s’est aligné sur le jugement humain dans quatre cas de test sur cinq après avoir été entraîné sur des données vérifiées par des experts. L’équipe d’Ahmed a montré une piste de recherche pour analyser de grands volumes de récits personnels ; les organismes de santé devront encore déterminer comment ces systèmes se comportent au-delà de cette évaluation et comment ils peuvent s’intégrer aux soins réels.