Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
A video may spend most of its time in a neutral or transitional state, then turn emotionally charged for only a few seconds. Traditional systems often label the whole clip anyway. At Northwestern Polytechnical University, Professor Xie Songyun and researchers at the School of Artificial Intelligence have built a dataset designed to find that peak instead, and their tests lifted eight emotion-recognition algorithms from 34.7% to 38.5% average accuracy.
Une vidéo peut passer la majeure partie de son temps dans un état neutre ou transitoire, puis devenir émotionnellement chargée pendant quelques secondes seulement. Les systèmes traditionnels étiquettent pourtant souvent l’ensemble du clip. À l’Université polytechnique du Nord-Ouest, le professeur Xie Songyun et des chercheurs de l’École d’intelligence artificielle ont constitué un jeu de données conçu pour repérer ce pic, et leurs tests ont fait passer la précision moyenne de huit algorithmes de reconnaissance des émotions de 34,7 % à 38,5 %.
The team calls the multimodal dataset FIRMED. Participants watched experimental videos, immediately replayed them and marked one or more obvious emotional moments, reporting both category and intensity. That immediate recall was intended to avoid interrupting natural emotion and physiological-signal collection while reducing the memory bias that can come with delayed reporting. The researchers then centered a four-second emotion event window on each mark: two seconds before it and two seconds after it.
L’équipe a baptisé ce jeu de données multimodal FIRMED. Les participants ont regardé des vidéos expérimentales, les ont immédiatement repassées et ont marqué un ou plusieurs moments émotionnels évidents, en indiquant à la fois la catégorie et l’intensité. Ce rappel immédiat devait éviter d’interrompre la collecte des émotions naturelles et des signaux physiologiques, tout en réduisant le biais mémoriel susceptible d’apparaître lorsque les réponses sont recueillies plus tard. Les chercheurs ont ensuite centré sur chaque marque une fenêtre d’événement émotionnel de quatre secondes : deux secondes avant et deux secondes après.
Ablation comparisons found that four seconds balanced completeness and precision; a five-second window diluted features associated with surprise and disgust, while weakening fear-related alpha suppression and happiness-related gamma enhancement. In a check of 150 randomly selected records, two independent reviewers reached a Cohen’s kappa of 0.96 for emotion-category agreement, and 97.7% of time markers fell within one second.
Les comparaisons par ablation ont montré que quatre secondes constituaient un compromis entre exhaustivité et précision ; une fenêtre de cinq secondes diluait les caractéristiques associées à la surprise et au dégoût, tout en atténuant la suppression alpha liée à la peur et l’amplification gamma liée au bonheur. Lors d’une vérification portant sur 150 enregistrements sélectionnés aléatoirement, deux évaluateurs indépendants ont obtenu un kappa de Cohen de 0,96 pour l’accord sur les catégories émotionnelles, et 97,7 % des marqueurs temporels se situaient à moins d’une seconde.
The practical shift is from asking which emotion fills a video to asking when the signal becomes meaningful. That could help a human-computer interface respond at the most emotionally charged instant, let mental-health screening focus on clinically meaningful segments, or support real-time warnings in wearable devices. Those uses are proposed applications, not deployments described in the study.
Le changement pratique consiste à ne plus demander quelle émotion imprègne une vidéo, mais quand le signal devient significatif. Cela pourrait aider une interface homme-machine à réagir au moment le plus chargé émotionnellement, permettre au dépistage en santé mentale de se concentrer sur les segments cliniquement importants ou favoriser des avertissements en temps réel sur des appareils portables. Ces usages sont des applications proposées, et non des déploiements décrits dans l’étude.
So what changes now? For researchers building emotion models, the result offers a more precise labeling method and a measurable gain across eight representative algorithms, with deeper spatiotemporal models benefiting most. The reported evidence comes from the NWPU team’s evaluation.
Qu’est-ce qui change maintenant ? Pour les chercheurs qui développent des modèles d’émotions, le résultat offre une méthode d’étiquetage plus précise et un gain mesurable avec huit algorithmes représentatifs, les modèles spatio-temporels plus complexes étant les principaux bénéficiaires. Les éléments présentés proviennent de l’évaluation menée par l’équipe de la NWPU.