Les agents IA du e-commerce soumis à un test pratique impitoyable : 107 tâches, 56,1 points au maximum
Environ 300 e-mails, 5383 déclarations douanières et plusieurs systèmes métier interconnectés : ce n’est pas le type de questionnaire auquel les chatbots sont habitués. RealReplicaBench a intégré ces éléments dans des workflows de e-commerce et demande à l’IA de sélectionner des fournisseurs, d’étiqueter des e-mails, de préparer des brouillons de réponse et de programmer des rendez-vous, ou encore de transformer des données douanières en tour de contrôle des achats. Après avoir été testés sur 107 tâches commerciales réelles, les 13 modèles évalués n’ont pas atteint 60 points ; même le meilleur score n’est que de 56,1 points.
Le meilleur score revient à Claude Opus 5. Dans le framework d’exécution Accio Work, il a réussi 66/107 tâches ; sur OpenClaw, il en a réussi 60/107, et sur PI, 65/107. Ces résultats montrent que le modèle n’est pas l’unique variable : la manière dont le framework d’exécution connecte les outils et gère l’état des systèmes influe également sur la capacité à mener une tâche jusqu’à son terme. Accio Work est l’espace de travail IA d’Alibaba, conçu pour aider les commerçants à gérer et à utiliser de manière centralisée les boutiques présentes sur plusieurs plateformes.
La sévérité de cette évaluation tient surtout à son refus d’accorder des points à une tâche « à peu près terminée ». Le choix du bon fournisseur peut influer sur les achats ; l’exactitude du calcul du prix peut avoir des conséquences sur la mise en ligne du produit ; la conformité de l’itinéraire logistique aux délais peut affecter la réservation ultérieure. Même si une tâche est réalisée à 80 %, elle n’est pas encore terminée pour l’utilisateur si les 20 % restants nécessitent toujours une intervention manuelle et que cette portion correspond précisément à une étape clé.
L’environnement de test ne se contente donc pas de fournir un énoncé : il reproduit aussi l’interface utilisateur, les opérations dans le navigateur, les outils en ligne de commande, les API, le système de fichiers et l’état des systèmes en arrière-plan. Dans les tâches d’exécution logistique, l’IA doit énumérer les itinéraires possibles pour une expédition de la Chine vers les États-Unis, en prenant en compte le transport maritime, le transport routier, le dernier kilomètre, l’assurance, le dédouanement, le Bond et les frais de plateforme. Elle doit écarter les options dépassant 30 jours ou dont les correspondances portuaires ne sont pas réalisables, puis finaliser le Booking et la Shipment Verification. Le critère de réussite n’est pas que le modèle affirme avoir terminé, mais que l’environnement ait réellement produit des résultats tels qu’un Shipment ID.
Qu’est-ce que cela signifie pour les commerçants ? À l’avenir, choisir une IA pour le e-commerce ne consistera pas seulement à comparer les scores obtenus aux questions ; il faudra aussi vérifier si elle sait préserver le contexte dans des systèmes réels, transmettre correctement les ID dynamiques et remettre le résultat à l’étape suivante. Les 107 tâches de RealReplicaBench sont issues d’environ 1,6 million de conversations complètes, 200 000 trajectoires d’exécution commerciale et 2000 workflows à forte valeur ; l’équipe prévoit de continuer à ajouter des tâches et d’utiliser l’évaluation pour l’évaluation des modèles, l’optimisation de leur entraînement et le routage des modèles. Les commerçants disposent ainsi d’un outil de sélection plus proche du travail réel, tandis que les équipes chargées des modèles doivent répondre à un critère plus concret : non pas « savent-ils le faire ? », mais « peuvent-ils le livrer ? ».
Sources — lire les originaux(heure de Paris)
À lire ensuite
- Qwen-UI-Agent obtient 97,5 % sur AndroidDaily
- Les marketplaces indiennes transforment l’IA en copilote pour les vendeurs
- Un robot à double bras trie 1 816 colis en une heure lors d'une démonstration en direct, avec un coût en baisse de 70 % selon des informations publiques
- Le système Nvidia porte Claude Opus 5 à 100 % sur ARC-AGI-3
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter