Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

Les agents IA du e-commerce soumis à un test pratique impitoyable : 107 tâches, 56,1 points au maximum

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · chinois
电商AI智能体接受严苛实战考:107项任务最高仅56.1分
Traduction · français
Les agents IA du e-commerce soumis à un test pratique impitoyable : 107 tâches, 56,1 points au maximum
Original · chinois
RealReplicaBench用107个真实电商任务测试AI,13个模型最高仅得56.1分。
Traduction · français
RealReplicaBench a testé l’IA sur 107 tâches réelles de e-commerce : les 13 modèles évalués ont obtenu au mieux 56,1 points.
Original · chinois
评测不看“完成80%”,只有结果能被下一环节直接接手才算完成。
Traduction · français
« Réaliser 80 % » ne suffit pas : une tâche n’est considérée comme terminée que si le résultat peut être directement repris par l’étape suivante.
Original · chinois
测试环境复刻网页、文件和后台状态,模型必须留下可独立验证的业务结果。
Traduction · français
L’environnement de test reproduit les pages web, les fichiers et l’état des systèmes ; les modèles doivent laisser un résultat métier vérifiable de manière indépendante.
Original · chinois

约300封邮件、5383条海关记录、多个彼此连接的业务系统,这不是聊天机器人熟悉的考卷。RealReplicaBench把这些材料放进电商工作流,要求AI完成供应商选择、邮件标签、回复草稿和日历安排,或把海关数据整理成采购控制塔。经过107个真实商业任务测试,参评的13个模型没有一个达到60分,最高分也只有56.1分

Traduction · français

Environ 300 e-mails, 5383 déclarations douanières et plusieurs systèmes métier interconnectés : ce n’est pas le type de questionnaire auquel les chatbots sont habitués. RealReplicaBench a intégré ces éléments dans des workflows de e-commerce et demande à l’IA de sélectionner des fournisseurs, d’étiqueter des e-mails, de préparer des brouillons de réponse et de programmer des rendez-vous, ou encore de transformer des données douanières en tour de contrôle des achats. Après avoir été testés sur 107 tâches commerciales réelles, les 13 modèles évalués n’ont pas atteint 60 points ; même le meilleur score n’est que de 56,1 points.

Original · chinois

最高分来自Claude Opus 5。在Accio Work执行框架中,它通过了66/107项任务;在OpenClaw上是60/107,在PI上是65/107。这组结果显示,模型本身并不是唯一变量:执行框架如何连接工具、管理状态,也会改变任务能否走到终点。Accio Work是阿里旗下的AI工作台,目标是帮助商家统一管理和操作多个平台店铺。

Traduction · français

Le meilleur score revient à Claude Opus 5. Dans le framework d’exécution Accio Work, il a réussi 66/107 tâches ; sur OpenClaw, il en a réussi 60/107, et sur PI, 65/107. Ces résultats montrent que le modèle n’est pas l’unique variable : la manière dont le framework d’exécution connecte les outils et gère l’état des systèmes influe également sur la capacité à mener une tâche jusqu’à son terme. Accio Work est l’espace de travail IA d’Alibaba, conçu pour aider les commerçants à gérer et à utiliser de manière centralisée les boutiques présentes sur plusieurs plateformes.

Original · chinois

这套评测最严厉的地方,是它拒绝给“差不多完成”计分。供应商是否选对,会影响采购;价格是否算对,会影响商品发布;物流路线是否满足时限,会影响后续订舱。哪怕任务已经完成80%,只要剩下的20%仍需要用户手动处理,而且这20%可能正是关键环节,对用户来说就还没有形成可直接使用的交付。

Traduction · français

La sévérité de cette évaluation tient surtout à son refus d’accorder des points à une tâche « à peu près terminée ». Le choix du bon fournisseur peut influer sur les achats ; l’exactitude du calcul du prix peut avoir des conséquences sur la mise en ligne du produit ; la conformité de l’itinéraire logistique aux délais peut affecter la réservation ultérieure. Même si une tâche est réalisée à 80 %, elle n’est pas encore terminée pour l’utilisateur si les 20 % restants nécessitent toujours une intervention manuelle et que cette portion correspond précisément à une étape clé.

Original · chinois

因此,测试环境不只给出题目,还复刻了用户界面、浏览器操作、命令行工具、API、文件系统和后台状态。物流履约任务要求AI为一票从中国到美国的运单枚举路线,把海运、拖车、尾程、保险、清关、Bond和平台费纳入考虑,排除超过30天或港口衔接不成立的方案,最后完成Booking和Shipment Verification。判定依据不是模型说自己做完了,而是环境里是否真的生成了Shipment ID等结果。

Traduction · français

L’environnement de test ne se contente donc pas de fournir un énoncé : il reproduit aussi l’interface utilisateur, les opérations dans le navigateur, les outils en ligne de commande, les API, le système de fichiers et l’état des systèmes en arrière-plan. Dans les tâches d’exécution logistique, l’IA doit énumérer les itinéraires possibles pour une expédition de la Chine vers les États-Unis, en prenant en compte le transport maritime, le transport routier, le dernier kilomètre, l’assurance, le dédouanement, le Bond et les frais de plateforme. Elle doit écarter les options dépassant 30 jours ou dont les correspondances portuaires ne sont pas réalisables, puis finaliser le Booking et la Shipment Verification. Le critère de réussite n’est pas que le modèle affirme avoir terminé, mais que l’environnement ait réellement produit des résultats tels qu’un Shipment ID.

Original · chinois

这对商家意味着什么?今后选择电商AI,不能只比较模型答题分数,还要检查它能否在真实系统里持续保持上下文、正确传递动态ID,并把结果交给下一环节。RealReplicaBench的107项任务来自约160万次完整对话、20万条商业执行轨迹和2000条高价值工作流;团队计划继续增加任务,并将评测用于模型评估、训练优化和模型路由。商家得到的是更接近实际工作的筛选工具,模型团队则必须面对一个更具体的标准:不是“会不会做”,而是“能不能交付”。

Traduction · français

Qu’est-ce que cela signifie pour les commerçants ? À l’avenir, choisir une IA pour le e-commerce ne consistera pas seulement à comparer les scores obtenus aux questions ; il faudra aussi vérifier si elle sait préserver le contexte dans des systèmes réels, transmettre correctement les ID dynamiques et remettre le résultat à l’étape suivante. Les 107 tâches de RealReplicaBench sont issues d’environ 1,6 million de conversations complètes, 200 000 trajectoires d’exécution commerciale et 2000 workflows à forte valeur ; l’équipe prévoit de continuer à ajouter des tâches et d’utiliser l’évaluation pour l’évaluation des modèles, l’optimisation de leur entraînement et le routage des modèles. Les commerçants disposent ainsi d’un outil de sélection plus proche du travail réel, tandis que les équipes chargées des modèles doivent répondre à un critère plus concret : non pas « savent-ils le faire ? », mais « peuvent-ils le livrer ? ».

Revenir à l’article