Thursday, 27 August 2026

Aube.

News of progress
PilotSingle source

电商AI智能体接受严苛实战考:107项任务最高仅56.1分

Languages for this article
Original · 中文ENFR

Originally written in Chinese. 3 languages available; yours is one click away.

约300封邮件、5383条海关记录、多个彼此连接的业务系统,这不是聊天机器人熟悉的考卷。RealReplicaBench把这些材料放进电商工作流,要求AI完成供应商选择、邮件标签、回复草稿和日历安排,或把海关数据整理成采购控制塔。经过107个真实商业任务测试,参评的13个模型没有一个达到60分,最高分也只有56.1分

最高分来自Claude Opus 5。在Accio Work执行框架中,它通过了66/107项任务;在OpenClaw上是60/107,在PI上是65/107。这组结果显示,模型本身并不是唯一变量:执行框架如何连接工具、管理状态,也会改变任务能否走到终点。Accio Work是阿里旗下的AI工作台,目标是帮助商家统一管理和操作多个平台店铺。

这套评测最严厉的地方,是它拒绝给“差不多完成”计分。供应商是否选对,会影响采购;价格是否算对,会影响商品发布;物流路线是否满足时限,会影响后续订舱。哪怕任务已经完成80%,只要剩下的20%仍需要用户手动处理,而且这20%可能正是关键环节,对用户来说就还没有形成可直接使用的交付。

因此,测试环境不只给出题目,还复刻了用户界面、浏览器操作、命令行工具、API、文件系统和后台状态。物流履约任务要求AI为一票从中国到美国的运单枚举路线,把海运、拖车、尾程、保险、清关、Bond和平台费纳入考虑,排除超过30天或港口衔接不成立的方案,最后完成Booking和Shipment Verification。判定依据不是模型说自己做完了,而是环境里是否真的生成了Shipment ID等结果。

这对商家意味着什么?今后选择电商AI,不能只比较模型答题分数,还要检查它能否在真实系统里持续保持上下文、正确传递动态ID,并把结果交给下一环节。RealReplicaBench的107项任务来自约160万次完整对话、20万条商业执行轨迹和2000条高价值工作流;团队计划继续增加任务,并将评测用于模型评估、训练优化和模型路由。商家得到的是更接近实际工作的筛选工具,模型团队则必须面对一个更具体的标准:不是“会不会做”,而是“能不能交付”。

56.1分13个模型在107项电商任务中的最高得分

Sources — read the originals(Paris time)

爱范儿ZH
0000

Read next

Comments

Loading the thread…

Sign in to leave a comment. Sign in