阿里國際站測試13款 AI 模型:最佳僅完成61.7%真實商貿任務

阿里巴巴國際站(Alibaba.com)在 GitHub 發佈公開測試工具 CommerceAgentBench,對13個 AI 模型家族在107項真實商貿任務上的表現進行評分,結果於2026年9月公佈。測試採用通過/不通過制,僅當任務正確完成才計分,例如商品須以正確屬性上線、貨運須預訂在真實存在的航線上。
得分最高的是 Claude Opus 5,任務完成率為61.7%。阿里國際站總裁張闊9月9日在《財富》撰文稱,這一分數"高到足以有用,也低到足以構成警示"。測試覆蓋採購、物流、商品上架、履約及售後服務等環節。
據測試結果,AI 代理在到岸成本核算、退貨糾紛和多段運輸路線等需要跨多步驟保持信息的任務上表現最差。另據 PYMNTS Intelligence 數據,約1.32億美國成年人曾在 AI 輔助下購買零售商品,其中亞馬遜佔此類購買的59%。
來源:https://www.pymnts.com/news/artificial-intelligence/2026/commerce-test-shows-where-ai-agents-break-down/
這篇內容的出處與狀態
- 署名
- OceanAlt 編輯部
- 首次發佈
- 2026-09-19
- 最後更新
- 2026-09-19
- 內容性質
- 快訊
- 原始資料
- 查看原文 ↗
相關閱讀
付款前把收款地址粘進去,看它有沒有上過制裁名單、混幣器或詐騙標籤。


