OceanAltOceanAlt
Agent 經濟2026-09-19事件發生 2026-09-182 分鐘讀完

阿里國際站測試13款 AI 模型:最佳僅完成61.7%真實商貿任務

OOceanAlt 編輯部轉載來源
分享:XLinkedInFacebookTelegramWhatsApp微博🖼 海報(英文)

阿里巴巴國際站(Alibaba.com)在 GitHub 發佈公開測試工具 CommerceAgentBench,對13個 AI 模型家族在107項真實商貿任務上的表現進行評分,結果於2026年9月公佈。測試採用通過/不通過制,僅當任務正確完成才計分,例如商品須以正確屬性上線、貨運須預訂在真實存在的航線上。

得分最高的是 Claude Opus 5,任務完成率為61.7%。阿里國際站總裁張闊9月9日在《財富》撰文稱,這一分數"高到足以有用,也低到足以構成警示"。測試覆蓋採購、物流、商品上架、履約及售後服務等環節。

據測試結果,AI 代理在到岸成本核算、退貨糾紛和多段運輸路線等需要跨多步驟保持信息的任務上表現最差。另據 PYMNTS Intelligence 數據,約1.32億美國成年人曾在 AI 輔助下購買零售商品,其中亞馬遜佔此類購買的59%。

來源:https://www.pymnts.com/news/artificial-intelligence/2026/commerce-test-shows-where-ai-agents-break-down/

分享:XLinkedInFacebookTelegramWhatsApp微博🖼 海報(英文)

這篇內容的出處與狀態

署名
OceanAlt 編輯部
首次發佈
2026-09-19
最後更新
2026-09-19
內容性質
快訊
原始資料
查看原文 ↗

引用這篇內容

OceanAlt 編輯部(2026)。《阿里國際站測試13款 AI 模型:最佳僅完成61.7%真實商貿任務》。OceanAlt。https://oceanalt.com/zh/articles/flash-auto-mu7dumqi-hlnu(訪問日期:2026-09-19)

本文遵循 編輯準則與事實核查標準。發現錯誤請告訴我們,核實後會在此處公開更正。

先試一下 · 免費、不用註冊

付款前把收款地址粘進去,看它有沒有上過制裁名單、混幣器或詐騙標籤。

這套判斷也可以放進你自己的產品

一行代碼,不碰你的樣式和 JS。同一套結算前風險判斷可以出現在你的文章、你的錢包確認頁,或者作為接口供你的 Agent 在付款前調用。

組件不收集讀者身份。接入不代表 OceanAlt 對你的產品或頁面上的地址作安全背書。