Qwen团队与淘天发布E-Commerce Bench:让AI在模拟网店中经营一年,测试长程商业能力
该基准要求模型用 10 万元本金在一年内经营网店,面对真实市场数据和供应商谈判,结果显示顶尖模型可盈利 14 倍,但多数模型在反欺诈、谈判和长程学习上表现不佳。
AI解读:E-Commerce Bench的推出是因为现有AI评测多限于有明确终点的任务(如找宝藏、写报告),而真实商业经营没有终点,模型需在动态市场中持续决策。该基准用淘宝和天猫的真实数据模拟 365 天的网店经营,模型必须管理库存、现金流、供应商谈判和促销,这比传统benchmark更贴近实际。对开发者和企业来说,它能揭示模型在长程规划、反欺诈和谈判上的短板——例如,即使最赚钱的模型欺诈防范排名靠后,而多数模型不会随时间改进砍价。这项评测让模型能力的比较更细化,但正如作者承认,它离完美还很远,短期内普通用户无需关注,但AI供应商可借此定向优化。
Qwen团队(阿里通义实验室)联合淘天集团发布E-Commerce Bench,一个用于评估大语言模型作为电商商家在真实市场中长程经营能力的基准。模型需在一年内用 10 万元本金开设网店,进行选品、供应商谈判、定价、促销、库存与现金流管理等决策,并面对市场的不确定性。评测结果旨在衡量模型在盈利、现金流管理、谈判质量、反欺诈、运营效率、执行力和长程学习等维度的表现。该基准的数据、代码和论文已公开(arXiv:2608.30730)。
评测设计:确定性内核加真实数据
E-Commerce Bench的环境设计强调真实性与可复现性。市场数据直接来自淘宝和天猫平台,包括 6,886 个商品、60 个品类、576 个供应商和 12 种店型,全年日历固定了 10 个市场事件和 8 场促销。
模型每天有 600 分钟(早八点到晚六点)的时间预算,每次工具调用都消耗时间,例如查余额 10 分钟、开店 60 分钟、给供应商发消息 30 分钟。资金管理采用三账户结算,收入需经发货、扣除佣金、等待 9 天才能提现。库存按件按天收费,发货速度分三档,退货率受品类基线、次品率、定价和发货速度影响。
用户需求完全不采样,销量由品类基础需求、价格响应、周末、促销、季节性、事件、店铺信誉等因子计算确定。供应商报价由确定性内核计算,避免随机性;LLM渲染层仅负责将内核决定的报价和回应进行对话式呈现,防止模型通过越狱或欺骗获取不公平优势。
- 三账户结算模拟现金流延迟:所有成本从银行账户扣除,收入需等待 9 天才能提现。
- 库存成本持续产生:即使关店也需支付仓储费,除非亏本清货。
- 信誉分影响流量:退货扣 0.6 分,取消订单扣 1.0 分,信誉过低时流量降至正常的 15%。
评测结果:表现参差,个别维度差距显著
评测针对 18 个模型各进行了 5 轮完整模拟,结果差异数个数量级。GPT-5.6 Sol资产达 143 万,是起点的 14.31 倍,而Qwen3.5-Plus平均资产仅剩 1,100 元。开源阵营最佳为Qwen3.8-Max-Preview,回报 4.16 倍,但总榜前四名均为闭源模型。值得注意的是,90 次评测中有 10 次破产,其中GPT-5.5在两个月内因过度铺货导致资金链断裂。
从分维度看,谈判质量维度:没有模型能压至供应商成本底线,Claude Opus 4.7得分 0.811(0.5 分意味着不还价),Kimi K2.6得分 0.596。反欺诈维度差距最大:流向欺诈供应商的采购占比最高相差超 160 倍,Claude Opus 4.7仅 0.12%,Qwen3.5-Plus高达 20.11%,而 576 家供应商中有 152 家(26.4%)为欺诈方。
运营效率上,Fable5每次工具调用平均带来 479 元收益,高于总资产第一的GPT-5.6 Sol的 363 元,且调用次数少 59.9%。74% 的调用用于发货、前进、提现和上架等操作,而供应商对话仅占 6%,调价仅占 0.66%。
长程学习方面,通过AnchorRatio指标评估重复进货价格,1.0 表示与随机顺序无异。8,647 次重复进货中,18 个模型仅 2 个低于 1.0,中位数为 1.369,15 个模型显著偏离零假设,向更贵方向移动。只有Qwen3.8-Max-Preview显示明显学习迹象,其AnchorRatio为 0.88。
- 反欺诈的关键在于是否下单:模型接触的欺诈供应商占比类似,Claude Opus 4.7对接触的欺诈商最终下单仅 4.0%,而GPT-5.6 Sol高达 31.7%。
- 高总资产模型并非全能:GPT-5.6 Sol在反欺诈项排名第 16,但未因此破产。
作者观点:单一指标会掩盖真实表现
Qwen团队指出,若只看年末总资产,会误以为GPT-5.6 Sol全面领先,但其反欺诈排名第 16。18 个模型中没有一个能在七个维度上同时领先,前三名各有短板,垫底的也可能在某一维度不差。
团队强调构建评测时避免让LLM扮演供应商,以减少采样噪声,这一思路适用于长程任务评测的通用设计。他们也承认基准离饱和仍远,七个维度的最好成绩分散于六个模型,显示未来模型的提升空间。
- 作者称:‘若只看年末总资产,你会以为GPT-5.6 Sol全面领先,但它反欺诈排第 16。’
- 来源信息来自论文预印本(arXiv:2608.30730),未经同行评审。