13:13官方账号阿里通义 Qwen@Alibaba_Qwen73°CommerceAgentBench基准测试专注于真实商业需求,而非仅测试模型回答能力。该基准测试显示最佳整体完成率约为62%。Qwen3.8-Max在评估的开源权重模型中表现最强,能够处理复杂商业工作流。该基准已开源,可在GitHub查看完整结果。AI模型CommerceAgentBenchQwen3.8-Max商业代理推荐理由:阿里发布商业代理基准测试,Qwen3.8-Max在复杂商业工作流中表现最佳,完成率达62%。原文稍后读已读值得跟进有用关注 CommerceAgentBench