论文Agent 与开发者10:23BrickBench:评估智能体乐高搭建能力的基准发布有人做了个让 AI 拼乐高的评测基准,智能体得选零件还得保证能真的拼出来,结果还是拼不过人类,挺有意思。#BrickBench#智能体#评测基准#BrickAgentaarXiv cs.AI@Peter Kulits 等 5 人原文稍后读已读值得跟进有用关注 BrickBench