论文11:06RoboWits:机器人创造性问题解决面临意外挑战机器人研究者终于有了一个专门测试认知推理和意外应对的基准——RoboWits 揭示了 VLA 模型在变异任务上的脆弱性,做机器人操作和具身智能的团队值得关注这个评估框架。#机器人#基准测试#认知推理#视觉-语言-动作模型aarXiv cs.AI@Chunru Lin 等 8 人原文稍后读已读值得跟进有用关注 机器人
论文精选10:12CAREBench:评估LLM情绪理解的新基准,聚焦认知评价推理做AI情感计算或人机交互的团队,这个基准能帮你发现模型在情绪理解上的真实短板——别被下游指标骗了,建议点开看看评价推理链的设计。#LLM#情绪理解#评价理论#基准测试aarXiv cs.AI@Zhaoyue Sun 等 6 人原文稍后读已读值得跟进有用关注 LLM