论文精选10:12CAREBench:评估LLM情绪理解的新基准,聚焦认知评价推理做AI情感计算或人机交互的团队,这个基准能帮你发现模型在情绪理解上的真实短板——别被下游指标骗了,建议点开看看评价推理链的设计。#LLM#情绪理解#评价理论#基准测试aarXiv cs.AI@Zhaoyue Sun 等 6 人原文稍后读已读值得跟进有用关注 LLM