论文精选72°11:39AMEL:对话历史极性偏差影响LLM判断做AI评估、内容审核或自动化打分的团队,这条研究直接告诉你为什么你的LLM裁判可能不靠谱——负面历史会让它更苛刻,建议每个测试项都开新对话。#LLM评估#对话偏差#上下文影响#自动化裁判aarXiv: OpenAI@Sid-ali Temkit原文稍后读已读值得跟进有用关注 LLM评估