论文精选00:14Meta新论文:LLM裁判被质疑时判决翻转率25%-91%Meta用Wiggle框架折腾了9个前沿模型,发现LLM裁判一被追问就翻案,最高91%翻转,这评测挺扎心。#Meta#Wiggle Framework#LLM裁判#模型评测elvis@omarsar0原文稍后读已读值得跟进有用关注 Meta
论文精选11:48多目标提示优化失效模式:梯度冲突与指令干扰做LLM评估或裁判定制的团队,这篇论文点出了多目标优化时容易踩的坑——梯度稀释和指令干扰,看完能帮你避开无效的提示优化策略。#LLM裁判#多目标优化#文本梯度#提示优化aarXiv cs.AI@Parth Darshan, Abhishek Divekar原文稍后读已读值得跟进有用关注 LLM裁判