论文11:24双维度LLM框架自动化内容相似性分析这篇论文提出了一种新的双维度LLM框架,可以更有效地分析大规模评估中的内容冗余问题,对于内容筛选和自适应测试有重要意义。#LLM#内容相似性分析#AISA框架#自适应测试aarXiv cs.AI@Jing Huang 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文10:46LLM自动生成认知决策场景,复杂度验证达心理测量标准这篇论文讲怎么用LLM自动造认知决策场景,还验证了复杂度靠谱,做AI评估或心理学实验的可以看看。#LLM#决策场景#复杂度验证#心理测量aarXiv: DeepSeek@Abdalla Doleh 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文12:08用项目反应理论(IRT)评估AI安全基准这篇论文用IRT给192个模型的安全基准做心理测量,能把评测成本砍掉97%以上,还能识破模型故意考差或API后门换模型。#项目反应理论#AI安全#安全基准#心理测量aarXiv cs.AI@Joshua Fonseca Rivera 等 4 人原文稍后读已读值得跟进有用关注 项目反应理论