#LLM评估
共 47 条 · 7 天 4 条 · 30 天 8 条
5月25日
5月22日
SWE-Mutation:评估LLM生成测试套件可靠性的新基准
软件工程团队和AI研究者终于有了一个严谨的测试套件质量评估工具——SWE-Mutation能帮你判断LLM生成的测试是否真的可靠,做自动化测试或代码修复的开发者值得关注。
5月20日
MediLongChat:合成长期医疗对话数据集,评估AI记忆能力
医疗AI开发者终于有了一个能真正测试长期记忆能力的基准——MediLongChat让跨会话推理变得可评估,做医疗对话系统的团队建议直接拿来跑跑看。
5月19日
5月12日
5月11日
论文11:42
VecCISC:通过推理轨迹聚类降本增效,提升置信度自一致性VecCISC通过聚类与过滤显著降低计算开销,对工业界部署高精度推理模型具有实际价值,尤其适合长轨迹场景。
arXiv cs.AI原文