论文12:09测试时缩放推理大模型:推理机制、评估与可复现性研究这篇论文把测试时缩放拆成三种结构,还给了评估和复现规范,做推理模型的人可以参考。#测试时缩放#推理模型#评估方法#可重复性aarXiv cs.LG@Mohsen Hariri 等 14 人原文稍后读已读值得跟进有用关注 测试时缩放
论文Agent 与开发者10:46ReproRepo:利用GitHub Issue扩展可重复性审计这篇论文提出了一个可扩展的框架,用GitHub Issues来测试LLM智能体找论文代码的复现问题,比现有手动基准好很多,值得看。#ReproRepo#GPT-5.5#Codex#可重复性aarXiv cs.AI@Shanda Li 等 8 人原文稍后读已读值得跟进有用关注 ReproRepo
论文12:53十年AI研究可重复性分析:56800篇论文揭示文档实践改进这篇论文用56800篇数据告诉你,AI研究的可重复性在过去十年大幅提升,代码共享从11%涨到64%,而且不是靠强制清单推动的。#可重复性#AI研究#开源科学#文档实践aarXiv cs.AI@Kevin L Coakley 等 4 人原文稍后读已读值得跟进有用关注 可重复性
论文10:50LLM 自动化社会科学可重复性评估,效果优于人工社会科学研究者终于有了低成本的重复性验证工具——LLM 比人工更高效且更一致,做元分析或期刊审稿的团队可以直接用这套方法。#LLM#可重复性#社会科学#自动化评估aarXiv cs.AI@Tobias Holtdirk 等 10 人原文稍后读已读值得跟进有用关注 LLM
论文精选13:26多级标注建模提升AI评估可重复性做AI评估和模型安全测试的团队,终于有了量化标注者偏差的方法论——多级建模直接告诉你需要多少标注才能得到可靠结论,建议做实验设计的点开看看。#可重复性#评估方法#标注者偏差#统计建模aarXiv cs.LG@Deepak Pandita 等 4 人原文稍后读已读值得跟进有用关注 可重复性