8月25日
01:38
8月21日
11:29
01:39
01:39lmarena.ai@lmarena_ai
Muse Spark 1.2 (xHigh) 模型在 Bash Recovery 基准上提升了 11.4%。该模型在 Confirmed Success 指标上提升了 6%。Praise vs. Complaint 指标下降了 5.7%。Steerability 指标下降了 2.5%。Tool Hallucination 指标提升了 1.1%。

推荐理由:Muse Spark 1.2 (xHigh) 模型发布了,在处理命令行错误上提升明显,用户反馈也更好,但纠错和引导能力略有下降。
8月20日
10:20
10:20官方账号arXiv cs.LG@Zachary Speck, Asa Shepard
使用124M参数的GPT - 2模型在OpenWebText数据集上训练32个模型,每个模型在第200步时替换一行批次数据测试示例影响,发现示例暴露后50步预测更好但最终无差异,跨熵等基准测试也显示无显著差异。
推荐理由:GPT - 2团队做了小规模单例反事实实验,测试示例学习后效果,和其他条件对比结果很有意思。
7月29日
10:29
7月14日
20:58