8月20日
10:20
10:20官方账号arXiv cs.LG@Zachary Speck, Asa Shepard
使用124M参数的GPT - 2模型在OpenWebText数据集上训练32个模型,每个模型在第200步时替换一行批次数据测试示例影响,发现示例暴露后50步预测更好但最终无差异,跨熵等基准测试也显示无显著差异。
推荐理由:GPT - 2团队做了小规模单例反事实实验,测试示例学习后效果,和其他条件对比结果很有意思。