8月14日
11:33
11:33官方账号arXiv cs.LG@Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel
研究者推出LITTLECURRICULUM,一个包含880亿token的预训练语料库,内容限定为美国小学五年级以下的知识范围。他们用该语料从头训练出5B参数的LittleLearner模型,模型语言能力足以进行开放式评测,但知识边界清晰对应课程大纲。实验表明,通过后训练和上下文学习注入新知识,LittleLearner能更好利用已有知识,但无法提升超出课程范围的能力。该研究为可控条件下研究模型知识获取提供了沙盒环境。
推荐理由:想搞懂模型知识边界怎么控制?这篇论文用小学课程语料训练了个5B模型,还公开了数据和模型,适合研究预训练数据影响的人看。
7月7日
11:38
11:38官方账号arXiv cs.AI@Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
本文提出SearchGen-20K数据集和SearchGen-Bench基准,包含20,839条提示,覆盖12类失败模式和22个领域。在SearchGen-Bench上,前沿开放视觉生成模型得分仅21-28分(满分100),比现有基准低40分。作者发现朴素搜索无效,会引入噪声,并识别出生成器特有的知识边界,提出"先教后搜"协同训练框架,即使最小版本也带来单调改进。
推荐理由:想了解视觉生成模型为什么画不出新角色或近期事件?这篇论文用具体数据告诉你差距在哪,还给了个可复现的协作搜索方案。