8月4日
12:31
12:31官方账号arXiv cs.AI@Nicole Mitchell, Dhruv Agarwal, Maty Bohacek, Remi Denton, Roma Patel
这篇arXiv论文认为,语言模型拟人化且融入日常使用,可能引发认知、发展和社会情感层面的长期变化。作者主张NLP应转向长期测量用户行为变化,而非局限静态文本评估。论文参考社会科学中纵向数据测量方法,并与NLP计算手段结合。该框架用于在线识别问题行为,并纳入对齐流程以缓解长期风险。
推荐理由:一篇讲怎么测AI长期影响的论文,用社会科学的方法补NLP的短板。适合做AI安全和行为研究的人读。
8月1日
06:51
06:51官方账号Cohere@cohere
Cohere Labs的免费ML Summer School系列在Twitch直播中位列科技类频道第一。该系列已吸引来自20多个国家的观众。课程内容覆盖从NLP在大语言模型中的应用到科技行业职业发展等多个主题。下一期直播将于下周在twitch.tv/cohere_ai继续播出。

推荐理由:Cohere官方免费ML夏校直播,在Twitch科技类排第一,覆盖20多国,内容从NLP到求职都有,想入门大模型可以跟。
7月3日
09:57
09:57官方账号arXiv cs.AI@A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani
该论文分析了ACL Anthology中650篇提及LLM-as-a-Judge的论文,发现仅33篇关注低资源或多语言场景。研究发现存在不一致的评价结果、对LLM判断过度信任以及普遍依赖单一评判模型的问题。作者基于分析提出了针对多语言和低资源环境下使用LLM-as-a-Judge的具体建议。
推荐理由:这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。
5月22日