7月16日
11:31
11:31官方一手arXiv: OpenAI@Minh Hua, Rita Raley
2019年OpenAI发布两百万GPT-2输出以检测机器生成文本,但这些输出不完整且含语法错误。论文认为当前对齐技术(损失函数、奖励模型、基准测试)只是优化文化的最新表现,无法区分低概率文本是错误还是创新。批评者指出这种优化范式在五年内取得了合法语言的裁判权,却缺乏判断力。
事件专题

推荐理由:这篇论文点出了一个关键问题:AI生成文本的优化可能走偏了,不只是工程进步,还牵扯价值观判断。适合想理解技术背后隐患的人。
6月24日
12:00
12:00官方账号arXiv cs.AI@Adhitya Charan, Adwaid Suresh, Anuj Kumar, Aparna A, Dhanakumar K, Dharun M S, Dinesh G, Goutham Kumar Reddy K, Harshini V M, Jenifa D, Jona Delcy C A, Kathirvel S, Killi Uma Maheswara Rao, Kiruthik Kanna M, Kurra Vishnu Sai, Madhumithaa G K, Navin Kumar, Ram Charan Golla, Revathi T, Rishikkanth R, Sanjay Krishna M, Surendra Vendra
BluTrain是一个用标准C++和CUDA实现的AI训练框架。在8-GPU 6000 Ada系统上训练124M参数GPT-2模型(FP32),其吞吐量达407K tokens/s,比PyTorch的395K tokens/s高约3%。同时内存占用减少22%,且严格保持数值精度。框架包含原生实现的张量模块、反向模式自动微分、线性代数库、缓存分配器、分布式执行和MLIR编译器。
推荐理由:这个新框架用C++从头写,训练GPT-2比PyTorch快3%且省内存22%,适合追求极致性能的开发者。
6月18日
10:57
10:57官方账号arXiv cs.LG@Amiri Hayes, Belinda Li, Jacob Andreas
研究者提出用程序合成方法反向工程Transformer注意力头。他们先计算注意力矩阵,再让预训练语言模型生成Python程序来重现注意力模式。在GPT-2、TinyLlama-1.1B和Llama-3B上,不到1000个程序实现了平均IoU>75%。替换25%的注意力头仅导致16%的困惑度增加,并在下游问答基准上保持性能。
推荐理由:这篇论文用Python程序解释了注意力头怎么工作,还能直接用程序替换掉原始头,精度很高,想看模型内部机制的可以读。