论文精选10:56Signed-Permutation Coordinate Transport for RMSNorm Transformers这篇论文说清了为什么RMSNorm模型用排列对齐不够,必须考虑符号。实验数据很具体,SAE重建、情感引导效果对比鲜明,对做模型对齐和可解释性的人很有用。#RMSNorm#TinyLlama#Qwen#坐标传输aarXiv cs.LG@John Sweeney原文稍后读已读值得跟进有用关注 RMSNorm
论文10:57程序合成解释Transformer注意力机制这篇论文用Python程序解释了注意力头怎么工作,还能直接用程序替换掉原始头,精度很高,想看模型内部机制的可以读。#GPT-2#TinyLlama#Llama-3B#可解释性aarXiv cs.LG@Amiri Hayes 等 3 人原文稍后读已读值得跟进有用关注 GPT-2