论文10:12SAE 对比研究:Mamba 与 Pythia 潜在表征 99.98% 对齐有人拿 SAE 逐个对比 Mamba 和 Pythia 的内部特征,99.98% 几乎一样,做可解释性的可以看看。#Mamba#Pythia#SAE#可解释性aarXiv cs.LG@Rithin Nagaraj 等 4 人原文稍后读已读值得跟进有用关注 Mamba
论文精选73°09:36滞后耦合:模型内部表征可读性先于因果性MIT发现AI模型内部表征可读性先于因果性,这一滞后现象在12B参数规模下依然存在,挑战了传统模型理解。#Pythia#滞后耦合#内部表征#因果性aarXiv cs.AI@Xining Xun原文稍后读已读值得跟进有用关注 Pythia
论文09:35Pythia:无需微调的多智能体临床症状检测系统看这篇论文你就知道,不用微调也能高效提取临床症状。Pythia靠多智能体自己写提示词,敏感度0.76、特异度0.95,比传统词典和BERT都稳,还能本地部署。#Pythia#多智能体#提示词优化#临床文本挖掘aarXiv cs.AI@Cameron Cagan 等 6 人原文稍后读已读值得跟进有用关注 Pythia
论文10:56红外组织与临界认知场形成:Transformer动力学研究这篇论文用Pythia模型实测了Transformer内部动力学的红外组织现象,发现记忆核呈标度无关性,挺硬核的理论研究。#Pythia#Transformer#认知场理论#红外组织aarXiv cs.LG@Byung Gyu Chae原文稍后读已读值得跟进有用关注 Pythia
论文10:41自然 Ungrokking:预训练中哪些规则存留的不对称控制这篇论文发现了模型训练中规则自然遗忘的规律,并且能预测和控制——破坏容易恢复难,对理解LLM行为很有启发。#Natural Ungrokking#Pythia#预训练#规则学习aarXiv cs.LG@Juliana Li, Diya Sreedhar原文稍后读已读值得跟进有用关注 Natural Ungrokking