09:35官方账号arXiv cs.AI@Cameron Cagan, Pedram Fard, Jiazi Tian, Jingya Cheng, Shawn N. Murphy, Hossein EstiriPythia是一个多智能体系统,可自主编写并优化临床概念提取提示词,无需人工工程或微调。在本地运行的开源模型上,Pythia利用开发集的敏感度和特异度选择提示词。与基于词典的方法在72个症状和400份临床笔记上比较,Pythia的平均敏感度为0.76,特异度为0.95;词典则分别为0.82和0.76。对于词典将所有笔记均标记为正的14个概念,Pythia通过要求现在时、患者归因的发现,恢复了平均0.97的特异度。在低于2%患病率的概念上,Pythia的敏感度转移出现0.25的平均差距,而BERT分类器在相同开发集上微调后,敏感度仅为0.23,且低于约5%患病率时降为零。论文Pythia多智能体提示词优化推荐理由:看这篇论文你就知道,不用微调也能高效提取临床症状。Pythia靠多智能体自己写提示词,敏感度0.76、特异度0.95,比传统词典和BERT都稳,还能本地部署。原文稍后读已读值得跟进有用关注 Pythia
10:56官方账号arXiv cs.LG@Byung Gyu Chae该研究在Pythia语言模型中提取Transformer层雅可比矩阵的松弛谱,直接测量了弛豫态密度(TDOS)、记忆自能、遗忘间隙、记忆核和红外临界指数。测量发现慢弛豫模式呈现红外累积,产生近似平坦的TDOS(ρ(λ)~λ^{-0.1})和标度无关的记忆核(K(t)~t^{-1})。记忆自能在早期优化中出现瞬态最大值,随后松弛到近临界亚稳态,此时遗忘间隙最小、集体磁化率最大。这些定量实验证据表明Transformer动力学受红外集体组织支配,且该行为在不同训练阶段、网络深度和模型规模下均可复现。论文PythiaTransformer认知场理论推荐理由:这篇论文用Pythia模型实测了Transformer内部动力学的红外组织现象,发现记忆核呈标度无关性,挺硬核的理论研究。原文稍后读已读值得跟进有用关注 Pythia
10:41官方账号arXiv cs.LG@Juliana Li, Diya Sreedhar论文发现小型语言模型在预训练中学会的代词-性别规则(准确率0.94)会在3500步后自然消失,尽管训练数据仍包含该规则。这种未在损失曲线上反映的反转现象称为natural ungrokking。规则存留由支持频率预测:在2个语料、3个预算、3个种子的16次未干预运行中,支持频率决定规则命运。该动态出现在公开Pythia检查点中,遗忘顺序按模型规模排序。控制不对称:反转支持证据可破坏规则,但即使注入450倍支持也无法恢复。论文Natural UngrokkingPythia预训练推荐理由:这篇论文发现了模型训练中规则自然遗忘的规律,并且能预测和控制——破坏容易恢复难,对理解LLM行为很有启发。原文稍后读已读值得跟进有用关注 Natural Ungrokking