论文Agent 与开发者精选10:38LLM在上下文学习中展现贝叶斯预测能力这是篇挺有意思的论文,作者用隐藏马尔可夫模型数据测试了六款开源LLM,发现它们在上下文学习中能近似贝叶斯预测,还做了干预实验验证了这一点。#LLM#贝叶斯预测#残差流#提示词工程aarXiv cs.LG@Daniel Balcells 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者多源确认精选09:23DeepSeek-V4-Flash残差流使用机制研究DeepSeek团队揭秘四流残差通路实际使用方式,发现模型并未充分利用全部流容量。#DeepSeek-V4-Flash#残差流#mHC#模型架构3 个信源在谈事件专题aarXiv: DeepSeek@Pengxiang Zhao 等 5 人4 个信源在谈原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
论文09:44语言模型中的星空地图表示新研究发现大模型脑子里有张星空图,还能解码出来,挺有意思的。#语言模型#星空地图#可解释性#表示学习aarXiv cs.LG@Aleksandr Berdnikov, Yevgeny Liokumovich原文稍后读已读值得跟进有用关注 语言模型
论文11:11SemRF:语言模型残差流动态的语义参考框架这篇论文提出SemRF框架,帮你看清语言模型内部计算如何逐层演变,用Voronoi图定位知识分布,比只看激活值更精确。#SemRF#语言模型#残差流#模型可解释性aarXiv cs.LG@Jian Gu 等 4 人原文稍后读已读值得跟进有用关注 SemRF