8月25日
10:51
10:51官方账号arXiv cs.AI@Na Li, Yuchen Jiao, Changxiao Cai, Gen Li
精选
ConvergeFlow 是一种基于嵌入空间的流语言模型,通过约束数据预测器到标记嵌入的凸包,并仅用流匹配引起的均方误差目标进行训练。实验表明,ConvergeFlow 在 OpenWebText 上的性能与现有连续和离散扩散语言模型相当。
推荐理由:Na-Li66团队发布了ConvergeFlow,这是一种基于嵌入空间的流语言模型,它通过改进训练方法,在性能上与现有模型相当,值得一试。
8月22日
15:43
08:34
8月19日
23:40
8月11日
11:16
11:16官方账号arXiv cs.AI@Nathan Godey, Yoav Artzi
精选
Matryoshka训练框架将500M、1.5B和3B三个子模型堆叠进单一嵌套架构,端到端训练。相比独立训练基线,该套件在基准性能和困惑度上持平,但训练计算量减少36%。嵌套结构天然支持投机解码,吞吐量提升14-26%。论文还消融了关键架构选择,为构建强Matryoshka套件提供指导。
推荐理由:想省训练算力又不想掉性能?这个嵌套训练法把三个模型塞一个架构里,直接省36%算力,还顺带加速推理,值得一看。
7月30日
7月17日
11:30
11:30官方账号arXiv cs.AI@Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo
该论文提出通过公共讨论界面(如论坛评论)向大语言模型预训练数据注入恶意内容的攻击方法。作者引入HalfLife分析工具,用于评估网络爬虫数据中是否包含对抗性内容。实验表明,基于维基百科等传统数据源的投毒假设不适用于真实的大规模异构预训练语料库。研究强调第三方网页内容可能成为攻击语言模型预训练的潜在向量。
推荐理由:这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。
7月14日
19:54
19:54官方账号Decoder@Tomislav Bezmalinović
精选
Anthropic发布新研究,分析了Claude模型在不同语言中的价值表达。研究将数千个术语映射到四个核心维度。结果显示Claude在印地语中表现出更多温暖,在俄语中表现出更多严谨。这揭示了语言对AI回答的塑造作用,并提出了方法论问题。
事件专题

推荐理由:Anthropic发现Claude说印地语时更暖心,说俄语时更较真。有趣的研究,看看你的语言会影响AI怎么对你。
7月7日
03:26
03:26官方一手Anthropic: Transformer Circuits资讯
精选
研究者发现Claude模型内部存在一组可言语化的特权表征,这些表征形成全局工作空间。这些表征仅占模型内部状态的一小部分,但可用于报告、控制和推理。相比之下,模型的大部分处理是自动且不可言语化的。该研究揭示了语言模型内部计算的可解释性结构。
推荐理由:这篇文章发现了Claude模型内部有个‘大脑指挥部’——一小部分它能说出来的表征,其他都是自动在干。挺有意思的视角。
7月5日
6月16日
09:50
09:50官方账号arXiv cs.LG@Zongfang Liu, Jinghui Zhang, Zijian Ma, Guangyi Chen, Xin Yuan
该研究提出MoE专家一次性剪枝的统一公式,将现有启发式标准归为路由频率、门控权重、激活强度三类因素。基于此给出选择原则:任务无关剪枝应优先使用基于激活强度、无门控的标准。新提出的MAN和MSAN标准在4个MoE模型、16个基准上取得任务无关设置平均排名前两位。平均性能比最强基线提升最多8.8个百分点。
推荐理由:这篇论文把MoE剪枝的各种评分方法统一了,还提出MAN和MSAN两个新标准,在多个模型和基准上表现更稳定,适合做模型压缩的人参考。
6月2日
5月26日
5月25日
5月19日
14:26
14:26官方账号arXiv cs.AI@Payal Chandak, Victoria Alkin, David Wu, Maya Dagan, Taposh Dutta Roy, Maria Clara Saad Menezes, Ayush Noori, Nirali Somia, John S. Brownstein, Ran Balicer, Rebecca W. Brendel, Noa Dagan, Isaac S. Kohane, Gabriel A. Brat
精选
医学伦理天然具有多元性,但大型语言模型在提供医疗建议时可能隐含单一的价值偏好。研究者提出了一个审计框架,包含临床验证的伦理困境基准和从决策中恢复价值优先级的方法。前沿模型在讨论伦理冲突时能展现观点多元性,但个体决策几乎确定,无法复现医生群体的分布性多元。多数模型的价值优先级在医生变异范围内,但部分模型显著低估患者自主权。若不加干预,单一模型可能将自身价值偏好大规模强加给所有患者,取代临床伦理的多元性。
推荐理由:这篇论文揭示了AI医疗建议中隐藏的价值偏见问题,做医疗AI开发或临床决策支持的团队值得关注——它提醒我们,模型不只是输出答案,还在无声地传递伦理立场。
5月13日