有人出了个数学基准 Endless Exam,14类构造题自动验证打分,8个模型全测了一遍,目前没谁超过人类已发表纪录。
论文
arXiv 与期刊里的 AI 论文,每篇附中文摘要与推荐理由 · 5350 篇
9月22日
论文10:59
Endless Exam 基准:用14类数学构造衡量模型通往超级智能的进度VPRune:免训练视觉 token 剪枝框架,高压缩下仍保 LVLM 精度
VPRune 不用训练就能剪掉 LVLM 的视觉 token,FastVLM-1.5B 上高压缩率也掉点少,做端侧部署可以看看。
论文10:30
EmbeddingGemma微调对比MPNet:岗位候选人语义匹配嵌入评估给岗位匹配选嵌入模型的看这篇:EmbeddingGemma 微调版对决 MPNet,RRF 混合检索评测细节给得很足。
arXiv 论文提出 opinion leader dynamics,解释稀疏注意力如何塑造 token 聚类
把 token 当粒子建模,还拿 Kimi-K3 和 DeepSeek-V4-Flash 实测验证,讲清稀疏注意力为啥省算力还不丢效果。
论文10:13
TLS方法用于托卡马克破裂预警:在DIII-D和EAST上优于DSM托卡马克最怕等离子体突然破裂,这篇论文把生存模型改成只看有限时间窗,TLS 在 DIII-D 和 EAST 上报警最准。
论文10:12
SAE 对比研究:Mamba 与 Pythia 潜在表征 99.98% 对齐有人拿 SAE 逐个对比 Mamba 和 Pythia 的内部特征,99.98% 几乎一样,做可解释性的可以看看。
论文10:11
PEON 方法:用概率本体建模运行设计域,让 AI 系统测试有统计依据搞自动驾驶或列车感知测试的可以看看:PEON 把运行设计域建成概率模型,能自动采出代表性测试用例,还给出何时能停测的判据。
LLM Agent 图记忆成本:Corvic AI 与 7 款图数据库对比
想给 Agent 配图记忆数据库前先看这篇,Corvic AI、Neo4j 等 8 款引擎实测,最贵的不是查询慢,是把数据喂进去。