8月14日
12:22
12:22官方账号arXiv cs.AI@Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li
AutoDesign是面向长周期智能体设计的框架,能将多模态源转化为结构化媒体输出,聚焦论文到海报生成任务。该框架引入PosterBench基准,主轨含100篇论文,横跨五个学科,验证子集含10篇。在主轨上AutoDesign得分78.32,超过闭源系统Claude Design 7.45分。在七个受控配置中,加入DesignHarness将平均得分由54.99提至67.39,提升12.4%。完全自主循环中它执行253次工具调用和11轮编辑,40分钟内成本低于3美元。
推荐理由:AutoDesign能自动把论文变海报,PosterBench上比Claude Design高7.45分,40分钟成本不到3美元。
12:19
12:19官方账号arXiv cs.AI@Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi
HumanTracker 基准包含约153小时专业表演者的光学运动轨迹,覆盖四类运动族并带有文本标签。HumanScore 指标基于12K运动对(共24K运动)训练,用于对齐人类偏好。在代表性 SOTA 跟踪器上,HumanScore 能比运动学指标更准确地预测人类偏好,揭示脚部滑动和触地时机等接触稳定性问题。
推荐理由:想评估人形机器人运动跟踪效果?HumanTracker 提供了153小时专业动作数据和更符合人眼判断的 HumanScore,能发现脚滑、触地不准这类关键问题。
11:37
11:37官方账号arXiv cs.AI@Alison R. Panisson, Maria Eduarda W. M. Vianna, Italo Firmino da Silva, Heitor Henrique da Silva, Rafaela Fernandes Savaris, Bernardo Pandolfi Costa, Martin Augusto Gagliotti Vigil, Jim Lau, Agenor Hentz, Andréa Sabedra Bordin, Alexandre Leopoldo Gonçalves, Roberto Rodrigues-Filho
巴西圣卡塔琳娜联邦大学(UFSC)的论文提出人工智能学术联盟(LIA)的组织框架,用于整合教学、科研和大学推广。该框架采用学生中心、项目驱动的运作方式,强调民主治理和协作学习。文中展示的实践项目涵盖竞赛团队、学习小组、公开讲座、知识库和AI社会应用。这些案例说明了如何在统一组织结构下培养技术能力和横向能力,并为工程和计算机教育提供可复制的模型。
推荐理由:UFSC的LIA论文讲了AI社团怎么组织竞赛队、学习小组和公益项目,搞高校AI社团的可以参考。
11:33
11:33官方账号arXiv cs.LG@Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel
研究者推出LITTLECURRICULUM,一个包含880亿token的预训练语料库,内容限定为美国小学五年级以下的知识范围。他们用该语料从头训练出5B参数的LittleLearner模型,模型语言能力足以进行开放式评测,但知识边界清晰对应课程大纲。实验表明,通过后训练和上下文学习注入新知识,LittleLearner能更好利用已有知识,但无法提升超出课程范围的能力。该研究为可控条件下研究模型知识获取提供了沙盒环境。
推荐理由:想搞懂模型知识边界怎么控制?这篇论文用小学课程语料训练了个5B模型,还公开了数据和模型,适合研究预训练数据影响的人看。
11:29
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song
精选
Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。
推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。
11:23
11:23官方账号arXiv cs.LG@Yunsung Chung, Yingshuo Liu, Abboud F. Hassan, Han Feng, Mary M. Maleckar, Nassir Marrouche, Jihun Hamm
提出干预感知临床世界模型,将术后恢复视为随时间展开的不规则轨迹。模型将基线影像编码为3D空间潜在状态,并用手术上下文与生理嵌入更新。在DECAAF-II数据集上,预测房颤消融90天复发的AUROC为0.756、AUPRC为0.777。无需随访MRI强度,疤痕范围MAE为2.971个百分点。潜在状态支持90天内不同时间范围的风险查询与空白期记录编辑。
推荐理由:论文提出干预感知模型,用房颤消融后不规则记录预测复发,DECAAF-II上AUROC 0.756,推理时免随访MRI强度。
11:19
11:19官方账号arXiv cs.LG@David Chushig-Muzo, María Ángeles Rodríguez de Cara, Eva Milara, Francisco J. Lara-Abelenda, Luis Zhinin-Vera, Diego H. Peluffo-Ordóñez
TabSOM是一种基于自组织映射的表格转图像编码方法,通过颜色匈牙利赋值让每个特征占据固定画布位置。它用SOM组件平面构建捕获特征两两关系的图,并堆叠多尺度节点通道来编码特征值与交互。与十二种现有表格转图像方法在公开二分类数据集上对比,TabSOM在每个数据集上排名第一或第二,且方差最低。其可解释性结果与Random Forest、XGBoost和SHAP验证,类分离分数与基线一致并补充结构信息。
推荐理由:做表格分类想用深度学习?TabSOM把表格变成图像,打平十二种老方法还更稳,连特征关系都能可视化,值得试。
10:39
10:39官方账号arXiv cs.LG@Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman
论文提出TraVEL方法,用于提升驾驶视频检索。研究者先在nuReasoning数据集上对Qwen3-VL-Embedding进行InfoNCE微调,再引入轨迹相似度作为GRPO奖励。相比纯监督微调,TraVEL在2B模型上使纵向和横向mAP分别提升9.8和4.7个百分点,在8B模型上分别提升7.2和1.5个百分点。该方法不需要外部感知输出,推理时仅靠单向量检索。
推荐理由:想搞自动驾驶数据检索的可以看看这个TraVEL,用行车轨迹当训练信号,让模型更懂左转右转、加速减速,比普通微调强不少。
10:38
10:38官方账号arXiv cs.LG@Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West
论文提出合成人格预训练(SPP),在预训练阶段就从第一个 token 开始植入目标助手人格,而非等预训练后叠加价值观。方法先用价值规范给预训练文档标注第一人称反思,再在标准文档和反思上以交叉熵损失训练,最后用对话数据做人格绑定。在 3B 参数、500B token 的预训练中,SPP 提高了宪法遵循和越狱鲁棒性,降低了分布外道德困境中的错位率,同时保持能力。实验显示,仅在预训练末期引入 SPP 效果明显更弱,且优势随预训练预算增加而增大。
推荐理由:这篇把对齐提前到了预训练第一步,3B 模型跑 500B token,越狱更难破,值得搞 AI 安全的人看一眼。
8月13日
17:54
17:54官方账号arXiv cs.LG@Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth
蛋白质结构预测基础模型在某些靶标上仍不可靠,外部 oracle 可纠正错误但成本高昂。一篇论文系统对比了 FK-steering、DPO、Best K-of-N 和最新提出的 O3 四种预算分配方法。在钙调蛋白(1CLL)和大肠杆菌天冬氨酸转氨甲酰酶(9EEH)两个靶标上,没有单一方法在所有预算下都占优。O3 在低预算时最有效,而 FK-steering 和 DPO 随预算增加表现更好。该研究给出了针对实际 oracle 预算约束的可操作建议。
推荐理由:做蛋白质结构预测的可以看看这篇,它对比了四种 oracle 预算分配方法,告诉你低预算用 O3,高预算用 FK-steering 和 DPO,挺实用。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。