6月9日
11:56
11:56官方账号arXiv cs.AI@Peiliang Gong, Emadeldeen Eldele, Chenyu Liu, Ziyu Jia, Yi Ding, Xinliang Zhou, Lianchao Gu, Qi Zhu, Yang Liu, Daoqiang Zhang, Xiaoli Li
精选
现有LLM时间序列预测方法多依赖被动对齐或静态重编程,难以捕捉非平稳模式和细粒度任务意图。本文提出InA-Probe,通过多层级指令注入和自适应查询生成,让模型主动探测时间序列中的关键模式。该方法在7个真实基准上超越现有深度学习和LLM基线,在跨域场景中预测误差降低高达37%,零样本泛化能力也显著提升。消融实验表明,自适应查询与细粒度指令的协同作用是释放LLM推理能力的关键。
推荐理由:时间序列预测从业者终于有了一个能主动理解任务意图的LLM方案——InA-Probe在跨域场景误差降低37%,做金融、能源等时序预测的团队值得关注。
6月8日
09:33
09:33官方账号arXiv cs.AI@Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao
随着基础模型和智能体框架的进步,AI 在研究任务中展现出强大能力,但仍无法完全替代人类研究人员。为此,研究者提出了 AARR(Act As a Real Researcher)基准系列,首个基准 AARRI-Bench 专注于评估智能体在细粒度研究场景中的专业性、严谨性和推理能力。实验显示,最佳配置(Mini-SWE-Agent 搭配 Claude Opus 4.7)仅达到 68.3% 的成功率,常忽略人类研究者能轻易察觉的细微关键细节。结果表明,开发类人研究 AI 需要更深入地探索研究行为,而非仅依赖复杂框架。数据已开源。
推荐理由:这个基准直击当前 AI 智能体在研究场景中的短板——不是执行能力不够,而是缺乏研究者的细腻判断。做 AI 评估或智能体开发的团队值得关注,它揭示了提升 AI 研究素养的新方向。
6月5日
12:05
12:05官方账号arXiv cs.AI@Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue
精选
论文提出 Benchmark Agent,一个全自动构建 LLM/MLLM 评测基准的智能体系统。它从用户需求分析、子任务设计到数据标注和质量控制,全流程自动化。作者用它生成了 15 个覆盖文本理解、多模态理解和领域推理的基准,经人类评估和 LLM 评判验证,质量高且无需人工参与。该系统解决了传统基准构建劳动密集、易饱和的问题,能持续生成新基准以区分顶尖模型。代码和预览已公开。
推荐理由:做 LLM 评测的团队终于有了自动化工具——Benchmark Agent 能持续生成新基准,避免模型性能饱和,建议做模型评估的开发者直接试试。
6月4日
10:37
10:37官方账号arXiv cs.AI@Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang
精选
针对现有LLM知识基准存在的三个问题(学科代表性不足、标注激励不当、排名不稳定),研究者提出了KINA基准,包含899道题目,覆盖261个细粒度学科。该基准通过贪心近似算法确保学科代表性,并设计了锦标赛式奖励机制以提升标注质量。在13个实验室的42个模型评估中,Gemini-3.1-Pro-Preview以53.17%的准确率领先,Claude-Opus-4.6和GPT-5.4紧随其后,整体排名呈现分层结构,远未达到饱和。工具增强平均提升5.17个百分点,但模型间差异显著。该基准还提供了自举排名稳定性统计,避免对相邻排名的过度解读。
推荐理由:KINA 解决了 LLM 知识评估中学科代表性不足和排名不稳定的痛点,做模型评测或研究 LLM 知识边界的团队可以直接用这个基准来更可靠地对比模型,建议点开看看具体的设计和排名细节。
6月3日
01:21
01:21Suhail@Suhail
一位用户惊叹于 LLM 带来的学习速度与广度,认为它让任何人都能随时学习自己领域的前沿知识。这种能力既可以让人贬低智力或沮丧,也可以让人成为在小房间里就能掌握前沿的普通人。自学从未如此普及和高效。
推荐理由:LLM 正在重塑自学方式,对任何想快速学习新知识或深入领域前沿的人来说,这条推文点出了关键心态转变——是选择沮丧还是利用工具,值得每位学习者思考。
6月2日
09:38
09:38官方账号arXiv cs.AI@Minjing Shi, Junling Wang, Jingwei Ni, Sankalan Pal Chowdhury, Mrinmaya Sachan
LFTutor 是一个基于大语言模型的智能辅导系统,旨在帮助普通人学习识别日常对话中的逻辑谬误,从而对抗虚假信息。该系统结合了意图驱动的苏格拉底式提问和批判性论证原则,主动引导学习者反思自己的推理过程。自动评估和人工评估均显示,LFTutor 在教授逻辑谬误方面显著优于未采用这些教学策略的基线 LLM。这项工作展示了将 LLM 与教学支架相结合以培养 AI 时代批判性思维和论证素养的潜力。
推荐理由:想提升自己和团队信息辨别力的读者值得关注——LFTutor 把 LLM 从信息污染源变成了教育工具,用苏格拉底式提问教普通人识别逻辑谬误,比单纯看科普文章更有效。