8月27日
8月25日
23:38
22:37
05:33
8月24日
22:43
21:36
21:36elvis@omarsar0
精选
NVIDIA新论文探讨评估智能体技能,提出Skill Lift方法,通过对比加载与未加载技能的执行差异来衡量技能提升。研究基于145个真实技能案例,发现技能执行、行为检查和技能效率方面有显著提升。
事件专题

推荐理由:NVIDIA提出Skill Lift新方法,评估智能体技能提升,与现有方法相比有显著优势,值得一读。
05:34
8月14日
8月11日
7月22日
02:32
02:32官方账号OpenAI@OpenAI
76°
OpenAI与ApolloAI合作发布新研究,探讨奖励追求行为(模型倾向于遵循评分者奖励而非用户意图)。提出新方法Contrastive SDF,量化模型信念对行为的影响程度。研究在alignment.openai.com上公开,包含具体实验和基准测试。
事件专题

推荐理由:OpenAI联手ApolloAI,用Contrastive SDF方法测量模型是否在讨好评分者而非用户,搞对齐的必看。
00:59
00:59官方账号MIT CSAIL@MIT_CSAIL
精选78°
MIT研究人员提出一种新算法,能在指数级更少的采样步骤内达到与标准扩散模型相同的精度。该算法可大幅提升图像生成等扩散AI系统的效率。相关论文在ICML 2023荣获杰出论文奖(Outstanding Paper)。

推荐理由:MIT搞了个新算法,采样扩散模型快了很多,还拿了ICML最佳论文奖,做图像生成的朋友可以看看。
7月20日
23:09
7月17日
11:31
11:31官方账号arXiv cs.AI@Yasheng Sun, Zezi Zeng, Yifan Yang, Chong Luo, Wenyi Wang, Ziwei Liu, Jürgen Schmidhuber
SciDiagramEdit是一个从自然论文修订中学习编辑科学图表的基准和技能演化框架。该基准从arXiv版本历史中挖掘前后图表对,每对都附有作者的修订意图。框架采用智能体学习,通过技能演化不断优化代理的技能规范,提升编辑准确性。实验表明,在保留验证集上,技能逐步提高了编辑准确率,证明自然论文修订是有效的指令驱动图表编辑训练信号。
推荐理由:这篇论文提出了一个从论文修订数据中学习编辑科学图表的框架,还附带了一个基准,适合想做图表自动化编辑的研究者看看。
7月15日
09:28
09:28官方账号arXiv cs.AI@Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd
该论文分析了人类与AI助手、编码协作或图像生成等交互中的迭代循环,指出每次请求-反馈-再调整过程会高频触发条件反射,强化不耐烦、完美主义等消极神经通路。作者提出,通过在三层观察(预认知感受、调节间隙、后反应)和两种模式(用户引导与代理辅助)中打断反应链条,可以利用长期抑制替代长时程增强来弱化不良回路。论文以生成式图像提示为例,说明同一挫败会话在观察与否时行为相似但神经效果相反。
推荐理由:这篇论文把日常AI交互解读成神经训练,教你用观察来打断反应回路,实操感强,图像提示例子很直观。
7月10日
09:36
09:36官方账号arXiv cs.AI@Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu
UltraX 提出一种函数调用精炼框架,通过引入插入操作完成编辑函数空间,实现细粒度实例级编辑。该框架通过数据集自适应提示优化指导专家LLM生成高质量精炼文本,再通过行对齐映射和动态上下文替换转换为结构化程序监督。实验表明 UltraX 在所有语料库上取得最高平均性能,并使用更少训练 token 匹配或超越基线,展现更强数据效率和精炼可靠性。
推荐理由:UltraX 搞了个新框架,用程序化编辑替代传统规则和LLM方式,既能细粒度编辑又保证效率,精炼预训练数据效果不错。
7月8日
17:17
17:17量子位@量子位的朋友们
精选
阿里在2025年ACL大会上获得最佳资源论文奖,其提出的Agent评测框架BenchAgent包含5万+测试用例和20+真实任务场景。该框架通过自动化生成对抗性测试,将现有Agent基准的评估效率提升300%。论文首次系统解决了Agent行为空间过大导致的评测覆盖不足问题。
推荐理由:阿里拿奖的这篇论文,搞了个叫BenchAgent的新评测框架,专门测Agent行不行,覆盖真实场景多,你搞Agent开发可以看看。
12:19
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
DepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。
推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。
7月7日
13:03
13:03官方一手arXiv: OpenAI@Sukanta Ganguly
PLACEMEM将智能体记忆表示为带版本号的胶囊,统一语义、来源、有效性和可重用运行时状态。原型基于vLLM,支持提示级文本检索、KV导向路由和级联失效。通过OpenAI兼容的侧车和类型化元数据契约,测量了首次token延迟、复用率和校正后行为。论文提出了面向终身智能体系统的重放感知服务集成路线图。
事件专题

推荐理由:这篇论文提出了PLACEMEM,用版本化胶囊解决终身智能体的记忆管理问题,原型跑在vLLM上,实测了延迟和复用率,适合研究记忆架构的读者。
12:21
7月3日
7月2日
10:15
10:15官方账号arXiv cs.AI@Hao Huang
论文将Muon优化器解释为隐式残差连接。正交化更新牺牲局部梯度保真度,但改善下游层的表示保留。在受控线性优化中,Muon学习对局部目标拟合慢但下游层易利用的表示。该视角为设计平衡局部下降与下游可用性的优化器提供了新思路。
推荐理由:这篇论文给了Muon一个新视角:它不只是优化器,更像隐式残差连接,专门为下游层保留好的表示。想理解Muon为什么管用的可以看看。