8月5日
10:43
10:43官方账号arXiv cs.LG@Qianqian Wang, Wenwu Gong, Yunshan Li, Zhenqing Wu, Ruili Wang, Lili Yang
该论文提出条件可识别的潜在环境推荐模型 CILER,用于解决分布外推荐中的偏好偏移问题。CILER 用用户条件指数族建模潜在环境,用特征索引多项式描述环境对偏好的影响。在三个数据集上,CILER 在特征、时间和地理偏移下改善了全部十二项 OOD 排序指标。论文还给出了环境敏感表示的可识别性条件,并界定了部署风险的误差上界。
推荐理由:这篇论文把推荐系统的分布外问题拆成环境识别和偏好建模两步,CILER 在三个数据集上十二项指标全涨,做法扎实,做推荐的朋友值得看看。
10:09
10:03
10:03官方一手arXiv: DeepSeek@Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin
UrbanAgent是一个面向跨系统城市任务的工具增强智能体框架,将大语言模型的推理能力与代码执行、API调用及Model Context Protocol工具集结合。研究团队同时推出了Urban-Eval基准,用于评估跨系统城市请求的任务结果与执行质量。实验显示UrbanAgent任务成功率达71%,比最强基线高出10个百分点,该优势在GPT-5-mini、Gemini-2.5-flash、DeepSeek-V4-flash和Qwen3-235B-A22B上保持一致。
事件专题

推荐理由:想解决城市服务碎片化问题?这个框架把LLM和代码、API、MCP接起来,跑通跨系统任务,成功率比最强基线高10个点。
09:51
09:51官方账号arXiv cs.LG@Jiawen Zhu, Shuhan Liu, Shengxuan Li, Qiming Shi, Di Weng
论文提出POEM框架,利用SO(2)旋转学习相位校正坐标来应对周期漂移。其中DPIA机制会从相似时间上下文中检索历史相位增量并外推到未来。实验表明POEM在周期漂移场景下取得有竞争力的性能,可视化也显示潜在轨迹更规整。
推荐理由:这篇论文对付时序预测里的周期漂移,用SO(2)旋转加相位注意力,想法挺巧妙。
09:34
09:34官方账号arXiv cs.LG@Amirhossein Taleshinosrati, Yangyang Wang, Atitaya Phoemsuk, Vahid Abolghasemi, Naser Hossein Motlagh, Sadasivan Puthusserypady, Daniel Teichmann, Abdolrahman Peimankar
FOUND-AF基准测试在AFDB、CinC2017、CPSC2021和LTAFDB四个ECG数据集上,以冻结特征提取器加XGBoost分类器的统一流程,评估了来自五个家族的九个公开基础模型,包括HuBERT-ECG、CLEF、ST-MEM、ECG-JEPA和ECGFounder。ECGFounder在准确率、模型大小、推理时间和内存占用之间取得最佳平衡。该框架采用记录级分组交叉验证和配对bootstrap统计检验,确保结果可比。
推荐理由:房颤检测选哪个ECG基础模型?FOUND-AF用4个数据集统一测了9个模型,ECGFounder综合最强。
8月4日
12:50
12:50官方账号arXiv cs.AI@Taye Akinrele, Sindhuja Penchala, Noorbakhsh Amiri Golilarz, Sudip Mittal, Shahram Rahimi
该论文提出一种针对生成式与智能体AI认知能力差距的分类法综述,围绕持久状态建模、目标导向自主性、自我监控与控制、环境交互、学习与适应五个维度组织现有研究。论文回顾了各维度的最新进展,指出常见局限,并提出自适应认知智能架构(ACIA)作为统一框架。还讨论了以认知为中心的评价方向,为迈向长期可靠推理和持续学习的认知AI提供路线图。
推荐理由:这篇综述把生成式和智能体AI的认知短板按五个维度梳理清楚了,还给了个ACIA架构思路,适合想系统了解认知AI研究现状的人。
12:48
12:48官方账号arXiv cs.AI@Ortal Ashkenazi, Vitalii Kloz, Mykhailo Ulianchenko
Wix在客服助手Helpmate中部署三阶段技能选择管线:语义匹配、确定性可执行性门控、LLM决策。在756.6K条用户消息和267.6K对话中,门控移除了59.4%的技能-消息对,节省228.8百万token。相比暴露全部十个技能,上下文减少90.5%。反事实测试中,若不设门控,模型会在7.8%的对话中选择无法执行的技能。
推荐理由:Wix用确定性门控砍掉59.4%无用技能调用,省2.3亿token,还量化了不设门控的7.8%误选率。做客服Agent的可以参考。
12:31
12:31官方账号arXiv cs.AI@Nicole Mitchell, Dhruv Agarwal, Maty Bohacek, Remi Denton, Roma Patel
这篇arXiv论文认为,语言模型拟人化且融入日常使用,可能引发认知、发展和社会情感层面的长期变化。作者主张NLP应转向长期测量用户行为变化,而非局限静态文本评估。论文参考社会科学中纵向数据测量方法,并与NLP计算手段结合。该框架用于在线识别问题行为,并纳入对齐流程以缓解长期风险。
推荐理由:一篇讲怎么测AI长期影响的论文,用社会科学的方法补NLP的短板。适合做AI安全和行为研究的人读。
12:26
12:26官方一手arXiv: OpenAI@Shuoxing Zhou
精选
arXiv论文构造了两个可数离散群Γ1和Γ2,二者均为ICC群且具有Kazhdan性质(T),但两群不同构。它们的群von Neumann代数却同构,即L(Γ1)≅L(Γ2)。该结果构成Connes刚性猜想在ICC性质(T)群情形下的反例。论文注明该结果由GPT-5.6 Sol辅助获得,并与OpenAI的工作独立且同时完成。
事件专题

推荐理由:论文给出了Connes刚性猜想的具体反例,两个不同构的ICC性质T群居然有同构的群von Neumann代数,搞算子代数的人值得一看。
12:25
12:25官方一手arXiv: OpenAI@Francesco Fournier-Facio
本文构造了一个无挠的非 sofic 群,来源与二元 Leavitt 代数单位群不同。该例子依赖与 OpenAI 所宣布结果相同的技术判据。此前已知的非 sofic 群例子往往带有挠,新结果填补了无挠情形。论文给出了更广泛的构造框架。
事件专题

推荐理由:这篇数学论文给出了无挠非 sofic 群的新构造,跟 OpenAI 那个 Leavitt 代数例子不是一回事,想看群论新进展的可以读读。
12:10
12:10官方账号arXiv cs.LG@Zhichen Liu, Ruihan Sun, Hengjie Yang, Zipeng Wu, Zhaohan Chen, Xiaofan Zhang, Yang Xu
72°
LiveMem为预训练全注意力大语言模型引入独立于活动上下文的记忆状态,主注意力路径只保留有界KV窗口。在LongMemEval基准上,LiveMem在对比系统中取得领先总分。即使支持证据已从当前上下文移除,LiveMem仍能依据记忆状态正确作答。证据距离分析表明,有用信息可持久保留在活动窗口之外。
推荐理由:论文提出LiveMem,给LLM加了个永久记忆状态,上下文窗口再长也不怕忘事。在LongMemEval上跑分领先,值得一看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。