8月14日
12:05
12:05官方账号arXiv cs.AI@Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech
DFM Mimir v1是丹麦基础模型团队发布的10亿参数语言模型,基于HRM架构从零训练。该模型仅使用许可的后训练数据,混合了161个数据集进行训练。在20个英语、数学与代码及丹麦语基准上,Mimir v1超过HRM-Text 1B,并可与Qwen 3.5 4B和Gemma 4 E2B竞争。它在丹麦语任务上刷新了最先进水平,模型现已在Hugging Face Hub开放下载。
事件专题

推荐理由:丹麦团队开源了10亿参数的Mimir v1,只用合规数据就追上4B模型,丹麦语还是第一。
12:03
12:03官方账号arXiv cs.AI@ AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao
AlayaWorld v1.1技术报告发布,提出改进版交互式长时程世界建模。新版本将空间记忆由深度扭曲法改为流式3D点缓存渲染器。视觉条件被编码到与生成视频一致的因果VAE潜空间中。具体包括六处修改:采用运动感知潜条件、因果编码重渲染空间记忆等。报告未改变主干架构与分块自回归生成方案。
推荐理由:AlayaWorld v1.1报告出来了,空间记忆换成了3D点缓存渲染,条件编码统一到因果VAE,做世界模型的值得瞄一眼。
11:08
11:08官方账号arXiv cs.LG@Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
Intern-S2-Preview 是一系列面向科学发现的智能体基础模型,支持多模态科学理解、推理、生成和长周期任务。训练流程包含科学多模态预训练、监督微调、多任务强化学习及智能体 RL,并引入部分 rollout、自适应长度正则化等技巧提升稳定性。其中 Intern-S2-Preview-397B 在 SciTS 时间序列基准上取得领先表现,同时其时间序列模块增强了科学信号理解与预测。独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。
推荐理由:这个科学智能体模型能处理多模态数据,397B 版在时间序列预测上很强,还有个 4B 小模型能直接把生物任务分数拉高,适合搞科研的人看看。
8月13日
8月11日
12:35
12:35官方账号arXiv cs.LG@Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang
Macaron-V1是面向体验智能的开源智能体-模型家族,支持部署后持续学习。旗舰版Macaron-V1-Venti基于744B的GLM-5.2底座,搭配聊天、智能体、编程和GenUI四个LoRA适配器。Macaron-V1-Tall基于Qwen3.6(50B)设计,用于本地部署。系统采用模型-框架协同设计和递归自我改进循环,包含UI4A组件原生GenUI框架和智能体RL框架MindForge。在Personal Intelligence、GenUI和通用能力基准上进行了评估。
推荐理由:想了解怎么让模型部署后还能继续学?Macaron-V1用LoRA组合和递归改进做到了,744B大模型加四个专家LoRA,还开源。
8月10日
10:48
10:48官方账号arXiv cs.LG@Zhuotao Jin, Xiaoyun Wang, Nicholas Brawand, Roman Zubatyuk, Atul Thakur, Eric Qu, Boris Kozinsky, Justin Smith
DynaCrys是一种晶体生成模型,通过耦合符号扩散过程让空间群与Wyckoff占据和元素共同演化。其空间群转移遵循晶体学子群关系,并借助预训练对称性码本提供共享的Wyckoff词汇表示。在两个独立松弛评估引擎的大规模评测中,DynaCrys在稳定、独特和新颖晶体的对称性感知发现上达到最佳性能。它还支持快速采样,生成结构具有低松弛诱导位移。
推荐理由:DynaCrys把空间群和元素组成一起做扩散,两个评测引擎下都是最好成绩,生成还快,搞材料的人可以看看。
8月7日
09:22
09:22官方账号arXiv cs.AI@Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel
iARCS 框架用迭代智能体强化学习,让预训练场景生成器适配自然语言任务要求。它采用两阶段策略:先用通用奖励预训练提升物理合理性,再用 LLM 生成的奖励程序做任务特定微调。实验在可步行性、可达性和间隙约束任务上提升了约束保真度,同时场景多样性保持竞争力。iARCS 生成的数据还能反过来改进基础生成器。
推荐理由:iARCS 用强化学习让 3D 场景生成器听懂自然语言要求,走路、够东西这些约束都能满足,还能提升基础生成器。
8月6日
8月5日
11:16
11:16官方账号arXiv cs.LG@Edoardo Coppola, Stefano Fiorini, Pietro Liò, Mattia Savardi, Alberto Signoroni
LAEF是一个仅7M参数的心电图基础模型,能原生处理任意导联组合,无需零填充或修改架构。它在920万份12导联ECG上通过掩码节点建模和随机导联采样预训练。在18个下游数据集中,全导联可用时,LAEF与专用12导联基线相当,而后者规模大12倍。在1-2导联的即时诊断场景下,随机单导联时17/18数据集、双导联时14/18数据集上超过零填充替代方案,平均AUROC提升3.2点。
推荐理由:这个LAEF模型专治心电图设备导联不全的痛点,手表或手持记录仪只用1-2个导联也能获得接近12导联的诊断效果,比同类小模型强不少。
10:20
10:20官方账号arXiv cs.AI@Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing
LiLa-WAM在紧凑潜在空间中推理未来场景,可在单个24GB GPU上端到端训练,避免像素空间法的高开销。其核心是联合塑造的未来状态预测与动作生成机制,并提出了语言无关的视觉转换标记(VTT)作为任务表征。在RoboTwin 2.0的50个任务中取得90.48%成功率,且同时在LIBERO和真实机器人任务上验证了有效性。
推荐理由:LiLa-WAM用一张24GB显卡就能训练,在RoboTwin 2.0上50个任务做到90%以上成功率,还不用语言标注任务,做机器人操控的值得看看。
8月4日
12:10
12:10官方一手arXiv: DeepSeek@Wen Zan, Jiaqi Zhang, Jianchao Tan, Hong Liu, Cunguang Wang, Xiang Li, Duyue Ma, Guanyu Wu, Yifan Lu, Fengcun Li, Yerui Sun, Peng Pei, Yuchen Xie, Xunliang Cai
LongCat Sparse Attention(LSA)提出流式感知索引、跨层索引和分层索引三种策略,解决DeepSeek Sparse Attention的O(L^2)计算开销和内存访问不连续问题。LSA在69B-A3B到560B-A27B规模模型上,与全注意力性能持平。LSA支持原生训练最长100万token的上下文,并支撑LongCat-2.0(1.6T-A48B)的开发。团队开源了LongCat-Flash-Lite-Sparse(69B-A3B)。
推荐理由:DeepSeek稀疏注意力有个瓶颈,LongCat这套新方案用流式感知和跨层索引把它治了,跑长文本不慢,还开源了个69B模型,可以试试。
09:36
09:36官方账号arXiv cs.AI@Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu
WAM-Diff2是一种多任务离散扩散VLA框架,通过三阶段分层蒸馏将预训练自回归模型转化为并行扩散模型。该方法解决了自回归解码的高延迟和暴露偏差问题,同时保留多任务视觉-语言推理能力。在驾驶理解、感知和规划基准上,WAM-Diff2与自回归基线性能持平。推理加速达2.8倍,结合FlashInfer和CUDA Graphs系统优化后最高可达15.1倍。
推荐理由:它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。
8月3日
09:21
09:21官方账号arXiv cs.AI@Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai, Haoyu Wu, Minghui Wu, Chenxu Zhao, Ante Wang, Guannan He, Changwei Wang
SESA是一种自进化技能增强搜索智能体,通过挑战者与求解者的双向循环,使技能记忆和任务生成共同进化。在7个开放域和多跳问答基准上,SESA比SSP平均提高1.2至3.2个点,比SkillRL高0.9个点。在Qwen3模型上,SESA-Off保留1.8至2.2个点的提升,额外技能库再贡献0.5至1.0个点。代码已开源。
推荐理由:SESA让AI自己出题自己练,把失败经验存下来反复用,问答准确率比SSP高1到3个点,代码已经开源了。
7月31日
11:36
11:36官方账号arXiv cs.AI@Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi
Qwen-UI-Agent 是覆盖移动、电脑、网页和 DeepSearch 环境的 GUI 智能体,结合沙盒环境与真实设备移动运行时。其统一动作空间支持 GUI 操作与 CLI 执行交错,并可在单次模型回合中生成批量动作。AutoResearch 数据飞轮用智能体构建任务与环境,在线强化学习支持超过 100 步轨迹,在超过 10,000 个并发环境中训练。在基准测试中,移动端达到 MobileWorld 82.1%、MobileWorld-Real 92.2%、AndroidDaily 97.5%;电脑端 OSWorld-Verified 79.5%、WebArena 73.6%。
事件专题

推荐理由:Qwen 团队发了 UI-Agent,一个模型统一手机、电脑、网页操作,移动端跑分超 Opus 4.8,还能插命令行,挺能打。
7月30日
11:22
11:22官方账号arXiv cs.AI@Julien Benchek, Austin Bennett, Jasmin Kern, Ryan Stevens, Rene Sultan, Charis Ching, Hayley Popiel, Vaibhav Mittal, Felix Mercier, Brendan Foody, Bertie Vidgen
Mercor联手Ramp发布APEX-Accounting,内含160个会计任务,覆盖对账、费用计提等真实工作。九个前沿模型参与测试,Claude-Fable-5 (Max)以56.4% Mean Criteria@3领先Muse-Spark-1.1 (xHigh)的52.6%。最高Pass@8仅21.5%(Muse-Spark-1.1),GPT-5.6-Sol (Max+Pro)的Pass^8为2.6%。实验发现辛普森悖论:提高token预算提升总分,但预算受限时高token消耗任务得分更低。
事件专题

推荐理由:想看看AI到底能不能做会计?新出的APEX-Accounting基准拿160道真实会计题考了九个模型,最强Claude Fable-5才56%,离实际干活还差得远。
11:04
11:04官方账号arXiv cs.AI@Weijie Wu, Junbo Li, Lin Li, Jun Fang, Qingyang Hong
MMAC基准包含5,638个音频片段,来自20多个数据源,覆盖6个能力类别和15个评估维度。它检查模型生成字幕是否提及目标维度信息以及内容与参考标签的一致性。评估了开源和商业音频大模型,结果显示不同维度下的信息覆盖度和描述可靠性差异明显。
推荐理由:想评估音频大模型的信息还原能力?MMAC有五千多段音频和十五个细粒度维度,比只看生成质量更靠谱。
10:38
10:38官方账号arXiv cs.AI@Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengcheng Yang, Kai Huang, Xuan Zhou
Setoka基准基于认知与人格心理学理论,定义了用户理解的四个层次:语义记忆、情景记忆、行为模式和人格特质。该基准通过心理测量学流程合成异构用户数据与查询,用于评估记忆增强型个性化智能体。研究评估了3种语言模型结合5种记忆系统在10个合成用户上的表现,发现现有系统在语义记忆检索上表现良好,但在情景记忆上性能下降;在处理行为模式和人格特质理解任务时,由于需要整合碎片化信息,性能进一步下滑。
推荐理由:如果你想了解现有AI智能体到底能多深地理解用户,这个新基准Setoka用心理学理论和方法测出了它们的短板——不只是翻聊天记录,还要推断行为和性格。