7月10日
09:44
09:44官方一手arXiv: DeepSeek@Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi
精选
Infinity-Parser2 是一个大型多模态模型,通过可控数据合成管道和多任务强化学习实现端到端文档解析。研究团队构建并开源了包含500万样本的中英双语数据集Infinity-Doc2-5M,涵盖多种文档类型和标注形式。模型采用8个联合训练目标,包括文档解析、布局分析、表格/数学公式/图表/化学公式解析及文档VQA。Infinity-Parser2-Pro 在olmOCR-Bench上达到87.6%,在ParseBench上达到74.3%,超越DeepSeek-OCR-2、PaddleOCR-VL-1.5和MinerU2.5。Flash变体推理吞吐量较Infinity-Parser-7B提升3.68倍。
推荐理由:Infinity-Parser2 用多任务强化学习搞定文档解析,开源了500万样本数据集,Pro版在OCR基准上刷新纪录,Flash版速度快3倍多。适合做文档智能处理的开发者。
7月9日
10:18
10:18官方账号arXiv cs.LG@Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai
精选
SciReasoner是一个多模态科学基础模型,通过统一的结构感知词汇表对蛋白质、小分子和无机晶体进行推理。在Gene Ontology预测中,对低同源性和孤儿样蛋白的Cellular Component注释Fmax从0.42提升至0.55。化学单步逆合成准确率从0.63升至0.72,并能生成片段级断键与前体验证轨迹。在86个基准中,SciReasoner在67个任务上达到SOTA,双盲专家评估认为其推理痕迹在98%案例中优于或可比于前沿大语言模型。
推荐理由:这篇论文发布了SciReasoner,一个能同时处理蛋白质、小分子和晶体的推理模型,在67项基准上成绩最好,专家评价也很高。
10:17
10:17官方账号arXiv cs.LG@Yair Feldman, Linxi Zhao, Nathan Godey, Dongyoung Go, Yilun Hua, Kilian Q. Weinberger, Jennifer J. Sun, Yoav Artzi
CO-LMLM将知识库中的连续键与文本知识值配对,摆脱了传统关系型知识库的查询限制。在Wikipedia和FineWeb-Edu上预训练,360M参数模型困惑度低于使用40倍数据训练的LLM。SimpleQA验证显示其性能与gpt-4o-mini相当,且高于Claude Sonnet 4.5。该架构在多个规模下均优于先前LMLM和普通LLM。
推荐理由:CO-LMLM用360M参数打平gpt-4o-mini,事实准确度比Claude还高,这是用更小模型做更好知识检索的路线。
09:53
09:53官方账号arXiv cs.LG@Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
精选
MedPMC从610万篇PMC文章中自动筛选出1100万医学图像-文本对。人工评估中,95.3%的图像具有医学相关性,而此前数据集仅19.7%。在26项基准测试中,基于MedPMC训练的CLIP-style模型零样本AUC平均提升7.1个百分点。作为MLLM的视觉编码器,其医学VQA准确率提升1.9和16.9个百分点。在1万张真实临床照片中,形态到图像检索Recall@5提升11.7个百分点。
推荐理由:想训练医学多模态模型但缺高质量数据?MedPMC从610万篇论文里筛出1100万对数据,效果比现有数据集好5倍。
7月8日
12:20
12:20官方账号arXiv cs.AI@Sambaran Bandyopadhyay, Ananth Muppidi
RSF-GLLM框架将可微图推理与答案生成解耦,采用GRU引导的查询更新器和动态门控机制遍历语义不相似的桥接节点。引入流稀疏正则化保证从软概率收敛到离散推理路径。在WebQSP和CWQ数据集上,RSF-GLLM取得了与基于LLM的方法竞争的性能,且推理效率更高。
推荐理由:多跳知识图谱问答一直难在中间节点没语义关联,RSF-GLLM用循环软流解决了这个瓶颈,比那些全靠LLM暴力推理的更快更准。
10:16
10:16官方账号arXiv cs.AI@Xiachong Lin, Du Yin, Arian Prabowo, Hao Xue, Wen Hu, Imran Razzak, Matthew Amos, Sam Behrens, Flora D. Salim
TopoBrick是一个无需训练的零样本建筑IoT预测框架。它利用建筑知识图谱构建紧凑的结构骨架,并通过智能拓扑采样器为目标选择特定外生变量。在三个真实建筑上,TopoBrick超越了强零样本基础模型基线,并与全训练的建筑特定模型竞争。消融实验表明,拓扑感知采样比随机、仅本体或固定跳数选择更可靠,尤其对物理耦合的HVAC和天气驱动传感变量。
推荐理由:TopoBrick不用训练就能预测建筑传感器数据,靠知识图谱和智能采样选变量,比很多基础模型还准,跟专门训练的模型差不多。
09:54
09:54官方账号arXiv cs.AI@He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li
DT-Guard提出一种推理主动训练、推理自由推理的范式,在训练时使用推理监督,推理时只输出结构化安全标签。它采用意图-类别-安全的三步决策过程,并构建带意图标签、风险类别、安全标签和推理轨迹的数据集。通过Rollout-Guided Progressive Hard-Case Optimization (RG-PHO)提升硬样本鲁棒性。在提示侧和响应侧安全基准上,DT-Guard分别达到0.886和0.870的平均F1分数,4B参数版本取得0.878的双侧平均F1,超越多个8B基线。
推荐理由:想用轻量模型做好内容安全?DT-Guard靠训练时推理、运行时只打标签,4B就干掉8B的护栏,速度快还准。
7月7日
11:49
11:49官方一手arXiv: DeepSeek@Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
76°
DSpark是一种新型投机解码框架,通过半自回归架构(并行骨干网络+轻量级顺序模块)保持草稿质量,缓解后缀衰减。它采用置信度调度验证,根据前缀存活概率和引擎吞吐量动态调整每轮验证长度。在离线多领域基准测试中,DSpark的接受长度显著优于现有自回归和平行草稿器。在DeepSeek-V4服务系统的真实用户流量下,相比生产基线MTP-1,DSpark在维持吞吐量不变时单用户生成速度提升60%至85%。DSpark还通过防止高并发下吞吐量严重退化,使服务系统达到了此前无法实现的性能层级。
推荐理由:DeepSeek-V4搞了个新框架DSpark,把生成和验证分开调度,用户实际体验加速60%到85%,还不会拖慢系统吞吐。
11:36
11:36官方账号arXiv cs.AI@Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang
Cortex是一个双向对齐的体现代理框架,通过将操作子任务标准化为32个规范技能原语,并结合可执行性约束(如对象属性和轨迹可达性)自动标注4000+小时开源视频数据并生成30小时模拟数据。在Libero-long和RoboTwin基准上,Cortex分别比单一VLA模型提升3.1%和4.1%。其通用VLM与微调VLA结合,能零样本完成未见过的真实世界长程任务(如多阶段化学实验),而这单靠VLA微调无法实现。
推荐理由:Cortex把长程操作拆成32个标准动作,用开放数据自动训练,比纯VLA模型在Libero和RoboTwin上高3-4%,还能零样本做化学实验。
11:12
11:12官方账号arXiv cs.AI@Adriana Laurindo Monteiro, Nayse Fagundes, Gabriel Mattos Langeloh, Gustavo de Oliveira Kanno, Priscila Louise Aguirre, Thiago Costa Rizuti da Rocha, Victor Leme Beltran
OptiAgent是一个多智能体框架,能将运筹学问题的自然语言描述转换为求解器可用的数学公式和可执行代码。其架构包含专用智能体提取决策变量和约束,并支持迭代自纠正。引入多循环验证架构,包含四个专门反馈机制,分别针对误解、结构缺陷、数学不一致、验证失败和代码错误。在LP、MILP和非线性规划任务的4个基准中,OptiAgent在3个上取得SOTA,并在剩余数据集上具有竞争力。
推荐理由:运筹学问题用自然语言描述就能自动建模生成代码,OptiAgent在多个基准上SOTA,迭代自纠正机制很靠谱。
7月3日
12:04
11:54
11:54官方账号arXiv cs.AI@Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng
精选
PAW(Program-as-Weights)提出一种模糊函数编程范式,将自然语言规范编译为紧凑的本地可执行神经构件。一个4B编译器在FuzzyBench(1000万示例)上训练,为冻结的0.6B Qwen3解释器生成参数高效适配器。该解释器执行PAW程序,性能匹配直接提示Qwen3-32B,但推理内存仅为其1/50,在MacBook M3上达30 tokens/s。PAW将基础模型从逐输入求解器转变为可复用小工具构建器。
推荐理由:PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。
11:52
11:52官方账号arXiv cs.AI@Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He
ReContext是一种无需训练的长上下文推理方法,通过模型内部相关性信号构建证据池并在生成前重放。该方法在8个长上下文数据集上测试,上下文长度达128K。实验表明,ReContext在Qwen3-4B、Qwen3-8B和Llama3-8B三个模型上均提升了证据利用率,平均排名最优。
推荐理由:ReContext不用训练就能让模型用上长文里的关键信息,Qwen3和Llama3上都有效,适合处理超长文档推理。
11:32
11:32官方账号arXiv cs.AI@Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla
OrbitQuant提出一种数据无关的权重量化方案,通过随机置换块Hadamard(RPBH)旋转将激活值变换到归一化旋转基,使各坐标分布固定无需重新拟合校准数据。在FLUX.1、Z-Image-Turbo、Wan 2.1、CogVideoX四个模型上,该方法在多个低位宽设定下达到后训练量化(PTQ)最佳效果,并将图像扩散Transformer的PTQ推进到W2A4可用质量。同一量化器可直接从图像迁移到视频,无需针对每种模态调整。
推荐理由:想给图像或视频扩散模型做低位量化?OrbitQuant不需要每换一个模型或任务就重跑校准,FLUX.1、Wan 2.1上表现都很能打,W2A4也有可用效果。
11:28
11:28官方账号arXiv cs.AI@Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang
EvoPolicyGym是一个基于16个紧凑强化学习环境的基准,用于评测智能体在固定交互预算下迭代改进策略的能力。GPT-5.5在全部16个环境中取得最强综合排名,并在每个环境中进入前两名。该基准还提供轨迹级诊断,分析智能体如何分配预算、将反馈转化为参数调优。结果表明,自主策略演化不仅依赖单次任务胜出,更需在有限反馈下发现任务适配机制并细化策略。
推荐理由:想看看AI智能体怎么自己迭代策略吗?EvoPolicyGym这个新基准让GPT-5.5跑了16个强化学习环境,全部拿到前两名。
09:03
09:03官方账号arXiv cs.LG@Di Wu, Huan Liu, Zhixiang Chi, Yuanhao Yu, Konstantinos N. Plataniotis, Yang Wang
新提出的 DNG-Encoder 用动态图表示神经网络推理的层间时序特征,解决了现有权重空间方法忽略顺序处理的问题。基于该编码器构建的 INR2JLS 框架,在 CIFAR-100-INR 分类任务上达到当前最优,准确率提升约 10%。实验涵盖多个下游任务,展示了权重空间动态建模的有效性。
推荐理由:想搞权重空间分析的可以看看,这篇用动态图编码推理过程,在 INR 分类上直接提了 10 个点,挺实在的。
7月2日
12:30
12:30官方账号arXiv cs.LG@Patrick Podest, Marco Pichler, Elias Bürger, Levente Zólyomi, Bernhard Voggenberger, Wilhelm Berghammer, Daniel Klotz, Sebastian Böck, Günter Klambauer, Sepp Hochreiter
TiRex-2是基于xLSTM的循环时间序列基础模型,将单变量TiRex扩展到多变量预测,支持未来已知协变量。它采用双向时间混合器和非对称分组注意力变体混合器,保持严格因果性。在GIFT-Eval和fev-bench上取得零样本SOTA性能。相比Transformer,流式处理时每块计算成本恒定,无需全历史重算。模型单变量模式有38.4M活跃参数,多变量模式额外激活44.1M参数。
推荐理由:TiRex-2是首个同时支持多变量流式预测和已知未来协变量的时间序列基础模型,零样本刷新GIFT-Eval和fev-bench榜单,每步计算量不变。做在线时序预测的朋友可以看看。
12:10
11:14
11:14官方账号arXiv cs.LG@Soosung Kim, Minjae Park, Eui-Young Chung, Jaeyong Chung
GSRQ提出Gain-Shape K-means (GSKM)替代传统K-means,解决高维中欧氏质心收缩导致的方向偏差问题。在LLaMA-3-8B上,1-bit量化时LongBench平均准确率从11.34提升至33.54,比VQLLM提高22.20个百分点。该方法在保持向量方向的同时实现子1-bit压缩。
推荐理由:这篇论文搞了个GSRQ新量化方法,1-bit下比VQLLM准22个点,专门解决KV缓存压缩时的方向丢失问题。
7月1日
09:40
09:40官方账号arXiv cs.LG@Zena Al-Khalili, Rafi Hakim, Dietrich Klakow, Ji-Ung Lee
Fork-Think提出一种新范式:先通过模型置信度在单条路径上识别分流点,再触发多分支采样并聚合。在三个模型和三个推理基准上,相比并行思考,Fork-Think节省了30%的token消耗和57%的推理时间,性能持平或更优。结合早停和加权投票后,无需预热即可达到现有最优方法。
推荐理由:Fork-Think让LLM推理更省钱省时间——先找准关键点再思考,token少用30%,速度快57%,效果还不输并行方法。
6月30日
13:57
13:57官方账号arXiv cs.AI@Yen-Jen Wang, Jiaman Li, Sirui Chen, Takara E. Truong, Pei Xu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, Karen Liu
VLK提出利用3D高斯溅射(3D Gaussian Splatting)重建度量级室内场景,并合成导航与物体交互轨迹,生成48,000个配对视觉-语言-运动学(VLK)数据,无需人工干预。训练出的VLK策略能够预测短时全身运动轨迹,并通过全身跟踪器将预测转化为实际动作。在物理Unitree G1人形机器人上,该方法成功完成导航和单物体运输任务,实现了从模拟到真实的感知驱动操作。
推荐理由:想让人形机器人自己学会拿东西?VLK用48,000条合成轨迹模拟真实场景,直接在Unitree G1上跑通了导航和运输,省掉人工标注的苦力。
12:39
12:39官方一手arXiv: DeepSeek@Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou
精选
Agents-A1是一个35B参数的Mixture-of-Experts智能体模型,通过扩展智能体视野(平均轨迹长度45K tokens)达到万亿参数级别性能。它在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和MolBench-Bind(56.8)上超越了1T参数的Kimi-K2.6和DeepSeek-V4-pro,在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上也具有竞争力。训练采用三阶段流程:全领域SFT、领域级教师模型、多教师领域路由在线蒸馏。
推荐理由:35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。