VOL.2026.09.04·214 STORIES·AITOP DAILY

AITOP日报

二〇二六年九月四日 星期五DAILY · 每早八时
01

模型发布/更新

Model Releases
5

Repo-To-Skill:将GitHub仓库提炼为AI技能

官方账号X·KOLX:arXiv cs.AI (@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu)原文 ↗

研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。

02

产品发布/更新

Product
5
03

行业动态

Industry
5
04

论文研究

Research
5

Trace as State:长上下文Transformer的条件状态更新

官方一手X·KOLX:arXiv: DeepSeek (@Xu Zou, Jie Tang)原文 ↗

研究人员提出Trace as State方法,将推理痕迹作为任务状态的文本代理放置在长上下文块之前。在DeepSeek V4 Pro Preview模型上,该方法在GraphWalks Parents任务上将准确率从初始的29.2%提升至81.8%,显著优于Trace Append方法的43.0%。GLM-5.2模型在该任务上实现了100%的准确率。该方法在三种模型和三种长上下文数据集的27种组合中,有26种表现优于对照方法。

大模型与本体排序器融合提升罕见病诊断

官方一手X·KOLX:arXiv: DeepSeek (@Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu)原文 ↗

该研究提出了一种行为融合模型,结合大语言模型和本体排序器进行罕见病诊断。在Phenopacket Store和RAMEDIS数据集上,融合方法将Phenomizer Recall@1分别提升7.86和20.18个百分点。当与DeepSeek-V4-Flash API结合时,融合模型将Recall@1从0.1657提升至0.2176,提升5.19个百分点,无需重新训练。90.8%的正确融合诊断保留了可检查的本体证据。

FUSE框架评估LLMs危险能力

官方一手X·KOLX:arXiv: DeepSeek (@Zhengyi Jin, Ru Zhang, Xiao Chen, Xinbo Liu, Jiaxuan Lin, Jia Huang, Jianyi Liu, Zhen Yang)原文 ↗

研究人员提出FUSE框架,通过知识(K)、防御(D)和危害(H)三个正交管道评估模型。该框架使用化学-生物(CB)模块评估了12个商业LLM,来自Claude、DeepSeek和GPT四个家族。研究发现模型间危险能力存在显著差异,知识相当的模型在拒绝韧性上表现不同,强防御模型在服从时仍可能生成有害内容。时间分析表明,新模型知识增强但防御仅部分改善,扩展和对齐进展未均匀转化为安全提升。

PARSER方法压缩MoE大模型

官方一手X·KOLX:arXiv: DeepSeek (@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang)原文 ↗

PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化独立矩阵误差转变为保留专家输出误差。在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型的精度差距分别缩小1.41倍和1.44倍,同时实现相同的峰值内存减少。

双层协调反射:多智能体LLM系统的博弈论方法

官方账号X·KOLX:arXiv cs.AI (@Yihang Chen, Yuxiang Chen, Yuxuan Huang, Meng Fang, Weilin Luo, Jun Wang)原文 ↗

该研究提出双层协调反射模型,将协调者与工作者的交互建模为双层协调博弈。研究分析了文本反思作为语义记忆状态上的随机运动,推导了有限时间上界,并证明了在特定条件下的下界。研究还引入了随机反思记忆上升(SRMA)算法,在500个SWE-bench实例上达到72.2%的解决率。

05

技巧与观点

Tips & Takes
5
214
今日事件
61
一手报道
46
新模型
76
信源
AITOP · 编辑系统自动生成