7月31日
12:17
12:17官方账号arXiv cs.LG@Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser
安全运营中心(SOC)面临告警疲劳,检测量超过人工处理能力。研究团队通过自动提示优化、自训练和可验证奖励强化学习,在真实人工标注的Windows端点检测上训练出链式推理(CoT)分类器。CoT会降低标签token概率,因此另训练校准器读取完整推理轨迹并估计判定正确概率。系统达到82.6%测试准确率,在高置信度操作点下,良性召回率比直接标注的LLM分类器提升43.0%,恶意召回率提升18.3%。未训练的置信度评判会使高置信召回归零,而微调的30B模型显著优于前沿通用模型。
推荐理由:这篇论文把推理模型用在安全告警分类上,82.6%准确率,比直接LLM打标签的恶意/良性召回提升明显,还解决了置信度问题。
7月30日
11:18
11:18官方账号arXiv cs.AI@Ji Xin, Xiao Xiao, Ishan Bhatt, Vinesh Gudla, Trace Levinson, Raochuan Fan, Shishir Kumar Prasad, Prakash Putta, Tejaswi Tenneti
该论文提出一种发现增强的搜索系统,利用意图条件召回扩展。采用两阶段混合架构:先使用闭源大语言模型(LLM)优化头部查询,再通过LoRA适配器和师生蒸馏微调小语言模型(SLM)覆盖尾部查询。系统评估使用LLM-as-a-judge指标和端到端会话级购买分析。结果将发现覆盖率从约60%提升至80%,推理成本仅为教师模型的30%。
推荐理由:论文提出一种混合架构,用大模型和小模型结合,将电商搜索发现覆盖率从60%提升到80%,推理成本仅大模型的30%,适合大规模部署。
7月29日
11:57
11:57官方账号arXiv cs.AI@Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He
CHARM是一种多模态图基础模型,通过分层上下文建模解决零样本迁移问题。它用层次化图上下文替代孤立原始节点,捕捉多模态语义和跨模态关系。在多个零样本多模态图任务上,CHARM取得一致改进。
推荐理由:这篇论文提出了CHARM,用分层上下文建模多模态图,不需要目标域微调就能零样本迁移,比现有GNN和LLM方法更通用。
11:40
11:40官方账号arXiv cs.AI@Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang
论文研究多仓库库存分配中MIP公式的实例级选择问题,提出一种求解器引导的LLM框架,通过SFT、IPO和GRPO训练选择器。实验基于京东数据,Hit Ratio@1从21.45%提升至50.42%,Hit Ratio@2从70.47%提升至82.31%,分配质量比固定最优公式高12.57个百分点,与事后最优差距缩小至4.85个百分点。
推荐理由:京东数据验证的一种新方法,用LLM和GRPO自动选库存分配公式,准确率翻倍,搞供应链优化的可以关注。
7月28日
12:05
12:05官方一手arXiv: DeepSeek@ Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu
Zing是一个集成框架,用于测量、内化和落地LLM的社会智能。其评估基准SoMBench覆盖3个主要维度、17个次要维度和71个任务范式,包含284个共享场景和3481个专家验证实例。在20个代表性LLM上的评估显示最高准确率仅72.08%,17个次要维度均未达90%。Zing训练方法在5个社会认知基准上持续超越基础模型,其中Zing-27B-Stage2取得最高平均分,Zing-32B-Stage2与DeepSeek-V4-Pro竞争。Actio推理架构通过PRISM、Starling、SAGE和门控RAG四种支持,在15个模型-基准对中提升14个。
事件专题

推荐理由:这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。
7月27日
11:57
11:57官方账号arXiv cs.AI@Fin Gentzen, Marla Grunewald, Iulisloi Zacarias, Mounir Bensalem, Admela Jukan
该论文提出一种自校准智能体AI框架,通过集成ARIMA预测器动态逼近真实值,减少LLM驱动系统中的运行漂移。在零知识工作负载的边缘资源使用场景中,该框架的资源使用预测准确率比基线LLM智能体高91.7%,预测速度提升71.7%。自校准机制采用的ARIMA跳跃算法比标准ARIMA生成真实值快52%,且精度相同。实验验证了该框架在去中心化基础设施中部署自主AI的可靠性。
推荐理由:这篇论文讲了一个能自己校准的智能体框架,用ARIMA预测把资源分配准确率提了91.7%,速度还快了71.7%。搞边缘计算或零知识证明的可以看看。
10:58
10:58官方账号arXiv cs.LG@Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna
TRACE-ROUTER 提出任务级路由框架,将每个任务在受理时通过上下文赌博机分配一次模型,后续所有LLM调用均固定到所选后端,并使用最终奖励更新策略。在 tau2-Bench 上,该方法比延迟匹配的单个模型插值高出7-8个准确率点。在 Terminal-Bench 上,相比最强单模型基线,TRACE-ROUTER 以36%更低延迟实现7.1个准确率点提升。该框架无需显式任务复杂度估计,即可学习适应工作负载的路由策略。
推荐理由:这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
7月25日
08:12
08:12Gary Marcus@GaryMarcus
Gary Marcus发帖指出,LLM行业牛方认为模型酷炫、芯片股飙升、收入增长。熊方则看到企业用户除编程外生产力提升有限、与中国价格战、LLM提供商在无芯片补贴下无法盈利、且模型依然不可靠。该帖获得24个点赞和1607次浏览。
推荐理由:看看Gary Marcus怎么用一句话说透LLM行业的冰火两重天,收入和股价飞涨,但企业实际收益和盈利问题依旧。
7月24日
11:52
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。
推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。
11:04
11:04官方一手arXiv: Anthropic@Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof
本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。
推荐理由:一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
09:33
09:33官方账号arXiv cs.AI@Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu
论文提出一种token级检测方法,通过平滑相邻token分数并采用自适应Lepski规则选择带宽,识别人机协作文本中由LLM生成的部分。该方法无需token级标注数据训练,在合成和真实数据集上优于多种基线。作者部署了公开网站实现该方法。
推荐理由:这篇论文给了一个新方法,能精确找出LLM写的片段,不用提前标注,比现有文档级检测更细。
07:40
00:53
00:53Gary Marcus@GaryMarcus
Gary Marcus指出,当前用户使用的ChatGPT/Claude并非纯大语言模型(LLM),而是结合了“Harness”的混合系统。他将这种组合称为神经符号AI架构。这一变化解释了为什么2024-2025年的模型相比2022-2023年的纯LLM有明显性能提升。
推荐理由:Gary Marcus解释了现在ChatGPT和Claude比两年前强的原因——它们加了层'Harness'变成神经符号系统了。