论文11:24LLM后训练作为棕地维护:数据工程工业视角工业LLM维护团队必读,教你如何在有限资源下提升模型性能,数据工程比一次性配方更重要。#LLM#后训练#数据工程#CodeForcesaarXiv cs.AI@Gopi Krishnan Rajbahadur 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:23自适应非结构化数据推理代理方法MIT团队推出代理式数据破解技术,让AI代理在回答问题时顺便结构化数据,大幅降低推理成本。#FanOutQA#推理代理#数据结构化#RAGaarXiv cs.AI@Milad Rezaei Hajidehi 等 3 人原文稍后读已读值得跟进有用关注 FanOutQA
论文政策与合规精选73°11:23TASPO解决智能体政策优化中的监督-信用差距TASPO解决了智能体政策优化中的监督-信用差距问题,让特权信息只重新分配行动间的信用,不改变整体更新方向。#TASPO#智能体#GRPO#强化学习aarXiv cs.AI@Jingxiao Yang 等 6 人原文稍后读已读值得跟进有用关注 TASPO
论文精选73°11:22AutoSciRub:自动研究代理评估框架ZJU团队推出AutoSciRub,让AI研究代理先定标准再执行,在多个基准测试中显著提升研究质量。#AutoSciRub#ResearchClawBench#AstaBench#科学代理aarXiv cs.AI@Xuehai Wang 等 9 人原文稍后读已读值得跟进有用关注 AutoSciRub
论文78°11:22大推理模型超越人类监督的扩展路径这篇论文系统分析了大推理模型如何减少人类依赖,提出了五级发展阶梯和三种评估对象。#LRM#推理模型#强化学习#GitHubaarXiv cs.AI@Zhiqin Yang 等 19 人原文稍后读已读值得跟进有用关注 LRM
论文73°11:22基于YOLO姿态估计和CLIP语义评分的实时视频异常检测新方法结合YOLO和CLIP,无需光流和独立姿态估计器,实时检测异常行为,速度提升3倍多。#YOLO#CLIP#视频异常检测#姿态估计aarXiv cs.AI@Vanodhya G. Warnasooriya 等 4 人原文稍后读已读值得跟进有用关注 YOLO
论文精选73°11:21大语言模型序列评分崩溃下的推理能力恢复发现大模型推理失败不等于能力缺失,用简单方法就能恢复被掩盖的内部逻辑。#Qwen3.5#Llama-3.1-8B#OLMo-2-1B#推理模型aarXiv cs.AI@Qiyao Yan 等 3 人原文稍后读已读值得跟进有用关注 Qwen3.5
论文Agent 与开发者11:21评估编程智能体工作记忆这篇论文揭示了编程智能体工作记忆的语义异质性,对优化AI编程助手内存管理有实用价值。#编程智能体#工作记忆#内存管理#语义异构性aarXiv cs.AI@Le Chen 等 9 人原文稍后读已读值得跟进有用关注 编程智能体
论文11:21MNIST-PRO:部分可观察环境下的AI智能体基准测试MNIST-PRO基准测试揭示了AI智能体在部分可观察环境下的感知能力缺陷,特别是整合碎片化信息和更新错误信念的能力。#MNIST-PRO#AI智能体#部分可观察环境#多模态模型aarXiv cs.AI@Vernon Toh 等 5 人原文稍后读已读值得跟进有用关注 MNIST-PRO
论文11:20三种AI医疗文书系统审计结果三种AI医疗文书系统被审计,近三分之一存在错误,尤其在过敏信息和患者身份方面。#AI医疗文书#临床记录#错误率#审计研究aarXiv cs.AI@Sebastian Fox 等 4 人原文稍后读已读值得跟进有用关注 AI医疗文书
论文精选11:20LLM评估无法检测临床笔记遗漏信息OpenAI等公司AI临床笔记系统存在信息遗漏问题,新方法能更准确检测遗漏内容。#LLM#临床笔记#AI评估#医疗AIaarXiv cs.AI@Sebastian Fox 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文11:20知识对齐监督微调研究这篇论文提出了两种新方法,能减少大模型幻觉,特别适合关注模型可靠性的研究者。#监督微调#知识对齐#Qwen 3#OLMoaarXiv cs.AI@Arthur Becker 等 6 人原文稍后读已读值得跟进有用关注 监督微调
论文精选73°11:19大语言模型自我建模评估与改进研究者提出LLM自我建模评估基准,用合成数据提升模型自我认知能力,但不构成真正的内省。#LLM#self-modeling#强化学习#开源模型aarXiv cs.AI@Siqi Zeng 等 3 人原文稍后读已读值得跟进有用关注 LLM
模型73°11:19MR-JEPA: 心脏MRI通用视频基础模型研究人员发布了MR-JEPA模型,能处理心脏MRI多序列视频数据,在心脏功能评估和疾病检测上超越现有方法。#MR-JEPA#CMR#心脏MRI#视频基础模型aarXiv cs.AI@Athira J. Jacob 等 4 人原文稍后读已读值得跟进有用关注 MR-JEPA
论文10:50语言模型预计算内存成本研究论文揭示了预计算内存的重建成本和更新策略,对优化大模型上下文处理有实用价值。#Llama-3.1-8B-Instruct#预计算内存#键值缓存#语言模型aarXiv cs.LG@Asa Shepard原文稍后读已读值得跟进有用关注 Llama-3.1-8B-Instruct
论文精选73°10:49三步序列学习:对比强化学习中的动作块表示这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。#对比强化学习#动作块#表示学习#强化学习aarXiv cs.LG@Michal Korniak 等 5 人原文稍后读已读值得跟进有用关注 对比强化学习
论文10:49MolLedger:基于化学ADME属性的可解释图神经网络MolLedger用原子级分数解释药物分子预测,比传统方法更符合化学特性,药物研发人员值得关注。#MolLedger#ADME#图神经网络#药物发现aarXiv cs.LG@Christina X. Ji原文稍后读已读值得跟进有用关注 MolLedger
论文精选73°10:48PLC-DPO:噪声偏好优化中的后验标签校正研究人员提出PLC-DPO,能校正噪声偏好数据,在57个测试单元中胜率超DPO 5个百分点。#PLC-DPO#DPO#偏好优化#后验标签校正aarXiv cs.LG@Boryeong Cho 等 3 人原文稍后读已读值得跟进有用关注 PLC-DPO
论文精选73°10:47角色扮演越狱中的安全传递机制研究这篇论文揭示了角色扮演越狱如何绕过AI安全机制,找到了具体的安全防护目标。#角色扮演越狱#安全传递#机械可解释性#AI安全aarXiv cs.LG@Md Mokarram Chowdhury 等 3 人原文稍后读已读值得跟进有用关注 角色扮演越狱
论文多源确认10:45查询语言决定推荐市场:ChatGPT商业推荐研究ChatGPT推荐结果受查询语言和IP位置双重影响,商业决策者需注意此特性。#ChatGPT#OpenAI#查询语言#商业推荐10 个信源在谈事件专题aarXiv: OpenAI@Dmitrij Żatuchin11 个信源在谈原文稍后读已读值得跟进有用关注 ChatGPT
论文精选73°10:44PAC:LLM多任务强化学习的新课程方法PAC方法解决了LLM多任务RL中任务分配问题,结合优势信号和实际奖励增益,提升训练效率。#PAC#LLM#强化学习#课程学习aarXiv cs.LG@Yuanqiang Yu 等 11 人原文稍后读已读值得跟进有用关注 PAC
论文73°10:44毫米波无蜂窝大规模MIMO波束成形设计研究人员用GNN从sub-6 GHz CSI学习毫米波波束成形,比传统方法性能更好,训练开销更低。#GNN#CFmMIMO#毫米波#波束成形aarXiv cs.LG@Sina Tavakolian 等 5 人原文稍后读已读值得跟进有用关注 GNN
论文Agent 与开发者精选10:20黑盒LLM API指纹识别研究:令牌计数不能作为模型血统依据OpenAI兼容API的令牌计数能识别共享标记化堆栈,但不能单独用于确定模型家族关系,Qwen 3.8和DeepSeek V4变体测试低于阈值。#LLM#API#Qwen#DeepSeekaarXiv: DeepSeek@Bo Chen原文稍后读已读值得跟进有用关注 LLM
论文精选73°10:18多图像物体幻觉基准MIOH发布MIOH基准帮你看清多模态模型在复杂视觉推理中的真实表现,GPT-5和Gemini-2.5-Pro也不例外。#MIOH#多图像物体幻觉#MLLMs#GPT-5aarXiv cs.AI@Joonki Min 等 7 人原文稍后读已读值得跟进有用关注 MIOH
论文10:17PyKEEN-NSX:知识图谱负采样框架PyKEEN团队推出新框架,让知识图谱负采样更灵活,兼容现有工作流。#PyKEEN#PyKEEN-NSX#知识图谱#负采样aarXiv cs.AI@Ivan Diliso 等 3 人原文稍后读已读值得跟进有用关注 PyKEEN
论文精选73°10:17几何发散:追踪隐藏状态轨迹实现自适应多轮推理这篇论文用几何方法追踪LLM推理轨迹,能提前发现错误路径,提升任务成功率还降低token成本。#LLM#多轮推理#隐藏状态#τ-BenchaarXiv cs.AI@Jie Liang 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°10:17BiG-SURE:大模型语义不确定性估计方法BiG-SURE能帮你评估黑盒大模型的不确定性,无需访问模型参数,简单实用。#BiG-SURE#LLMs#VLMs#不确定性估计aarXiv cs.AI@Debarpan Bhattacharya 等 3 人原文稍后读已读值得跟进有用关注 BiG-SURE
论文10:17GMTS方法提升LLM推理训练效果GMTS方法让LLM推理训练更高效,前20%标记选择比传统熵方法表现更好。#GMTS#RLVR#LLM#推理模型aarXiv cs.AI@Outongyi Lv 等 3 人原文稍后读已读值得跟进有用关注 GMTS
论文10:16视觉定位的高效主动学习方法这个新方法能让视觉定位标注快1.6倍,特别适合需要大量标注数据的团队。#视觉定位#主动学习#RIS#RECaarXiv cs.AI@Junbeom Hong 等 5 人原文稍后读已读值得跟进有用关注 视觉定位
论文精选73°10:16合成数据中的隐蔽威胁研究MIT学者发现合成数据能偷偷给AI注入偏见,即使数据本身看起来完全无害。#合成数据#社会偏见#大模型#AI安全aarXiv cs.AI@Minkyung Cho 等 7 人原文稍后读已读值得跟进有用关注 合成数据
论文10:16大模型通过持续预训练适应瑞典新闻业瑞典学者用新闻数据微调大模型,发现经验回放能防止遗忘,提升新闻写作质量。#Swedish journalism#continued pre-training#经验回放#大模型微调aarXiv cs.AI@Lukas Borggren 等 3 人原文稍后读已读值得跟进有用关注 Swedish journalism
论文10:15电商生成式检索:联合学习嵌入与码本电商检索新方法,联合训练嵌入和码本,解决了传统两阶段训练的错误累积问题。#生成式检索#电商#嵌入模型#码本aarXiv cs.AI@Songtao Fang 等 5 人原文稍后读已读值得跟进有用关注 生成式检索
论文10:15DiffSAC:扩散引导的鲁棒估计采样方法DiffSAC用扩散模型优化采样过程,只需评估几十个假设就能达到传统方法数万个假设的效果,大幅提升计算机视觉鲁棒估计效率。#DiffSAC#扩散模型#鲁棒估计#计算机视觉aarXiv cs.AI@Chang Nie 等 4 人原文稍后读已读值得跟进有用关注 DiffSAC
论文精选73°10:15基于模型检查的LLM后验解释器自动测试这篇论文教你如何用模型检查方法自动验证LLM生成的解释是否可靠,比随机测试发现更多问题。#LLM#后验解释器#模型检查#MDP环境aarXiv cs.AI@Dennis Gross, Helge Spieker原文稍后读已读值得跟进有用关注 LLM
模型78°10:14TuringLLM推出20B参数专家混合模型Turing团队发布20B参数专家混合模型,每激活2B参数,性能接近9B模型,支持超长上下文。#TuringLLM#Turing-20B-A2B#专家混合模型#长上下文aarXiv cs.AI@Yuheng Zhang 等 22 人原文稍后读已读值得跟进有用关注 TuringLLM
论文精选73°10:12Q-Strata:混合精度量化新方法SNU MLLab团队发布Q-Strata,解决了MoE模型混合精度量化的难题,比现有方法性能更好。#Q-Strata#MoE#混合精度量化#Mixtral-8x7B-InstructaarXiv cs.AI@Deokjae Lee 等 3 人原文稍后读已读值得跟进有用关注 Q-Strata
论文精选73°10:12AdaPath:生物医学知识图谱问答新框架AdaPath 解决了生物医学知识图谱问答中的路径查找难题,在复杂查询中表现优异。#AdaPath#BioStrat-QA#知识图谱#生物医学aarXiv cs.AI@Jun Hyeong Kim 等 4 人原文稍后读已读值得跟进有用关注 AdaPath
论文精选73°10:12CHAP:个性化生成检索新框架CHAP框架解决了生成检索的语义鸿沟问题,通过层次语义对齐和残差级联生成,提升个性化检索效果。#CHAP#生成检索#个性化推荐#语义对齐aarXiv cs.AI@Gaoming Zhang 等 7 人原文稍后读已读值得跟进有用关注 CHAP
论文73°10:11GarmentWeaver:多模态服装结构化生成GarmentWeaver能从草图和文本生成可执行缝纫模式,比现有方法更准确且兼容性好。#GarmentWeaver#多模态#服装设计#视觉语言模型aarXiv cs.AI@Yinwen Lu 等 3 人原文稍后读已读值得跟进有用关注 GarmentWeaver
论文精选73°10:11可审计的LLM定性主题分析工作流设计这篇论文展示了如何用LLM做可追溯的主题分析,工作流程透明,还能保护隐私。#Thematic Analysis#LLM#qualitative analysis#可审计工作流aarXiv cs.AI@Nadia Jul Jeldtoft, Tariq Yousef原文稍后读已读值得跟进有用关注 Thematic Analysis