论文12:06Web Agent判别式世界模型研究斯坦福团队新论文提出Web Agent世界模型新训练方法,在WebArena基准上表现更好。#WebArena#Web Agent#世界模型#PRMaarXiv cs.LG@Kelvin Li 等 9 人原文稍后读已读值得跟进有用关注 WebArena
论文12:06语音脑机接口的通用通信度量OpenAI团队提出OVMI指标,解决了语音BCI系统难以比较的问题,优化后准确率提升16.3%。#语音脑机接口#OVMI#互信息#脑机接口aarXiv cs.LG@Dulhan Jayalath 等 3 人原文稍后读已读值得跟进有用关注 语音脑机接口
论文精选73°12:05PARSER方法压缩MoE大模型PARSER方法通过输出重要性指标优化MoE模型压缩,在相同内存减少下提升模型精度。#MoE#PARSER#Qwen#DeepSeekaarXiv: DeepSeek@Seungwoo Jung 等 7 人原文稍后读已读值得跟进有用关注 MoE
论文12:05AICOME框架验证AI测量个体与群体效应AICOME框架能从现有数据中恢复重要理论构念,周工作时长验证效果最佳,但信息受限时性能会下降。#AICOME#CFPS#情境测量#调查数据aarXiv cs.LG@Wenxin Jiang 等 3 人原文稍后读已读值得跟进有用关注 AICOME
论文11:53Graph Machine:通过边实现更优预训练Graph Machine 用边对象替代传统状态,在 Qwen3-0.6B 上预训练时,稀疏层仅需少量检索就能保持性能。#Graph Machine#Qwen3-0.6B#Transformer#稀疏路由aarXiv cs.LG@Lintai Hou原文稍后读已读值得跟进有用关注 Graph Machine
论文11:51语言不可读性对LLM安全的影响这篇论文揭示了LLM安全监控的盲点,提出了不依赖语言输出的沙箱防护方案。#LLM#语言不可读性#AI安全#沙箱aarXiv cs.LG@James Mickens原文稍后读已读值得跟进有用关注 LLM
模型Agent 与开发者多源确认78°11:51Nemotron-3模型在编程竞赛中超越人类金牌选手NVIDIA训练的编程竞赛模型首次在IOI中击败人类冠军,分数535.4远超金牌线361.12。#Nemotron-3#IOI#编程竞赛#GenCorrect2 个信源在谈事件专题aarXiv cs.LG@Aleksander Ficek 等 5 人3 个信源在谈原文稍后读已读值得跟进有用关注 Nemotron-3
论文精选73°11:51UE5M3 FP4块缩放实现稳定语言模型预训练NVIDIA提出新方法让FP4预训练更稳定,训练速度提升21.2%,模型性能全面超越现有方案。#Nemotron-H#FP4#UE5M3#量化训练aarXiv cs.LG@Robert Hu 等 3 人原文稍后读已读值得跟进有用关注 Nemotron-H
论文精选73°11:50Trace as State:长上下文Transformer的条件状态更新DeepSeek和GLM-5.2通过将推理痕迹前置,长上下文推理准确率大幅提升,最高达100%。#Trace as State#DeepSeek V4 Pro Preview#GLM-5.2#长上下文aarXiv: DeepSeek@Xu Zou, Jie Tang原文稍后读已读值得跟进有用关注 Trace as State
论文多源确认精选73°11:49大模型与本体排序器融合提升罕见病诊断研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。#本体排序器#罕见病诊断#大语言模型#DeepSeek-V4-Flash3 个信源在谈事件专题aarXiv: DeepSeek@Zhaoyang Jiang 等 8 人4 个信源在谈原文稍后读已读值得跟进有用关注 本体排序器
论文精选73°11:49FUSE框架评估LLMs危险能力FUSE框架首次系统评估了12个商业LLM的危险能力,发现模型间存在显著差异,新模型知识增强但安全提升有限。#FUSE#LLMs#Claude#DeepSeekaarXiv: DeepSeek@Zhengyi Jin 等 8 人原文稍后读已读值得跟进有用关注 FUSE
论文多源确认11:47语言模型中的门脸效应与拒绝行为研究Anthropic模型对人类说服技巧有反应,而OpenAI和Google模型反而更抗拒,这种差异很有意思。#Opus 5#门脸效应#拒绝行为#大语言模型10 个信源在谈事件专题aarXiv: OpenAI@Til Jordan11 个信源在谈原文稍后读已读值得跟进有用关注 Opus 5
论文11:44语言模型概率预测一致性研究荷兰书利润方法评估语言模型预测一致性,发现模型在概率预测上存在显著不一致,尤其在复杂逻辑关系下更明显。#语言模型#概率预测#荷兰书#一致性aarXiv cs.LG@Isaiah Andrews, Suproteem Sarkar原文稍后读已读值得跟进有用关注 语言模型
论文精选11:44可调线性生成先验在压缩传感中的全模型最优性这篇论文揭示了压缩传感中可调线性生成先验的理论边界,解释了为什么神经网络先验的可调性在实际应用中有效。#压缩传感#生成先验#线性模型#重建误差aarXiv cs.LG@Zhaoming Li, Paul Hand原文稍后读已读值得跟进有用关注 压缩传感
论文精选73°11:43CodePoisonRAG:检索增强代码生成知识投毒攻击研究人员展示了如何针对代码生成系统进行精准知识投毒,成功率高达93%,连安全防御都难以完全阻挡。#CodePoisonRAG#RACG#CWE#代码生成aarXiv cs.LG@Varun Gadey 等 3 人原文稍后读已读值得跟进有用关注 CodePoisonRAG
论文精选73°11:43从重加权到重写:解锁训练数据归因中样本的干预效果研究人员发现影响函数选中的样本通过重写而非重加权能更有效改变模型行为,这对训练数据归因方法评估有重要启示。#训练数据归因#影响函数#开源大模型#干预效果aarXiv cs.LG@Yuzhang Luo 等 4 人原文稍后读已读值得跟进有用关注 训练数据归因
论文11:42表格基础模型是否了解物理原理这篇论文测试了4个表格模型在316个物理方程上的表现,发现它们能插值物理但不懂单位和噪声机制。#TabPFN#TabDPT#表格基础模型#物理模型aarXiv cs.LG@Wassim Tenachi 等 4 人原文稍后读已读值得跟进有用关注 TabPFN
论文73°11:42医疗问答中的误导上下文机制研究医疗AI研究团队发现模型对断言比对证据更易受影响,开放推理轨迹能更好检测错误决策。#MedMisBench#医疗问答#推理模型#LLM监控aarXiv cs.LG@Robin Linzmayer, Noémie Elhadad原文稍后读已读值得跟进有用关注 MedMisBench
论文精选73°11:42HiPoly:分层聚合物原生AI框架HiPoly框架能从实验数据直接预测聚合物性质并设计可持续替代品,比传统方法更高效准确。#HiPoly#G2RINS#聚合物#分子设计aarXiv cs.LG@Ge Sun 等 8 人原文稍后读已读值得跟进有用关注 HiPoly
论文78°11:40语言模型可自主控制注意力机制新DA协议让模型自己决定关注哪部分内容,大幅减少计算量,Gemma和Qwen模型效果显著。#声明式注意力#Gemma-4-31B#Qwen-3.6-27B#长上下文1 个信源在谈事件专题aarXiv cs.LG@Namgyu Ho 等 6 人2 个信源在谈原文稍后读已读值得跟进有用关注 声明式注意力
论文精选73°10:15大模型自动注入智能合约漏洞论文展示用大模型自动生成带漏洞的智能合约,帮助测试安全工具,发现现有分析工具的局限性。#智能合约#大模型#漏洞检测#SolidityaarXiv cs.AI@Luca Migliaccio 等 5 人原文稍后读已读值得跟进有用关注 智能合约
论文10:12生成式AI对集体创造力的影响研究这篇论文分析了AI如何影响人类创造力,提出混合团队表现优于单一团队,探讨了AI与人类创意互补的可能性。#生成式AI#创造力#混合团队#文化创作aarXiv cs.AI@Mason Youngblood 等 7 人原文稍后读已读值得跟进有用关注 生成式AI
论文10:12大语言模型在市场机制中的竞争行为研究这篇论文测试了GPT、Claude等LLM在真实市场机制中的表现,发现它们比人类效率低,还公开了测试框架。#LLM#双向拍卖#市场均衡#思维链aarXiv cs.AI@Pawel Struski 等 4 人原文稍后读已读值得跟进有用关注 LLM
论文73°10:09UGC增强图像异常感知数据集与框架OpenAI发布新数据集和方法,专门解决社交媒体图片增强后的异常检测问题,比传统方法更准确。#UEAP-4k#DFAP-UGC#UGC#图像增强aarXiv cs.AI@Yan Zhong 等 7 人原文稍后读已读值得跟进有用关注 UEAP-4k
论文精选73°10:09文本到图像模型视觉隐喻生成基准研究研究人员发布了首个视觉隐喻生成基准,测试了11个模型,发现即使是最好的模型在隐喻表达方面也有明显不足。#VMetaphor-Bench#T2I#视觉隐喻#文本到图像aarXiv cs.AI@Chuer Chen 等 5 人原文稍后读已读值得跟进有用关注 VMetaphor-Bench
论文精选73°10:08ViSAR:无需训练的自适应k检索方法ViSAR让文档问答系统更聪明,能根据问题复杂度自动调整检索页面数,速度提升近六成还不影响准确率。#ViSAR#DocVQA#RAG#视觉文档问答aarXiv cs.AI@Adrien Mialland 等 4 人原文稍后读已读值得跟进有用关注 ViSAR
论文Agent 与开发者精选73°10:02CivBench:文明VI中的长期智能体基准测试MIT团队发布文明VI智能体基准测试,揭示AI在长期规划中的监控和执行缺陷。#CivBench#文明VI#智能体#MCPaarXiv cs.AI@Austin Tudor David Andrews 等 6 人原文稍后读已读值得跟进有用关注 CivBench
论文10:01通过教育解决AI系统信任问题ICE-T框架通过三种教学要素帮助学习者建立对AI系统的适当信任,解决了机器学习教育中的黑盒问题。#ICE-T#机器学习教育#AI素养#信任校准aarXiv cs.AI@Pierre Haritz 等 3 人原文稍后读已读值得跟进有用关注 ICE-T
论文精选73°10:00UTP-Bench:不确定性旅行规划基准UTP-Bench用真实数据测试GPT-5等模型,发现它们在时间缓冲、延迟感知和人群敏感规划方面与人类计划差距明显。#UTP-Bench#GPT-5#Qwen3#旅行规划aarXiv cs.AI@Etcharla Revanth Rao 等 6 人原文稍后读已读值得跟进有用关注 UTP-Bench
论文精选10:00世界观模拟增强多轮越狱攻击效果研究这篇论文揭示了多轮越狱攻击的机制,提出了BLUEPRINT框架,能以最少查询次数实现高成功率攻击。#BLUEPRINT#WORLDSIM#越狱攻击#安全评估aarXiv cs.AI@Siyu Chen 等 6 人原文稍后读已读值得跟进有用关注 BLUEPRINT
论文精选73°09:59稀疏专家模型路由几何与动力学共享证据斯坦福团队揭示稀疏专家模型路由层间共享几何结构,能预测跨层路由行为,提升模型效率。#稀疏专家模型#MoE#路由#几何结构aarXiv cs.AI@Kirill Labzin 等 4 人原文稍后读已读值得跟进有用关注 稀疏专家模型
论文09:13基于语音印象引导的伪三元组可扩展方向跟随TTSNTT研究团队发布新方法,让TTS系统能根据表演方向修改语音,无需大量训练数据。#TTS#LLM#语音合成#伪三元组aarXiv cs.LG@Kenichi Fujita, Yusuke Ijima原文稍后读已读值得跟进有用关注 TTS
论文09:13后验平均估计源分布方法这篇论文提出了一种改进的源分布估计方法,通过期望最大化解决了现有方法在参数空间不准确区域的问题。#源分布估计#后验平均#期望最大化#Lotka-VolterraaarXiv cs.LG@Trung-Dung Hoang, Lisa M. Koch原文稍后读已读值得跟进有用关注 源分布估计
论文09:13基于学习的点云坐标加密攻击研究论文揭示了点云加密方案的安全漏洞,2X加密模式下机器学习仍能重建加密数据。#点云#坐标加密#机器学习#PointNetaarXiv cs.LG@Mohammad Waquas Usmani 等 3 人原文稍后读已读值得跟进有用关注 点云
论文精选73°09:12英国气象局模型集成分布式强化学习英国气象局将强化学习集成到全球天气预报模型,显著降低多个纬度带的预报误差。#Met Office#Unified Model#强化学习#天气预报aarXiv cs.LG@Pritthijit Nath 等 5 人原文稍后读已读值得跟进有用关注 Met Office
论文精选73°09:12ProbeMatchDTI:探针驱动的多尺度生化模式匹配ProbeMatchDTI框架能保留弱生化模式,在药物-靶点预测上超越现有方法2个百分点,代码已开源。#ProbeMatchDTI#药物-靶点相互作用#生化模式匹配#药物发现aarXiv cs.LG@Quan Hao 等 11 人原文稍后读已读值得跟进有用关注 ProbeMatchDTI
论文精选73°09:12多教师蒸馏方法提升多领域大模型性能MT-SDPO方法让每个样本选择最可靠的教师,而非按领域匹配,大幅提升多领域大模型性能。#MT-SDPO#Qwen3-8B#多教师蒸馏#大模型aarXiv cs.LG@Xixiang He 等 7 人原文稍后读已读值得跟进有用关注 MT-SDPO
论文精选73°09:11TrajMind:角色专用LoRA链式轨迹异常诊断TrajMind用快慢双路径解决轨迹异常检测,既保持高效监控又能精准诊断,跨城市表现稳定。#TrajMind#LoRA#轨迹异常#视觉-语言模型aarXiv cs.LG@Jiahao Wu 等 4 人原文稍后读已读值得跟进有用关注 TrajMind
论文73°09:11QUEST方法提升不确定知识图谱补全QUEST方法改进了不确定知识图谱补全,通过谱初始化和图正则化提升了预测准确性和训练稳定性。#QUEST#UKG#知识图谱#谱初始化aarXiv cs.LG@Md Abrar Jahin 等 4 人原文稍后读已读值得跟进有用关注 QUEST
论文73°09:10测试时适应框架的教师-学生方法重新思考这篇论文提出了一个简单的改进方法,让教师模型不更新权重,就能显著提升测试时适应的性能。#Test-Time Adaptation#teacher-student#intransigent teacher#语义分割aarXiv cs.LG@Damian Sójka 等 4 人原文稍后读已读值得跟进有用关注 Test-Time Adaptation