论文11:25语言模型欺骗研究的因果框架这篇论文提出了语言模型欺骗研究的因果框架,区分了欺骗行为与欺骗机制,通过实验验证了看似欺骗的行为不一定有相应机制支持。#语言模型#欺骗机制#因果框架#开源模型aarXiv cs.AI@Yakov Pyotr Shkolnikov原文稍后读已读值得跟进有用关注 语言模型
模型精选73°11:25SENTINEL-RL:安全运营中心拓扑推理分离架构Sentinel-RL解决了LLM在安全运营中的两大瓶颈,能快速处理大规模网络拓扑,推荐更准确的 containment 行动。#SENTINEL-RL#PPO#SOC#拓扑推理aarXiv cs.AI@Uday Vallabhaneni 等 3 人原文稍后读已读值得跟进有用关注 SENTINEL-RL
模型精选73°11:25Terminal-Universe:将代理轨迹转化为可扩展终端环境Terminal-Universe能把代码执行轨迹变成可复用环境,让Qwen3.5-27B在终端任务上提升近12分。#Terminal-Universe#Qwen3.5-27B#Terminal-Bench#代码代理aarXiv cs.AI@Jie Wu 等 14 人原文稍后读已读值得跟进有用关注 Terminal-Universe
论文精选73°11:24人机交互实现测试时高效适应TAHI方法让人机交互数据成为缩小专业差距的信号,适应后的模型不仅个人任务成功率提升,还能跨用户泛化。#TAHI#人机交互#测试时适应#写作aarXiv cs.AI@Zora Zhiruo Wang 等 25 人原文稍后读已读值得跟进有用关注 TAHI
论文Agent 与开发者精选73°11:24AI智能体自然语言交互协议标准发布Ecma International发布NLIP标准,让不同AI智能体框架能互相通信,支持多种传输协议。#NLIP#AI智能体#MCP#A2AaarXiv cs.AI@Luyi Xing 等 12 人原文稍后读已读值得跟进有用关注 NLIP
论文多源确认11:23终端智能体环境演化方法研究研究人员提出环境演化方法,让终端智能体训练环境持续变难,在Qwen模型上提升了18%性能。#环境演化#终端智能体#Qwen3.6#Claude Opus3 个信源在谈事件专题aarXiv cs.AI@Zhiyuan Fan 等 12 人4 个信源在谈原文稍后读已读值得跟进有用关注 环境演化
论文11:23大语言模型推荐的认识论依据研究这篇论文提出了评估LLM推荐可信度的认识论担保框架,帮你判断何时该相信AI建议。#LLM#epistemic warrant#认识论担保#AI可靠性aarXiv cs.AI@Shai Vardi, João Sedoc原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:22Gated DeltaNet在4位量化中保持性能的机制研究Minima团队把Qwen3.8-27B全量化到4位,性能不变还更小更快,揭秘了混合模型递归部分为什么好量化。#Gated DeltaNet#Qwen3.8-27B#NVFP4#量化1 个信源在谈事件专题aarXiv cs.AI@Sergii Kozyrev, Davyd Maiboroda2 个信源在谈原文稍后读已读值得跟进有用关注 Gated DeltaNet
论文精选73°11:22通过训练编译:将自然语言规范转为本地神经函数OpenAI新方法把自然语言描述变成可复用的本地神经函数,比远程调用更快,还部署了实际应用案例。#compile by training#FuzzyBench-Hard#神经函数#自然语言规范aarXiv cs.LG@Yuntian Deng 等 3 人原文稍后读已读值得跟进有用关注 compile by training
论文精选11:21黑盒LLM评估器可靠性研究失败OpenAI等公司的模型评估可能存在严重可靠性问题,同一模型在不同时间点表现差异巨大。#LLM#评估可靠性#模型评估#SpearmanaarXiv cs.LG@Haoyaun Zhu, Jie Zhang原文稍后读已读值得跟进有用关注 LLM
论文11:21思维链推理中可读性与可解释性的差异研究思维链文本的可读性不等于可解释性,研究揭示了LLM判断推理步骤重要性的局限性。#思维链#可解释性#LLM#推理模型aarXiv cs.LG@Kevin Du 等 4 人原文稍后读已读值得跟进有用关注 思维链
论文11:20低成本微型车自动驾驶开源平台发布MIT开源了微型自动驾驶平台,结合数字孪生技术,误差比纯实车训练更低。#自动驾驶#Ackermann#Webots#模仿学习aarXiv cs.LG@Gustavo Claudio Karl Couto 等 3 人原文稍后读已读值得跟进有用关注 自动驾驶
论文精选73°11:20前瞻性编码提升深度连续时间循环网络学习研究人员提出前瞻性编码方法,解决了深度循环网络中底层信号延迟和顶层误差衰减问题,在多个模型上提升了性能。#RQFs#连续时间循环网络#前瞻性编码#状态空间模型aarXiv cs.LG@Shivang Rawat 等 4 人原文稍后读已读值得跟进有用关注 RQFs
论文精选73°11:19顺序优于联合:RLVR与OPD方法对比研究OpenAI等机构常用方法被挑战,论文证明先OPD后RL的两阶段训练效果更好,还给出了实用切换信号。#RLVR#OPD#大模型推理#强化学习aarXiv cs.LG@Boyan Li 等 6 人原文稍后读已读值得跟进有用关注 RLVR
论文精选73°11:19硬件感知的FP4 FlashAttention-4NVIDIA研究团队推出Direct-P方法,解决了Blackwell FP4张量核心在注意力计算中的瓶颈问题。#FlashAttention-4#FP4#Blackwell#Direct-PaarXiv cs.LG@Robert Hu原文稍后读已读值得跟进有用关注 FlashAttention-4
论文精选73°11:18DRACO:动态评分细粒度信用分配IBM发布DRACO,解决长周期智能体训练中信用分配问题,无需验证器就能提升15.9分。#DRACO#GRPO#智能体#信用分配aarXiv cs.LG@Shubham Gandhi 等 4 人原文稍后读已读值得跟进有用关注 DRACO
论文11:18退化扩散模型的条件化研究论文解决了退化扩散模型条件化的难题,提出基于因果最优传输的新方法,适用于传统分数函数失效的场景。#扩散模型#因果最优传输#条件生成#退化扩散aarXiv cs.LG@Uğur Aydın, Tamer Başar原文稍后读已读值得跟进有用关注 扩散模型
论文精选73°11:17PreferenceEKF 实现高效主动奖励学习PreferenceEKF 用子空间推理解决奖励模型不确定性问题,比传统贝叶斯方法更高效。#PreferenceEKF#RLHF#强化学习#贝叶斯方法aarXiv cs.LG@Yutai Zhou, Erdem Bıyık原文稍后读已读值得跟进有用关注 PreferenceEKF
论文精选11:17单层注意力中布尔函数的头部复杂度这篇论文揭示了单层注意力模型中布尔函数计算的头部需求边界,为理解Transformer架构的计算能力提供了理论基础。#Transformer#注意力机制#布尔函数#计算复杂度aarXiv cs.LG@Rajmohan Rajaraman 等 3 人原文稍后读已读值得跟进有用关注 Transformer
论文精选73°11:15FLY-EVAL++:安全约束飞行评估协议FLY-EVAL++为飞行预测任务提供新评估标准,发现LLM在安全约束下存在显著差异,比单纯看准确率更重要。#FLY-EVAL++#Flight Trajectory and Attitude Prediction#LLM#安全评估aarXiv cs.LG@Yalun Wu 等 9 人原文稍后读已读值得跟进有用关注 FLY-EVAL++
论文11:14LLM4CKD:大模型用于慢性肾病早期筛查斯坦福团队提出LLM4CKD框架,用少量数据就能做肾病筛查,比传统方法更灵活。#LLM4CKD#慢性肾病#零样本学习#少样本学习aarXiv cs.LG@Muhammad Ashad Kabir, Sirajam Munira原文稍后读已读值得跟进有用关注 LLM4CKD
论文73°11:14可微分混合建模优化化学传输过程这篇论文提出了一个结合物理模型和神经网络的混合框架,能从实验数据自动发现本构定律,比传统黑盒模型更具物理一致性。#JAX#种群平衡方程#可微分建模#化学工程aarXiv cs.LG@Arthur Jessop 等 4 人原文稍后读已读值得跟进有用关注 JAX
模型中美对照精选73°11:14零售供应链需求适应的智能体框架零售供应链需求适应有新框架,用GPT/Qwen/DeepSeek提升成功率7%。#零售供应链#智能体#GPT#QwenaarXiv: DeepSeek@Lei Zheng 等 6 人原文稍后读已读值得跟进有用关注 零售供应链
论文11:13LLM能否从代码提交中提取架构设计决策研究测试了四种大模型从代码提交中提取架构设计决策的能力,发现虽有一定效果但仍有改进空间。#LLM#架构设计决策#代码提交#Gemini 3 Pro1 个信源在谈事件专题aarXiv: DeepSeek@Amey Karan 等 4 人2 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文多源确认精选73°11:13KC-Bench:评估LLM智能体知识冲突的动态基准研究人员发布了KC-Bench基准,专门测试AI智能体如何处理知识冲突,九个主流模型测试结果都不理想。#KC-Bench#LLM Agents#知识冲突#基准测试4 个信源在谈事件专题aarXiv: DeepSeek@Yaxing Lyu 等 5 人5 个信源在谈原文稍后读已读值得跟进有用关注 KC-Bench
论文精选11:12LLM推理轨迹中的预算与难度混淆问题DeepSeek-R1等模型推理轨迹中的'突破'可能只是难度信号,真正有价值的信息很少。#LLM#推理轨迹#DeepSeek-R1#MATHaarXiv: DeepSeek@Yigit Utku Bulut原文稍后读已读值得跟进有用关注 LLM
模型多源确认精选73°11:12Jina-OCR-v1发布:低成本GPU文档解析模型Jina团队发布了Jina-OCR-v1,能在低成本GPU上高效处理文档,速度翻倍且精度高。#Jina-OCR-v1#DeepSeek-OCR#FastMTP#文档解析2 个信源在谈事件专题aarXiv: DeepSeek@Alejandro Barón García 等 4 人3 个信源在谈原文稍后读已读值得跟进有用关注 Jina-OCR-v1
论文精选73°11:10LLM代码生成中的复合提示约束研究OpenAI等模型在复合提示下表现差异大,JSON+专家角色+中等紧急程度组合导致GPT-4o-mini性能下降12.2个百分点。#LLM#代码生成#提示工程#HumanEval+aarXiv: OpenAI@Shrenik Jadhav 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°12:19TRACE框架实现自主机器人决策可追溯TRACE框架让自主机器人决策过程完全可追溯,解决了深度学习模型不可解释的问题。#TRACE#自主机器人#可解释AI#欧盟AI法案aarXiv cs.AI@Cagri Temel原文稍后读已读值得跟进有用关注 TRACE
论文精选73°12:18电信网络根因分析的结构化推理框架电信专家团队用LLM解决5G/6G网络故障诊断,通过结构化推理减少幻觉,比传统方法更准更可靠。#LLM#电信#根因分析#5GaarXiv cs.AI@Hao Zhou 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°12:17SafeEvolve:基于智能体经验的策略协同进化框架SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。#SafeEvolve#Qwen3.5-4B#AgentDojo#安全对齐aarXiv cs.AI@Qinghua Mao 等 11 人原文稍后读已读值得跟进有用关注 SafeEvolve
论文12:17工厂智能体子网络选择测量驱动方法工厂智能体如何通过子网络选择在有限硬件上高效运行,实测功耗仅1.3-5瓦。#工厂智能体#检索增强#子网络选择#边缘计算aarXiv cs.AI@Vasileios Rizeakos 等 5 人原文稍后读已读值得跟进有用关注 工厂智能体
论文精选73°12:16双层协调反射:多智能体LLM系统的博弈论方法清华团队提出多智能体LLM系统的博弈论框架,新算法在SWE-bench上超越基准2.2个百分点。#多智能体#LLM系统#博弈论#SWE-benchaarXiv cs.AI@Yihang Chen 等 6 人原文稍后读已读值得跟进有用关注 多智能体
模型Agent 与开发者精选73°12:16Repo-To-Skill:将GitHub仓库提炼为AI技能DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。#DisCo#GPT-5.5#MLE-bench#PaperBenchaarXiv cs.AI@Jianlyu Chen 等 11 人原文稍后读已读值得跟进有用关注 DisCo
论文Agent 与开发者78°12:15RVSD框架减少视觉语言模型幻觉清华团队提出RVSD框架,不用训练就能减少大视觉语言模型的幻觉,效果还特别好。#RVSD#视觉语言模型#视觉幻觉#语义空间视觉检索aarXiv cs.AI@Canjie Liu 等 4 人原文稍后读已读值得跟进有用关注 RVSD
论文精选73°12:14DKL:解耦知识学习提升指令模型DKL解决了RAG检索失败时的问题,比RAFT和PA-RAG方法更高效,还能保持指令模型的指令跟随能力。#DKL#RAG#Instruct LLM#知识注入aarXiv cs.AI@Kushagra Bhushan 等 10 人原文稍后读已读值得跟进有用关注 DKL
论文精选73°12:14黑盒大模型幻觉检测研究这篇论文教你如何检测黑盒大模型的幻觉,有4种方法可选,无需监督标签也能用。#LLMs#幻觉检测#语义熵#token不确定性aarXiv cs.AI@Urja Pawar 等 7 人原文稍后读已读值得跟进有用关注 LLMs
论文精选73°12:13Loom:通过嵌入空间重加权实现文本共识Loom框架通过嵌入空间重加权技术,在保持高准确率的同时大幅提升推理速度,适合工业场景的根因分析任务。#Loom#OpenRCA#根因分析#嵌入空间aarXiv cs.AI@Ron Begleiter 等 4 人原文稍后读已读值得跟进有用关注 Loom
论文多源确认精选73°12:09GRADSOLVE:GPU上ODE集合的快速精确梯度计算GRADSOLVE解决了ODE集合在GPU上求解与反向微分速度不匹配的问题,大幅提升计算效率。#GRADSOLVE#JAX#ODE#GPU7 个信源在谈事件专题aarXiv cs.LG@Alessio Spurio Mancini8 个信源在谈原文稍后读已读值得跟进有用关注 GRADSOLVE
论文精选73°12:06Cliff:从首次错误中学习过程奖励研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。#Cliff#RLVR#强化学习#推理模型aarXiv cs.LG@Peixuan Han 等 6 人原文稍后读已读值得跟进有用关注 Cliff