10:03官方账号arXiv cs.AI@Chetan Arora, Andreas Vogelsang, Abbi Sharma该论文提出代理型AI系统的需求工程需明确委托自治边界,即决定哪些任务可委托给系统、授权等级及监督方式。作者设计了两个工件:Agency Justification Record (AJR) 帮助团队判断何时需要代理而非简单替代方案;Agentic Delegation Policy (ADP) 涵盖目的、权限、信息、协调、保障和演化六个维度,其中权限采用分级模型。论文通过两个对比案例(安全关键的医院出院协调代理和自动代码审查代理)展示了框架应用。论文AJRADP需求工程推荐理由:做AI代理开发?这篇论文提出了AJR和ADP两个实用工具,帮你理清什么该委托给代理、怎么设定权限等级,比直接写prompt靠谱多了。原文稍后读已读值得跟进有用关注 AJR
10:02官方账号arXiv cs.AI@Pilsung Kang该论文将量子问题顺序模型中的QQ等式发展为审计自回归大语言模型(LLMs)顺序判断的标准。理论表征了满足QQ等式的机制类别,包括边际独立核和极性依赖重复家族。方法上开发了预指定审计流水线,结合最坏情况鲁棒性包络、采样一致性抽查和饱和诊断。在开放权重指令微调模型上进行的初步实验中,所有预指定的健康门通过,但17/18和7/8项目对饱和(近确定性),没有项目通过残差上下文认证。论文QQ equalityLLM审计问题顺序效应推荐理由:这篇论文用QQ等式定量审计LLM的顺序效应,还给出了理论机制和实用流水线,适合对模型行为一致性感兴趣的人读。原文稍后读已读值得跟进有用关注 QQ equality
10:01官方账号arXiv cs.AI@Yunze Han研究者对Qwen2.5-Coder-7B-Instruct模型在SWE-trajectory数据集(67,074条轨迹,32,161条已解决)上进行LoRA微调,提出效率和风格两维度质量评分框架,并通过16组对照实验分析策略、规模与消融。在7B模型SWE-bench解决率近零的情况下,采用交叉熵损失替代评估,发现其与ROUGE-L完全秩相关(Spearman ρ=-1.00)。结果揭示规模依赖的质量-数量权衡:500到1000条时数据翻倍降低约12.7%损失,但TopQ与随机差距小于1%;2000条时差距扩大到3.6%(p=0.016)。消融实验确认错误重试率是主导子维度,表现与完整复合指标相当(Δ<0.2%)。论文Qwen2.5-CoderLoRASWE-trajectory推荐理由:这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
09:53官方账号arXiv cs.LG@Photios A. Stavrou, Giuseppe Serra, Marios Kountouris传统率失真理论使用均方误差等失真度量,但难以捕捉感知质量。率失真感知理论引入感知作为第三轴,通过源信号与重构信号之间的分布相似性量化。本教程综述了感知感知压缩的编码原则,以及不同随机性假设下的可达性结果。它提供了计算Blau和Michaeli定义的率失真感知函数的统一优化视角,涵盖离散和连续源下的f-散度、α-散度和Wasserstein度量。还介绍了交替最小化、牛顿法和凸优化等计算工具,以及高斯源和完美现实主义等可解析情形。论文率失真感知理论压缩信息论推荐理由:想搞懂压缩里的感知极限吗?这篇教程把率失真感知理论的计算方法和多种散度度量讲透了,比泛泛的综述实在得多。原文稍后读已读值得跟进有用关注 率失真感知理论
09:52官方账号arXiv cs.LG@Joseph Lazzaro, Alessio Russo, Aldo Pacchiano本文研究在线表格强化学习中的最佳策略识别问题,提出首个非渐近样本复杂度保证。算法Navigate and Stop (NaS)的样本复杂度依赖于特征时间、MDP的连通性、最优特征时间的曲率等实例相关量。研究填补了NaS算法在非渐近分析上的空白,明确了各因素对样本复杂度的贡献。论文NaS算法BPI强化学习推荐理由:这篇论文给NaS算法提供了非渐近保证,解释了样本复杂度受哪些因素影响,做强化学习理论的朋友可以看看。原文稍后读已读值得跟进有用关注 NaS算法
09:50官方账号arXiv cs.LG@Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen论文在整数算术任务上发现,vanilla Transformer模型可通过人类有效学习方法提升性能。通过将算术任务分解为子任务并做损失收敛顺序分析,揭示LLM学习模式与人类相似,简单子任务学习更快。应用人类问题解决策略和认知赋能方法后,准确率显著提高。研究通过准确率提升实验、可视化验证和解释性分析展示了方法有效性。工作探索了Transformer LLM与人类学习者的潜在相似性,并用可解释AI验证增强信任。论文TransformerLLM算术任务推荐理由:这篇论文发现Transformer学算术的方式跟人很像,用教人算术的策略来调模型,效果还真不错,想了解LLM推理机制和可解释性的话值得一看。原文稍后读已读值得跟进有用关注 Transformer
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。论文WhisperAssameseASR推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%原文稍后读已读值得跟进有用关注 Whisper
09:48官方账号arXiv cs.LG@Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun ZhangOrderMoE提出了一种利用专家相似性的分布式部署框架,专为资源受限的边缘基础设施设计。它通过路由器诱导的logits表示构建专家相似性模型,将MoE层中的专家分组到多个相似性组中。然后采用相似性感知的专家分组与部署策略,提高边缘服务器间的本地相似性覆盖率。在真实边缘测试平台上,OrderMoE显著降低了平均延迟、尾延迟、跨服务器流量和远程专家调用比例,且推理质量下降可控。论文OrderMoEMoE边缘计算推荐理由:这篇论文把MoE模型卸到边缘设备上跑,靠专家相似性分组减少跨服务器通信,实测延迟和流量都降了,质量只掉一点。原文稍后读已读值得跟进有用关注 OrderMoE
09:47官方账号arXiv cs.LG@Zhihua Liang精选该论文提出一个连续几何框架,将Transformer的离散代数操作建模为语义纤维丛上的积分-微分方程,涉及RMSNorm、RoPE、Softmax Attention等组件。实验覆盖Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral五种架构,参数规模从124M到8B。几何预测与实证一致:Lipschitz缩放校准精度达R²=1.000,且验证了Poincaré递归的热力学抑制、上下文极限相变等六个现象。论文Transformer架构微分几何Qwen3推荐理由:用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。原文稍后读已读值得跟进有用关注 Transformer架构
09:41官方账号arXiv cs.LG@Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik标准稀疏自编码器(SAE)独立编码每个token,无法捕捉序列中跨时间的持久信息。论文提出的Persistent SAE为每个特征学习一个持久系数,使模型自动决定哪些特征应持久及持续时长。实验表明,该方法在保持与标准SAE竞争性重建质量的同时,学习到从快速到慢速的特征时间尺度谱:快速特征作为局部可解释检测器,慢速特征在持久状态中集中主题级信息。在提示注入监控案例中,慢速特征能在长上下文中保持检测信号并维持因果有效性。论文Persistent Sparse AutoencodersSAE可解释性推荐理由:这篇论文提出了Persistent SAE,让稀疏自编码器学出特征该持久多久,在解释和监控语言模型上更灵活,尤其长文本场景下效果明显。原文稍后读已读值得跟进有用关注 Persistent Sparse Autoencoders
09:40官方账号arXiv cs.LG@Khushnaseeb Roshan该论文提出一种混合防御机制,结合对抗训练(AT)和高斯数据增强(GDA),以抵御快速梯度符号法(FGSM)和Carlini & Wagner(C&W)两种白盒对抗攻击。未防御时,NIDS在FGSM和C&W攻击下的准确率分别降至0.2649和0.4961。应用混合防御后,准确率提升至96.57%和89.20%。实验在epsilon和置信噪声因子0.0001至0.0009范围内进行评估。论文FGSMC&WNIDS推荐理由:这篇论文用对抗训练加高斯增强,把NIDS被FGSM攻击后的26%准确率拉回96%,实测有效。原文稍后读已读值得跟进有用关注 FGSM
09:38官方账号arXiv cs.LG@Vibhanshu Sharma, Pratyush Dhingra, Janardhan Rao Doppa, Partha Pratim PandeThRIve是一种针对非易失性存储器PIM架构的热噪声感知训练方法,通过低秩适应(LoRA)选择性将低秩噪声感知参数存储在抗热性更强的硬件上。实验表明,该方法使CNN推理在整个工作温度范围内的平均精度保持在理想(无噪声)精度的2%以内,精度波动也在平均值的2%以内。与热鲁棒的SRAM-based PIM系统相比,ThRIve在保持相当精度和鲁棒性的同时,实现了高达5.4倍的能效延迟积(EDP)降低。论文ThRIvePIM低秩适应推荐理由:这篇论文提出了ThRIve方法,用低秩适应应对PIM芯片的热噪声问题,在保持精度不变的前提下把能效提升了5.4倍,做硬件推理的值得看看。原文稍后读已读值得跟进有用关注 ThRIve
09:37官方账号arXiv cs.LG@Babak Barazandeh, Subhabrata Majumdar, George Michailidis当前Agent轨迹评估依赖二进制成功标志或精确匹配,无法区分侥幸成功或分析失败原因。Otap将轨迹评估转化为执行图与有效解图之间的最优传输距离,基于不平衡融合Gromov-Wasserstein问题。该伪度量对保持依赖的重新排序具有不变性,对冗余步骤敏感度有限,并能处理缺失或幻觉步骤。在受控扰动和三个公开基准上,Otap在语义指标低于随机水平的场景中仍能有效区分有效与无效轨迹。其准确性在依赖图精确恢复时最高,在从自由文本推断时下降。论文OtapAgent轨迹规划评估推荐理由:这篇论文提出了Otap,一个用最优传输来评估Agent轨迹的新方法。它不再只看任务成功与否,而是分析执行结构,还能容忍不同的规划顺序和冗余步骤。原文稍后读已读值得跟进有用关注 Otap
09:36官方账号arXiv cs.LG@Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei贝叶斯滤波变压器(BFT)是一种在两阶段生成序列上训练的 Transformer:先由先验抽取潜在任务,再根据该任务生成观测。在理想极限下,BFT 的下一词预测等于贝叶斯后验预测分布(PPD),但实际训练仅逼近该分布。论文提出预测蒙特卡洛(PMC)方法作为可解释性工具,仅利用下一词生成即可近似 BFT 内部隐含的先验和后验分布。PMC 被应用于三个任务族(0-Markov 和 1-Markov 可交换性),揭示了此前在预测空间观察到的现象在隐空间中依然存在。论文BFTPMC可解释性推荐理由:这篇论文提出了PMC方法,能直接看穿BFT模型内部认为的贝叶斯先验是什么,比传统对比法更靠谱。做可解释性研究的朋友可以试试。原文稍后读已读值得跟进有用关注 BFT
09:35官方账号arXiv cs.LG@Lucky Verma研究团队在子句密度近乎匹配的条件下,比较了证明难的expander-Tseitin公式与证明易的ladder-Tseitin公式,以及密度不匹配的控制组。求解器Glucose的平均冲突代理差异高达51倍,其他五个求解器也保持方向一致。三个模型各243个实例的准确率差距从-32到+20个百分点,合并差距为+1.7个百分点(p=0.74),且正确率与冲突代理呈错误正向关联(r=+0.15)。证明保留重标定使一个模型准确率平均下降93点,但对另一个模型影响不大。16k token实验中,推理模型在证明易匹配公式上的token消耗反而更多,而32k C1差距消失。论文约束推理求解器难度模型难度推荐理由:这篇论文用严格实验告诉你,LLM在约束推理上的表现和求解器难度不是一码事。他们控制密度、比较两类公式,发现准确率差距和求解器冲突量几乎不相关,甚至反着走。原文稍后读已读值得跟进有用关注 约束推理
09:33官方账号arXiv cs.LG@Qiwei Han, Chi ZhouChemFusion是一种混合神经网络,融合了传统电子特征与明确的3D原子坐标,通过交叉注意力机制让全局电子状态动态关注未池化分子点云中的空间约束。在多样化交叉偶联反应库上测试,该模型在预测性能上显著超过传统单模态框架。提取注意力矩阵显示,网络自动学习识别并惩罚限制性空间位阻,提供了物理可解释性。论文ChemFusion多模态交叉注意力推荐理由:这篇论文搞了个ChemFusion模型,把电子特征和3D结构结合起来用交叉注意力,预测催化反应产率比老方法准多了。原文稍后读已读值得跟进有用关注 ChemFusion
09:32官方账号arXiv cs.LG@Maede Azani Hassan Abadi, Shouyi Wang该研究使用可解释机器学习框架,基于国家层面每周数据预测呼吸疾病率(每10万人)和空气质量状态。比较了9种回归模型和9种分类模型,采用嵌套交叉验证评估性能。结果显示PM2.5浓度是呼吸疾病率的最强预测因子,线性模型在回归任务中表现最佳;去除PM2.5后,GDP per capita、降水和医疗保健可及性等变量影响力上升。亚组分析表明,中低收入国家中PM2.5对预测的贡献显著高于高收入国家。研究强调模型可解释性比单纯精度更能揭示气候-健康预测中的关键机制。论文PM2.5呼吸健康SHAP推荐理由:这篇论文用实打实的数据告诉你,PM2.5对呼吸健康影响有多大,而且不同收入国家差别明显,模型能解释比只看精度更重要。原文稍后读已读值得跟进有用关注 PM2.5
09:31官方账号arXiv cs.AI@Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji WangAnthroDial是一个闭环框架,将拟人对话的生成、评估和偏好对齐联合建模。其运行时结合角色条件调度、长时记忆和虚拟时间;评测包含L0有效性门控、5个每轮维度和5个对话级维度。后训练管线用16,436个调度决策示例做SFT,并采用GRPO与认知诊断ZPD感知奖励,通过Kalman滤波对每个行为维度进行能力估计并加权。在55个角色、50个场景、50个角色-场景绑定、每模型100个角色条件案例的基准上,评估了16个系统,Qwen3.6-27B-SFT+RL达到39.00%严格ACC和98.5总分。9B无思考设置下,SFT和RL将严格ACC从0.00%提升到13.00%和18.37%。论文AnthroDialQwenGRPO推荐理由:这篇论文把拟人对话的生成、评测和奖励对齐做成闭环,Qwen3.6-27B微调后严格准确率39%,比基线高一大截。原文稍后读已读值得跟进有用关注 AnthroDial
09:29官方账号arXiv cs.AI@Utopia Meng, Unicornt Zhao, Derek Li, Goalen Gao, Frank DuTalaria是一个会话感知的无服务器多模型推理系统,针对工具使用代理的会话连续性优化。在单台TP=8服务器上,用30个SWE-Bench会话(960次调用)测试三个超百亿参数模型。相比轮询调度器(无会话预填充、主机KV恢复和D2D分段),p50会话完成时间从1000秒降至189秒(加速5.3倍),p95从2296秒降至867秒(加速2.6倍)。论文TalariaSWE-BenchLLM推荐理由:这篇论文的Talaria系统把工具代理场景下百亿参数模型的p50延迟从1000秒降到189秒,挺实用的加速方案。原文稍后读已读值得跟进有用关注 Talaria
09:28官方账号arXiv cs.AI@Shermin Shahbazi, Hossein Mohammadi, Mohsen AfsharchiDADIR是一种密度感知数据级不平衡回归框架,专门处理连续目标变量中密度分布不均的问题。它包含三个组件:密度感知自适应分区(DAAP)根据密度变化递归划分目标空间;密度正则化条件变分自编码器(DR-CVAE)保留稀疏区域表示并学习潜在特征;潜在空间数据平衡通过特征聚类和过采样生成结构一致的合成样本。实验在多个不平衡回归数据集上验证,在欠表示区域和整体精度上都取得一致性提升。论文DADIRDAAPDR-CVAE推荐理由:你还在为回归数据分布不均发愁?这个新框架DADIR用密度指导分区和生成,比固定分区法更准,专门提升稀疏区域的预测效果。原文稍后读已读值得跟进有用关注 DADIR
09:26官方账号arXiv cs.AI@Xichen Zhang, Yingjie Zhang, Tianshu Sun该论文提出一个名为"层归因"的框架,将AI智能体行为分析分为基础计算层(架构、记忆、感知、注意力、表征)和行为调节层(身份、资源、目标、社会互动、制度约束、治理)。框架指出三个关键结论:替代有效性是模型-任务-层的关系,人机差异提供诊断证据,治理需在干预前进行源头归因。该框架为评估AI智能体行为来源提供了系统性方法。论文AI Agent层归因智能体推荐理由:这篇论文把AI行为拆成两层来诊断,教你看清行为是来自模型结构还是外部规则,对搞智能体评估和治理的人很有用。原文稍后读已读值得跟进有用关注 AI Agent
09:25官方账号arXiv cs.AI@Xizhe Zhang, Fan Shi, Mianzhao Wang, Jiangpeng Zheng, Xu Cheng, Shengyong Chen该论文针对红外小目标检测中像素级掩码标注成本高且不确定性大的问题,提出HALO(Hotspot-Anchored Label Optimization)方法。HALO在框内定位辐射锚点,并基于局部背景统计合成物理锚定高斯(PAG)软标签,将含噪框监督转化为连续像素级软标签。实验在公共数据集上显示,标准紧框下HALO与代表性盒监督方法竞争力相当,而在更宽松或偏移框条件下(更贴近实际场景),HALO鲁棒性显著提升,且不同骨干网络下表现一致。论文还引入污染感知工作区间分析,揭示内在信杂比与性能的关系。论文HALOPAGIRSTD推荐理由:这篇论文提出了HALO,能用带噪框标注解决红外小目标检测,比现有方法更扛标注不准确,适合实际场景。原文稍后读已读值得跟进有用关注 HALO
09:12官方账号arXiv cs.AI@Barada Sahu, Shivesh Pandey精选使用verifier-guided repair对35B参数的计算机使用智能体(CUA)在五个oracle-graded环境中进行测试,方差分量分解显示评估方差几乎为零,训练种子效应不超过10%,而数据抽取在最难任务中占48%的主导方差。该任务的运行间分布为双模(Hartigan dip p=0.07, k=10),单次运行约有30%概率落入失败模式,均值±标准差无法正确描述。修复能力分两层:固定token安装可靠(成功率0.97±0.06),而开放式坐标点击修复仅部分有效(0.53±0.35),生成字段填充更弱(0.14±0.04)。框架级修复仅在任务是唯一剩余障碍时提升成功率(LinkedIn 8/20 vs 基准0/15, Fisher p=0.006)。作者发现单次改进报告约三分之一概率符号错误,并发布了cua_reliability库以支持多种子常规报告。论文CUA35BSA-OPSD推荐理由:这篇论文用严格的统计方法告诉你:CUA的修复效果不能只看单次跑分,一个看起来不错的改进有三分之一可能是错的。做AI agent的都应该看看这个库。原文稍后读已读值得跟进有用关注 CUA
10:47官方账号arXiv cs.LG@Yuchen Yang, Yifan Zhao, Anisha Dasgupta, Sasa MisailovicMoE大模型在KV缓存密集场景下,模型权重与KV缓存之间存在GPU内存竞争。PagedWeight方法在运行时动态量化MoE权重,平衡专家权重精度与缓存大小。在多个内存敏感场景中,PagedWeight在FP16等效精度下节省72.0% GPU内存并提升1.94倍吞吐量。在相似内存预算下,其质量比现有量化方法高出39.3%,吞吐损失不超过4.1%。论文MoELLM推理权重量化推荐理由:这篇论文展示了PagedWeight方法,能在MoE模型服务里动态量化权重,省内存还保准,比之前的方法效果明显更好。原文稍后读已读值得跟进有用关注 MoE
10:46官方账号arXiv cs.LG@Owen Lockwood, Jérémy Béjanin, Joost Bus, Christopher Chamberland, Patrick Huembeli, Frank Schäfer, Guillaume Verdon该论文提出了一种基于热力学计算的硬件蓝图,利用Langevin动力学实现能量高效的可微连续变量计算。作者展示了如何通过构造参数化能量基模型来训练机器学习模型,并基于概率图框架分析其运行时与能耗。初步实验采用热噪声驱动的随机模拟超导电路验证了该方案。数值研究表明,该热力学范式相比传统硬件在能效上有数量级提升。论文Thermodynamic Computing能量基模型概率图模型推荐理由:这篇论文提供了一种利用热力学原理做机器学习的新思路,特别适合关注低功耗计算硬件的读者,从理论到超导电路实验都有。原文稍后读已读值得跟进有用关注 Thermodynamic Computing
10:45官方账号arXiv cs.LG@Gabriel Samberg, YoonHaeng Hur, Yuehaw Khoo, Nir Sharon该论文提出了一种名为拉普拉斯最优传输(LapOT)的聚类感知匹配方法,核心是对最优传输问题添加基于相似图的二次拉普拉斯正则项,促使耦合矩阵尊重两个点集的聚类结构。作者还提出精细化同步聚类(RSC)方法,利用LapOT得到的聚类感知耦合生成跨点集的一致分区。实验证明,LapOT能产生比独立聚类更稳定、可解释的对齐结果。论文LapOTRSC点云匹配推荐理由:这篇论文用拉普拉斯最优传输让点云匹配自动感知聚类结构,还附带一个同步聚类方法RSC,适合做形状匹配或聚类对齐的同行参考。原文稍后读已读值得跟进有用关注 LapOT
10:44官方账号arXiv cs.LG@Matteo Tomasetto, Nicolò Botteghi, Gabriele Bruni, Andrea Manzoni论文提出PEARL框架,结合强化学习与最优控制,利用自动微分计算短时策略梯度,并通过神经网络近似伴随灵敏度以估计未来回报,从而减少环境交互次数。在非稳态流中的两个参数化导航问题测试中,PEARL在样本效率和泛化性上优于现有RL算法,可扩展到高维状态动作空间,无需低维表示或多智能体策略。论文PEARLreinforcement learningdynamical systems推荐理由:这篇论文用PEARL方法解决了RL在复杂动力学系统中样本效率低的问题,能在非稳态流中做实时控制,比现有算法更高效,值得搞控制或RL的人看看。原文稍后读已读值得跟进有用关注 PEARL
10:40官方账号arXiv cs.LG@Ramin Soleimani, Andrea Visentin, Dirk Pesch该论文提出行为条件化注意力神经过程框架,将推断出的行为结构嵌入预测机制,而非仅作为外部分组信号。在SGSC数据集上,使用用户不相交的训练/验证/测试集和可变上下文长度,与标签无关的ANP基线相比,最佳变体平均降低MAE 7.9%和CRPS 6.9%。与固定窗口基线相比,该变体在所有评估预测范围上实现更低RMSE。结果表明该框架能实现跨异质家庭、上下文和预测范围的单模型不确定性感知预测。论文Neural Process负荷预测SGSC数据集推荐理由:这篇论文用行为条件化神经过程做家庭用电预测,比基线方法MAE降了7.9%,特别适合处理不同家庭的用电习惯差异。原文稍后读已读值得跟进有用关注 Neural Process
09:57官方账号arXiv cs.LG@Tam Bang, Hussam Abubakr, Emiliano de la Garza Villarreal, Truc Phuong Nguyen, Austin Harris, Toru Hirano, Mina Sartipi, Yunfei Xu, Hoang H. NguyenPRISA框架利用路边LiDAR传感器实现隐私保护、低光照鲁棒的交通监测和实时风险检测。其风险评估模块自动从感知数据中训练轨迹预测模型,无需手动标注,并部署在NVIDIA Jetson AGX Thor上。在R-LiViT数据集上的评估显示,PPET评估在2.4秒预测时域内端到端延迟为194毫秒,TTC检测满足实时约束。该框架已在田纳西州查塔努加的真实信号交叉口部署,验证了主动式多智能体交叉口安全监测的可行性。论文PRISALiDAR交通安全9 个信源在谈事件专题推荐理由:这篇论文提出PRISA,用路边LiDAR自动学习轨迹预测,无需人工标注就能在边缘实时评估碰撞风险,延迟仅194毫秒,已在真实路口跑通。原文稍后读已读值得跟进有用关注 PRISA
09:56官方账号arXiv cs.LG@Midori Kato, Kevin A. Urquía-Calderón, Inar Timiryasov, Oleg RuchayskiyShellFlow是一个基于Transformer的生成模型,在5个数量级的不变质量范围(亚GeV到TeV)上学会了标准模型结构。它使用黎曼条件流匹配,在每个粒子的壳流形上生成,训练数据来自ATLAS Open Data的约10^9个真实pp对撞事件。模型仅用壳条件和不变质量公式作为物理先验,即学习到了双轻子共振(J/ψ、Υ、Z)在PDG位置、轻子Weinberg角、W和顶夸克质量,以及粒子间相关性。论文ShellFlowATLASLHC推荐理由:这篇论文展示了生成模型能从原始对撞数据中自动学习标准模型的结构,不需要模拟样本,连共振峰和质量都能自己学到。原文稍后读已读值得跟进有用关注 ShellFlow
09:55官方账号arXiv cs.LG@Ole-Christian Galbo Engstrøm论文针对IKPLS算法1和2的两个共享步骤(X旋转R和Y负载Q)提出加速。对于R,用直接评价策略替代逐项累加,所需乘法数相同但并行性更好。对于Q,首次发现每个Y loading可由之前迭代已算出的量得出,将计算成本从Θ(KM)降到Θ(M)(M=1或2≤M<K)。在NumPy (CPU)和JAX (GPU)上测试,孤立步骤加速达两个数量级,整体拟合加速约2倍(CPU)和6倍(GPU)。改进已集成到开源Python包ikpls中。论文IKPLSKernel PLSPLS回归推荐理由:IKPLS算法加速技巧:X旋转和Y负载计算改进,CPU快2倍、GPU快6倍,代码开源随便用。原文稍后读已读值得跟进有用关注 IKPLS
09:52官方账号arXiv cs.LG@Jun He, Deying Yu论文提出Honest Quorum Problem,即协议兼容但语义错误的智能体验证器可能满足常规检查而形成无效证书。定义Epistemic Byzantine Fault Tolerance (EBFT),引入两个置信度索引量e_δ和u_ε,分别约束拜占庭集之外的一致无效认可和降低活跃度的不可用支持。推导了语义有效性、共识一致性、活跃性和阈值选择的充分条件。论证仅当添加名义上不同的智能体能可测量地减少无效认可或不可用支持的尾部分布时,才能提升容错性。论文EBFT拜占庭容错智能体推荐理由:这篇论文挖出了智能体共识的一个坑:老实但推理错误的验证器照样能搞砸安全性。用e_δ和u_ε两个指标量化风险,比传统BFT更接地气。搞Agent基础设施的值得一读。原文稍后读已读值得跟进有用关注 EBFT
09:49官方账号arXiv cs.LG@Kaustav Mehta研究提出对AlphaFold2的9300万参数进行直接分析,通过高斯卷积平滑Evoformer权重张量,发现训练后的模型产生物理结构的构象图谱。泛素扰动下原生接触断裂顺序与数十年折叠实验一致。五个独立训练的KaiB模型均未恢复替代折叠,而α-突触核蛋白产生五种不同但连贯的图谱。随机噪声控制证实构象源于学习而非噪音,该涌现特性非显式训练目标。论文AlphaFold2蛋白质构象神经网络光谱推荐理由:给AI科学应用开发者的新视角:AlphaFold2的权重里藏着比静态预测更丰富的构象信息,用高斯卷积就能读出蛋白质折叠动力学线索。原文稍后读已读值得跟进有用关注 AlphaFold2
09:48官方账号arXiv cs.LG@Marco C. Campi, Simone Garatti该论文展示了 Pick-to-Learn (P2L) 方法用于校准模型预测控制 (MPC) 策略。示例中飞机从起点到终点,需避开低连通区域,并应对不确定侧风。MPC 策略由两个超参数控制,P2L 从 400 个风场景中仅筛选出 2 个信息丰富的场景。校准后的策略在所有可用场景中均成功避开低连通区域,且理论风险界为 4.8%。该风险界以 1−10^−5 的置信度保证,相当于新风场景下进入低连通区域的概率上限。论文Pick-to-LearnMPCP2L推荐理由:这篇论文用 P2L 方法从 400 个场景里只挑 2 个就搞定了 MPC 校准,风险界才 4.8%,而且置信度极高,做控制的人可以看看。原文稍后读已读值得跟进有用关注 Pick-to-Learn
09:47官方账号arXiv cs.LG@Akshay Sunil, Muhammed Rashid, Raja Sekhar Sivaraju, Sushma Nair, Subimal Ghosh这篇论文提出基于物理引导的深度时空超本地雷达临近预报框架,使用多变量U-Net结合多仰角反射率、多普勒径向速度和径向速度梯度代理特征。模型利用2023年5月至8月孟买多普勒雷达观测数据训练,预测未来90分钟内每7.5分钟间隔的12个复合反射率场。在90分钟提前时间,对于≥10、≥20和≥30 dBZ阈值,临界成功指数分别为0.437、0.332和0.193。与持续性法相比,该模型在更长提前时间上具有更低的RMSE和更高的空间相关性。训练后可在标准计算机上实时运行,几秒内生成预报。论文U-NetMumbaiDoppler radar推荐理由:搞气象AI的可以看这篇,用孟买雷达数据训练的U-Net模型预测90分钟降水,CSI比传统方法高不少。原文稍后读已读值得跟进有用关注 U-Net
09:45官方账号arXiv cs.LG@Claudia Skok Gibbs基因调控网络(GRN)从全基因组数据重建面临模型选择启发式、评估参考不完整、先验知识跨物种迁移难等挑战。PMF-GRN将GRN推理转化为概率图模型,通过变分推理实现原理性模型选择和不确定性感知的边估计。GLM-Prior微调预训练Nucleotide Transformer,直接从核苷酸序列预测转录因子-靶基因相互作用,并在酵母、小鼠和人类数据上验证泛化能力。两者结合形成双阶段视角:序列先验提供可迁移初始骨架,概率推理以量化不确定性精调调控估计。论文PMF-GRNGLM-PriorNucleotide Transformer推荐理由:想搞基因调控网络但被跨物种问题卡住?这论文用序列预测加概率精修,直接解决迁移和不确定性问题,值得做计算生物学的看看。原文稍后读已读值得跟进有用关注 PMF-GRN
09:35官方账号arXiv cs.AI@Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman该论文构建了CAV-STIXGen数据集,将自动驾驶车辆漏洞描述映射到STIX域对象、关系对象、CWE及MITRE ATT&CK技术。评估了11个开放权重LLM(4B至120B参数),单模型在SDO、SRO、CWE映射上F1分别达0.94、0.63、0.99,而完整ATT&CK映射仍有挑战。多智能体方案中Gemma-4-31B与Codestral-22B在SDO和SRO上分别获0.91和0.43的F1。分析了CWE与ATT&CK共现模式,展示了AI辅助漏洞转STIX的自动化威胁情报能力。论文LLMSTIX自动驾驶推荐理由:这篇论文测了11个开源模型做漏洞结构化的效果,Gemma-4-31B和Codestral-22B组队挺有意思,做安全情报的可以看看F1分数。原文稍后读已读值得跟进有用关注 LLM
09:34官方账号arXiv cs.AI@Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao SunMuon优化器在稀疏奖励智能体强化学习中展现优势。使用Qwen2.5-0.5B-Instruct和ALFWorld环境,在Group-in-Group Policy Optimization (GiGPO)下,仅将Muon应用于隐藏权重矩阵,最终窗口验证成功率从0.290提升至0.546(+88%),而高学习率AdamW无后更新成功。在3e-5学习率下,Muon将GRPO成功率从0.161提升至0.268;在1e-5下,GraphGPO Muon达到0.901,归一化验证AUC从0.399增至0.556,并提前30和60轮达到0.5和0.75成功率。该结果表明Muon可提升智能体强化学习性能,但效果依赖优势估计器和学习率。论文MuonAdamW智能体推荐理由:这篇论文发现Muon优化器让智能体RL成功率从29%飙到55%,比AdamW快60步,还分析了学习率的影响。原文稍后读已读值得跟进有用关注 Muon
09:32官方账号arXiv cs.AI@Wendi Yu, Lianhao Zhou, Xiangjue Dong, Sai Sudarshan Barath, Declan Staunton, Byung-Jun Yoon, Xiaoning Qian, James Caverlee, Shuiwang Ji这篇论文从信息瓶颈视角分析多智能体系统(MAS)与单智能体系统(SAS)的差异。关键发现是:MAS通过有界中继消息连接隔离的局部上下文,而SAS将所有推理轨迹积累在共享上下文中。在无限中继带宽下,任何SAS都可被MAS模拟;但在有限带宽下,压缩引入权衡——减少冗余上下文可提升效率,但可能损失任务相关信息。作者将该权衡形式化为由参数β控制的信息瓶颈问题,并通过18个控制实验(涵盖5个基准和3个模型规模)验证:当中继接近充分时,MAS持续有效(尤其对较弱模型);当中继造成信息损失时,MAS优势缩小甚至反转(尤其对较强模型)。论文多智能体系统信息瓶颈LLM推荐理由:这篇论文从信息瓶颈角度讲清楚了多智能体系统在什么时候比单智能体更有优势,还通过18个实验验证了弱模型受益多、强模型受益少。原文稍后读已读值得跟进有用关注 多智能体系统
09:31官方账号arXiv cs.AI@Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang多模态科学声明验证需依托论文中的图表、表格等视觉证据。现有方法在定位关键视觉证据、准确读取结构化科学图表、整合多模态观察方面存在不足。本文提出首个工具增强框架ToolSciVer,为视觉语言模型(VLM)配备三种类型感知视觉工具:表格行列聚焦、图表结构化解析、高分辨率区域放大。采用分组相对策略优化(GRPO)训练策略,综合奖励答案正确性、格式、长度、工具使用效率及有效性。在SciVer和MuSciClaims数据集上基于Qwen、InternVL、Gemma三个系列的五个VLM进行实验,结果表明该方法优于包括提示词和强化学习方法在内的四个基线。论文ToolSciVer多模态科学声明验证推荐理由:这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。原文稍后读已读值得跟进有用关注 ToolSciVer