11:38官方账号arXiv cs.LG@Xuan Zheng, Kento Uchida, Shinichi ShirakawaSIGMA提出了一种SHAP增强的隐式轨迹生成方法,用于无元数据的自动特征工程。该方法利用SHAP值提供任务感知信号,替代不可用的语义信息,并采用EXposed-feature Implicit Trajectory (EXIT)方法。实验显示,SIGMA将生成特征的重复率从37.2%降至6.8%,仅用平均5.4个特征就达到传统SOTA性能。论文SIGMASHAP自动特征工程推荐理由:研究人员提出SIGMA方法,解决了LLM在特征工程中的元数据缺失问题,大幅降低特征重复率,提升效率。原文稍后读已读值得跟进有用关注 SIGMA
10:23官方账号arXiv cs.AI@Shahab Band, Hamed Mohammadi针对目标域观测数据有限且源域与目标域统计特性不同的问题,提出一种移位感知双编码器迁移框架。源编码器使用美国10个监测站的逐时观测数据预训练,再用台湾77个站点两年的逐时数据按时间顺序划分训练集和验证集进行适配与评估。在四个基线中,冻结源编码器的双编码器模型达到最佳性能:MSE=21.8960, MAE=3.1597, R^2=0.8725,相比TL-v1的MSE降低约7.1%,相比TL-v2降低约4.1%。消融实验显示移除台湾特定分支导致性能下降最明显,而让源编码器在目标监督下适应得到最优结果(MSE=21.6575, MAE=3.1383, R^2=0.8739)。SHAP分析表明预测主要由近期PM2.5观测和与污染物输送扩散相关的气象变量驱动。论文PM2.5预测迁移学习双编码器推荐理由:这个双编码器迁移框架挺有意思:美国数据预训练、台湾数据适配,PM2.5预测MSE比旧方法降了7%,消融实验也扎实。原文稍后读已读值得跟进有用关注 PM2.5预测
09:32官方账号arXiv cs.LG@Maede Azani Hassan Abadi, Shouyi Wang该研究使用可解释机器学习框架,基于国家层面每周数据预测呼吸疾病率(每10万人)和空气质量状态。比较了9种回归模型和9种分类模型,采用嵌套交叉验证评估性能。结果显示PM2.5浓度是呼吸疾病率的最强预测因子,线性模型在回归任务中表现最佳;去除PM2.5后,GDP per capita、降水和医疗保健可及性等变量影响力上升。亚组分析表明,中低收入国家中PM2.5对预测的贡献显著高于高收入国家。研究强调模型可解释性比单纯精度更能揭示气候-健康预测中的关键机制。论文PM2.5呼吸健康SHAP推荐理由:这篇论文用实打实的数据告诉你,PM2.5对呼吸健康影响有多大,而且不同收入国家差别明显,模型能解释比只看精度更重要。原文稍后读已读值得跟进有用关注 PM2.5
11:56官方账号arXiv cs.LG@Arthur G. Bubolz, Abreu Quevedo, Giancarlo Lucca, Rafael A. Berri, Eduardo Borges, Bruno L. Dalmazo该研究提出一种结合链上数据、金融指标和推特情绪来分类比特币市场情绪的新方法,而非预测价格。使用XGBoost模型进行情绪分类,平均F1-score达到约0.84。通过SHAP方法量化不同链上特征对模型预测的贡献,增强了可解释性。结果显示该数据组合能提供有意义的预测信号,支持数据驱动的加密货币分析。论文BitcoinXGBoostSHAP推荐理由:这篇论文用链上交易数据和推特情绪来给比特币情绪分类,XGBoost模型F1到了0.84,还用了SHAP解释特征重要性,对做加密货币分析的人有参考价值。原文稍后读已读值得跟进有用关注 Bitcoin
09:05官方账号arXiv cs.LG@Jorge Alda, Jacobo Asorey, Alejandro Mir, Siannah Peñaranda该论文提出使用梯度提升回归树(XGBoost)构建机器学习仿真框架,以高效处理高能物理和宇宙学中高维参数空间的复杂非高斯似然函数。方法在B介子衰变味异常分析中验证,能准确解析具有弯曲退化等复杂相关性的置信区域。框架可推广至轴子粒子或宇宙学全局拟合等场景,并通过SHAP值实现特征重要性透明分析,确保预测与物理一致性。论文XGBoostSHAP高能物理推荐理由:用XGBoost搞物理参数拟合,还能用SHAP解释结果,做物理AI的值得看。原文稍后读已读值得跟进有用关注 XGBoost
09:49官方一手marktechpost@Sana Hassan精选本教程使用ChEMBL和UniProt获取EGFR C797S靶点信息,从IC50记录中提取pIC50数据集。利用RDKit标准化分子并计算Morgan指纹,训练基于scaffold-split的随机森林QSAR模型。通过SHAP解释效力驱动因素,并使用BRICS碎片重组生成并排名新候选分子。技巧ChEMBLRDKitSHAP推荐理由:用ChEMBL、RDKit、SHAP和BRICS手把手搭一个EGFR抑制剂预测模型,数据清理到模型解释全有,代码示例清晰。原文稍后读已读值得跟进有用关注 ChEMBL
10:33官方账号arXiv cs.LG@Antoine Pesenti, Aidan O'Sullivan该论文使用深度学习(DNN)结合可解释AI(XAI)技术,分析欧洲39个竞价区的电价决定因素。通过SHAP方法和扩展的SSHAP聚合框架量化特征贡献。研究发现太阳能等可再生能源在电价形成中作用突出,尽管其发电占比低;天然气价格仍是主导且一致的驱动因素;跨区域互联显著影响价格动态。论文还构建了一个合成全欧洲统一电力市场的反事实场景。论文XAISHAPDNN推荐理由:这篇论文用XAI方法拆解了欧洲39个地区的电价驱动力,告诉你太阳能比想象中更重要、天然气还是老大,还模拟了全欧统一电价会怎样。原文稍后读已读值得跟进有用关注 XAI
10:52官方账号arXiv cs.LG@Eric Günther, Balázs Szabados, Kristof Meding, Gunnar König, Sebastian Bordt, Ulrike von Luxburg论文提出解释卡(Explanation Cards)来增强算法解释的实用性,通过补充鲁棒性和有效性信息以及明确解释指南。以反事实解释和SHAP为例展示构建方法。解释卡将正确解读的责任从用户转移至提供者。该方案可操作化欧盟AI法案的可解释性条款。论文解释卡SHAP反事实解释推荐理由:这篇论文提出了解释卡,能帮你避免被算法解释误导,而且用SHAP和反事实解释举了具体例子。原文稍后读已读值得跟进有用关注 解释卡
12:10官方账号arXiv cs.LG@Kiarash Rezaei, Omran Ayoub, Sebastian Troia, Francesco Lelli, Paolo Monti, Carlos Natalino精选该论文提出一个结合大语言模型(LLM)和SHAP特征交互的生成式可解释AI框架,专为下一代网络运维设计。传统XAI方法输出技术性强,非专家难以理解,而该框架通过结构化提示融入互特征交互数据,生成自然语言解释。在光传输质量估计用例中,人类评估者验证其解释有用性提升12.2%,范围提升6.2%,正确率达97.5%。这解决了网络AI模型黑箱问题,让运营商能信任并采纳AI决策。论文可解释AILLMSHAP推荐理由:网络运维团队终于有了能看懂AI决策的工具——LLM把SHAP的复杂特征交互翻译成自然语言,做网络AI可解释性的开发者可以直接参考这个框架。原文稍后读已读值得跟进有用关注 可解释AI
11:15官方账号arXiv cs.LG@Lanxin Xiang, Liang Shi, Youhui Ye, Boyu Jiang, Dawei Zhou, Feng Guo精选特征归因分析在解释机器学习模型时,常因数据分割、随机种子等随机因素导致结果不稳定。本文提出 RoSHAP 框架,通过 Bootstrap 重采样和核密度估计建模特征重要性得分的分布,并证明聚合得分渐近服从高斯分布,大幅降低计算成本。RoSHAP 指标同时奖励活跃、强且稳定的特征,在模拟和真实实验中优于单次归因方法。使用 RoSHAP 筛选的特征构建的模型,在预测性能接近全特征模型的同时,显著减少了特征数量。该框架提升了模型的可解释性和稳定性,为可靠的数据驱动决策提供了支持。论文特征归因SHAP鲁棒性推荐理由:做模型可解释性研究的团队终于有了一个能对抗随机波动的归因指标——RoSHAP 通过分布建模让特征排序更稳定,做特征筛选和模型审计的开发者可以直接用。原文稍后读已读值得跟进有用关注 特征归因