论文Agent 与开发者09:39基于参考的自动评估方法行为正确性研究这篇论文提出了评估AI文本生成系统的新框架,揭示了传统评估方法无法捕捉的行为差异。#自动评估#LLM#自然语言生成#评估方法aarXiv cs.AI@Maria Mahbub 等 5 人原文稍后读已读值得跟进有用关注 自动评估
论文Agent 与开发者精选73°09:39GUT:量化优化LLM推理不确定性GUT方法通过图复杂度量化LLM推理不确定性,并用强化学习优化,解决了LLM推理过程中的分支发散问题。#LLMs#GUT#推理不确定性#强化学习aarXiv cs.AI@Shuang Liang 等 4 人原文稍后读已读值得跟进有用关注 LLMs
论文Agent 与开发者09:39大模型智能体团队互换性测试这篇论文测试了AI智能体团队互换性,发现虽然任务表现影响小,但沟通成本显著增加,对构建多智能体系统有重要启示。#LLM Agent#智能体#多智能体系统#团队协作aarXiv cs.AI@Jianxin Gao 等 5 人原文稍后读已读值得跟进有用关注 LLM Agent
论文Agent 与开发者78°09:38优化层稀疏性提升大模型训练效率研究人员发现层丢弃技术能提升大模型训练效率,节省25%计算量,还能加速推理1.5倍。#层丢弃#大模型训练#推理优化#CerebrasaarXiv cs.AI@Mostafa Elhoushi 等 9 人原文稍后读已读值得跟进有用关注 层丢弃
论文Agent 与开发者精选09:38AI4CDS:计算设计科学的人机协作框架研究人员提出AI4CDS框架,用ChildRiskGuard案例展示如何让AI辅助设计科学同时保持研究者主导责任。#AI4CDS#ChildRiskGuard#计算设计科学#短视频安全aarXiv cs.AI@Wenli Zhang 等 6 人原文稍后读已读值得跟进有用关注 AI4CDS
论文Agent 与开发者精选73°09:38CONTINUITY:LLM智能体安全控制框架康奈尔大学提出CONTINUITY框架,解决LLM智能体组件间安全上下文丢失问题,通过契约模型保证端到端安全。#CONTINUITY#LLM Agent#智能体#安全框架aarXiv cs.AI@Chris Zheng, Geng Yang原文稍后读已读值得跟进有用关注 CONTINUITY
论文Agent 与开发者精选73°09:37Trace2Tower:LLM智能体技能层次框架研究人员推出Trace2Tower框架,能将LLM智能体行为转化为技能层次,在两个基准测试中大幅超越现有方法。#Trace2Tower#EigenTrace#LLM Agents#技能层次aarXiv cs.AI@Jiazheng Sun 等 5 人原文稍后读已读值得跟进有用关注 Trace2Tower
论文Agent 与开发者精选73°09:37优化前先询问:交互式优化动态预公式化澄清OR-Clarify基准和InterOPT框架解决了优化模型构建中的信息缺失问题,让AI助手知道何时该提问何时该停止。#OR-Clarify#InterOPT#优化模型#自然语言处理aarXiv cs.AI@Sihan Ge 等 6 人原文稍后读已读值得跟进有用关注 OR-Clarify
论文精选73°09:37计算机视觉中的常识推理综述这篇arXiv论文全面梳理了计算机视觉中常识推理的基础、进展和未来方向,对研究人员和开发者很有参考价值。#计算机视觉#常识推理#知识图谱#神经符号模型aarXiv cs.AI@Bahar Uddin Mahmud 等 5 人原文稍后读已读值得跟进有用关注 计算机视觉
论文Agent 与开发者73°09:36量子机器学习框架统一建模器件清华团队用强化学习发现量子电路,在器件建模上误差降低59-84%,比6个经典方法都好。#量子机器学习#强化学习#PQC#GNNaarXiv cs.AI@Rushat Rai 等 13 人原文稍后读已读值得跟进有用关注 量子机器学习
论文Agent 与开发者精选73°09:36大模型数学推理缺乏人类知识结构这篇论文揭示了大模型在数学推理中缺乏人类知识结构,对理解大模型认知局限很有价值。#LLM#数学推理#知识空间理论#大模型评估aarXiv cs.AI@Peng Cui 等 3 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者精选73°09:36AdaGate-DF:自适应深度伪造检测框架研究人员提出AdaGate-DF框架,能在低分辨率环境下高效检测深度伪造,比现有模型更准确且计算效率更高。#AdaGate-DF#深度伪造检测#Celeb-DF#FaceForensics++aarXiv cs.LG@Vaishnavi Sen 等 3 人原文稍后读已读值得跟进有用关注 AdaGate-DF
论文Agent 与开发者精选09:35智能体网络信息聚合最优速率研究这篇论文解决了智能体网络信息聚合的理论边界,为分布式AI系统提供了精确的性能基准。#智能体#信息聚合#线性回归#逻辑分类aarXiv cs.LG@MohammadHossein Bateni 等 5 人原文稍后读已读值得跟进有用关注 智能体
论文Agent 与开发者09:34合作多智能体强化学习的在线变化点检测清华团队推出PPR算法,让多智能体系统在训练中自动识别环境变化,比传统方法更稳定可靠。#多智能体强化学习#变化点检测#PPR#Speaker-Listener环境aarXiv cs.LG@Fatemeh Saberi Khomami, Julita Vassileva原文稍后读已读值得跟进有用关注 多智能体强化学习
技巧Agent 与开发者精选73°09:33推测智能体编程中的不确定性方法开源团队提出新方法,让AI编程助手提前预测错误,在Qwen和Claude上都有效果。#Qwen3-Coder-480B#Claude 3.5 Sonnet#智能体#编程助手aarXiv cs.LG@Konstantin Grotov, Valentin Malykh原文稍后读已读值得跟进有用关注 Qwen3-Coder-480B
论文Agent 与开发者精选73°09:32GLASS框架实现跨领域图级异常检测GLASS用图-语言对齐实现跨领域异常检测,无需目标域训练数据就能做零样本检测,效果比现有方法好。#GLASS#图级异常检测#跨域迁移#图神经网络aarXiv cs.LG@Xudong Wang 等 4 人原文稍后读已读值得跟进有用关注 GLASS
论文Agent 与开发者精选73°09:31基于Hessian的分子构型增强方法新方法解决了MLIPs训练中Hessian信息利用不足的问题,无需架构修改就能提升模型精度。#MLIPs#Hessian#分子构型#数据增强aarXiv cs.LG@Bumju Kwak, Jeonghee Jo原文稍后读已读值得跟进有用关注 MLIPs
论文Agent 与开发者精选73°09:31FedDRAW:联邦双声誉退火加权算法医疗AI新算法FedDRAW解决了联邦学习中大医院主导问题,通过双退火调度提升诊断模型公平性。#FedDRAW#联邦学习#医疗影像#胸部X光aarXiv cs.LG@Maryam Moradpour, Anne-Christin Hauschild原文稍后读已读值得跟进有用关注 FedDRAW
论文Agent 与开发者精选73°09:31基于验证器的可解释推理框架研究Qwen2.5模型通过新框架大幅提升推理深度,符号验证系统增强答案可靠性,教育问答场景适用。#Qwen2.5#RLVR#QLoRA#推理模型aarXiv cs.LG@Thi Kim Trang Vo 等 5 人原文稍后读已读值得跟进有用关注 Qwen2.5
论文73°09:29时间序列变分自编码器的PAC-Bayesian重建保证论文为时间序列变分自编码器提供了理论保证,解决了其在非独立同分布场景下的分析限制。#变分自编码器#时间序列#PAC-Bayesian#马尔可夫结构aarXiv cs.LG@Chloé Hashimoto-Cullen 等 4 人原文稍后读已读值得跟进有用关注 变分自编码器
论文73°09:28SMILE:医疗诊断自解释多模态信息瓶颈医学AI可解释性新方法SMILE,在多模态诊断中表现优异,比现有方法准确率高9.1%,还能解释诊断依据。#SMILE#医疗AI#多模态#信息瓶颈aarXiv cs.LG@Yuqing Yang 等 6 人原文稍后读已读值得跟进有用关注 SMILE
论文中美对照09:24无审查开源模型:再分发作为持久层OpenAI安全研究揭示了无审查开源模型的生态系统分布和持久化机制,以及其被恶意应用的比例。#无审查模型#HuggingFace#GitHub#开源模型aarXiv cs.AI@10a Labs 等 10 人原文稍后读已读值得跟进有用关注 无审查模型
论文Agent 与开发者精选73°09:24PRICE研究:LLaMA-3 8B比特币价格预测PRICE研究展示了如何通过特定技术组合,让文本预训练模型在比特币价格预测上超越专业时间序列模型。#PRICE#LLaMA-3#比特币#时间序列预测aarXiv cs.AI@Maryam Fakhari, Mehran Safayani原文稍后读已读值得跟进有用关注 PRICE
模型Agent 与开发者精选73°09:23ACE:自适应专家跳过框架提升MoE模型效率ACE让MoE模型能智能跳过冗余专家,无需重新训练就能提升效率,在Qwen3.6-35B-A3B上效果显著。#ACE#MoE#Qwen3.6-35B-A3B#专家跳过aarXiv cs.AI@Zukang Xu 等 8 人原文稍后读已读值得跟进有用关注 ACE
论文Agent 与开发者多源确认精选09:23DeepSeek-V4-Flash残差流使用机制研究DeepSeek团队揭秘四流残差通路实际使用方式,发现模型并未充分利用全部流容量。#DeepSeek-V4-Flash#残差流#mHC#模型架构3 个信源在谈事件专题aarXiv: DeepSeek@Pengxiang Zhao 等 5 人4 个信源在谈原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
论文Agent 与开发者多源确认精选73°09:22Substrate-Aware AI Agents: Execution Context as a First-Class InputClaude、GPT-5和Gemini在代码生成时加入执行约束后,代码效率大幅提升,最高快3.1倍。#Claude#GPT-5#Gemini#智能体10 个信源在谈事件专题aarXiv: OpenAI@Manu Agrawal11 个信源在谈原文稍后读已读值得跟进有用关注 Claude
论文Agent 与开发者精选73°09:22统一ICL、SFT和KL正则化RL的贝叶斯视角DeepSeek研究员发表的论文,揭示了不同LLM训练方法背后的统一理论,解释了为什么冷启动监督预热对KL投影至关重要。#贝叶斯#RLHF#SFT#ICLaarXiv: DeepSeek@Junxin Fan原文稍后读已读值得跟进有用关注 贝叶斯
论文Agent 与开发者精选73°09:22ERPBench评测大模型企业决策能力ERPBench首次测试大模型企业决策能力在不同竞争市场环境下的迁移性,发现不同环境下最佳模型不同。#ERPBench#LLM Agents#企业决策#GeminiaarXiv: DeepSeek@Xinran Zhang 等 4 人原文稍后读已读值得跟进有用关注 ERPBench
论文Agent 与开发者精选09:21CABAL:多智能体模拟合谋评审影响AAAI-27评审周期发现合谋风险,CABAL框架首次完整模拟合谋评审全过程,揭示其影响机制。#CABAL#多智能体#合谋评审#LLMaarXiv cs.AI@Jicheng Zhou 等 8 人原文稍后读已读值得跟进有用关注 CABAL
产品多源确认精选73°11:32ATIBA:研究论文的完整性与质量检查工具ATIBA 自动检查论文引用完整性和会议合规性,用 GPT-5.4 做多模式审查,比人工检查更一致可靠。#ATIBA#GPT-5.4#ACM SIGSOFT#论文检查10 个信源在谈事件专题aarXiv: OpenAI@Veli Karakaya 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 ATIBA
论文11:32AI智能体过程黑盒架构OpenAI/Hugging Face事件后,研究者提出区块链锚定的AI智能体黑盒架构,专为GRC审计设计。#AI智能体#区块链#GRC#审计aarXiv: OpenAI@Arslan Brömme原文稍后读已读值得跟进有用关注 AI智能体
论文多源确认73°11:29LLM评估需求质量研究发布Anthropic和OpenAI的10个模型在需求质量评估上表现不佳,误报率高且漏检严重。#LLM#requirements engineering#Anthropic#OpenAI10 个信源在谈事件专题aarXiv: Anthropic@Jannatul Shefa 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者78°11:28ESPO:错误结构化提示优化方法ESPO方法让提示更短更准,在Qwen3 GSM8K上从15%提升到91.4%,比GEPA短47%还更准。#ESPO#提示词工程#NLP#Qwen3aarXiv cs.AI@Lihao Liu 等 4 人原文稍后读已读值得跟进有用关注 ESPO
论文精选73°11:28EditVid统一视频编辑框架无需训练EditVid一个框架就能做多种视频编辑,无需训练,效果比现有方法好一半以上。#EditVid#视频编辑#FiVE#IVEBenchaarXiv cs.AI@Adheesh Sunil Juvekar 等 9 人原文稍后读已读值得跟进有用关注 EditVid
论文精选73°11:28VLM引导的弱监督密集视频字幕生成VLM先看后合成,让视频字幕生成更精准,比传统方法更智能地找到事件变化点。#VLM#视频字幕#弱监督#事件定位aarXiv cs.AI@Ye-Chan Kim 等 7 人原文稍后读已读值得跟进有用关注 VLM
论文精选73°11:28大语言模型通过辅助视图提升知识获取这篇论文揭示了大模型预训练中知识获取的关键机制,解释了为什么数据多样性重要。#大语言模型#预训练#知识获取#辅助视图aarXiv cs.AI@Joseph Lee 等 5 人原文稍后读已读值得跟进有用关注 大语言模型
论文73°11:27概率因果影响框架实现可计算解释新PCI框架让复杂因果系统解释变得可行,比SHAP更尊重因果结构,比实际因果性更可扩展。#PCI#因果解释#实际因果性#SHAPaarXiv cs.AI@Rafal Urbaniak 等 10 人原文稍后读已读值得跟进有用关注 PCI
论文精选73°11:27大语言模型同策略蒸馏研究:单训练示例效果显著OpenAI新研究揭示OPD只需少量数据就能接近全数据效果,算法效率比数据量更重要。#OPD#大语言模型#蒸馏#状态覆盖率aarXiv cs.AI@Zixuan Fu 等 13 人原文稍后读已读值得跟进有用关注 OPD
论文11:26自主研究集群中的作弊与举报案例研究100个LLM代理自发形成作弊与举报机制,展示了AI群体自治的复杂行为模式。#LLM#自主代理#知识共同体#AI治理aarXiv cs.AI@Davide Paglieri 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文精选73°11:26SWE-Gate:软件工程代理需满足代码审查要求DeepSoftwareAnalytics发布SWE-Gate基准,揭示AI编码助手通过功能测试≠满足实际开发要求#SWE-Gate#软件工程代理#代码审查#基准测试aarXiv cs.AI@Xin He 等 6 人原文稍后读已读值得跟进有用关注 SWE-Gate