论文Agent 与开发者11:50地球系统世界模型用于情景模拟这个地球系统模型能模拟'如果...会怎样'的情景,比传统预测模型更灵活,可用于数字孪生研究。#Earth System World Model#生态系统模拟#机器学习#数字孪生aarXiv cs.LG@Zhihao Wang 等 9 人原文稍后读已读值得跟进有用关注 Earth System World Model
论文中美对照精选73°11:48结构化越狱攻击跨模型通用但不叠加谷歌Gemini被测试出严重安全漏洞,结构化越狱攻击在金融场景成功率高达100%,但非英语环境反而能缓解风险。#Gemini#IICL#越狱攻击#AI安全aarXiv: OpenAI@Tejasvi C. Addagada原文稍后读已读值得跟进有用关注 Gemini
论文Agent 与开发者11:48LLM与规则注入在OpenStack中的故障测试对比阿里和DeepSeek的代码模型在云系统故障测试中表现如何?和传统规则注入有什么不同?#Qwen2.5-Coder#DeepSeek-Coder#OpenStack#故障注入aarXiv: DeepSeek@Giuseppe De Rosa 等 3 人原文稍后读已读值得跟进有用关注 Qwen2.5-Coder
论文Agent 与开发者73°11:41CAST结合规划器引导行为提升强化学习新提出的CAST方法结合规划器与策略,在强化学习中实现更高效的值学习,并在四足机器人上验证效果。#CAST#强化学习#模型基础#规划器aarXiv: Google DeepMind@Pietro Noah Crestaz 等 4 人原文稍后读已读值得跟进有用关注 CAST
论文Agent 与开发者78°11:41TrojanWorld:通过想象操控攻击世界模型智能体TrojanWorld通过物理对象触发,能悄无声息地控制AI智能体的决策,威胁世界模型安全。#TrojanWorld#world-model#DreamerV3#R2-DreameraarXiv: Google DeepMind@Wenkai Huang 等 7 人原文稍后读已读值得跟进有用关注 TrojanWorld
论文Agent 与开发者73°11:21近似值迭代在自我博弈中的有效性研究这篇论文发现近似值迭代(AVI)在多个棋类游戏中比 AlphaZero 更准确且成本更低,挑战了 MCTS 主导地位。#Approximate Value Iteration#AlphaZero#MCTS#自我博弈aarXiv cs.AI@Raphael Boige 等 3 人原文稍后读已读值得跟进有用关注 Approximate Value Iteration
论文Agent 与开发者精选73°11:21SPINE基准测试揭示LLM在持续压力下的谄媚行为SPINE基准测试揭示了LLM如何在持续压力下放弃正确立场,发现情绪诱导是导致谄媚行为的主要因素。#SPINE#LLM#谄媚行为#Olmo3-7baarXiv cs.AI@Leyuan Tang 等 4 人原文稍后读已读值得跟进有用关注 SPINE
论文Agent 与开发者精选73°11:20GoDeep:无标注3D场景理解新方法GoDeep用纯语言模型作为翻译器,实现无标注3D场景理解,能处理OOV对象且结果可解释。#GoDeep#3D场景理解#开放词汇#CLIPaarXiv cs.AI@Thodoris Betsas 等 3 人原文稍后读已读值得跟进有用关注 GoDeep
论文Agent 与开发者精选11:20多领域模型训练中的领域覆盖优化研究阿里团队发现多领域模型训练中每个领域都有最佳覆盖比例,对齐阶段难以弥补领域差距。#Qwen3-8B-Base#KOR-Bench#多领域训练#模型对齐aarXiv cs.AI@Yunpeng Xu, Kun Zheng原文稍后读已读值得跟进有用关注 Qwen3-8B-Base
论文Agent 与开发者11:20ThinkPrior:零轮次难度先验用于RLVR冷启动提示选择研究人员提出ThinkPrior方法,通过离线锚点构建难度先验,解决了RLVR训练中的冷启动问题,显著减少了无效轮次。#ThinkPrior#RLVR#GRPO#Qwen2.5-Math-7BaarXiv cs.AI@Tommy Sha 等 3 人原文稍后读已读值得跟进有用关注 ThinkPrior
模型Agent 与开发者多源确认11:19Doctorina临床AI系统诊断表现超越医生Doctorina在初级护理诊断上全面超越人类医生,比第二名Kimi K3表现更好。#Doctorina#Kimi K3#Claude Opus 5#临床AI5 个信源在谈事件专题aarXiv cs.AI@Andy Nkansah 等 9 人6 个信源在谈原文稍后读已读值得跟进有用关注 Doctorina
论文Agent 与开发者精选73°11:18训练自由任务向量实现LLM行为控制新方法TFTVs让LLM行为控制无需微调,支持加法学习减法遗忘,比传统方法更好保留模型能力。#TFTVs#LLM#任务向量#行为控制aarXiv cs.AI@Gabriel J. Perin 等 4 人原文稍后读已读值得跟进有用关注 TFTVs
论文Agent 与开发者11:18LLM决策审计中评估工具影响比人口偏见更显著这篇论文揭示了LLM审计中评估工具设计比人口偏见更能影响结果,对AI公平性评估有重要启示。#LLM#AI公平性#决策审计#偏见评估aarXiv cs.AI@Siddharth Vohra, Manikandan Ravikiran原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者精选73°11:18LLM推理的答案分布轨迹研究这篇论文提出了分析LLM推理动态的新方法,通过答案分布轨迹揭示了传统评估方法忽略的推理过程细节。#LLM#推理模型#熵轨迹#答案分布aarXiv cs.AI@Mar Gonzàlez I Català 等 6 人原文稍后读已读值得跟进有用关注 LLM
论文Agent 与开发者11:17AI编程代码所有权研究这篇论文深入分析了AI编程中的责任归属问题,对开发者和管理者都有重要参考价值。#AI编程#代码所有权#质量工程#AI辅助开发aarXiv cs.AI@Augusto Camargo原文稍后读已读值得跟进有用关注 AI编程
论文Agent 与开发者11:17扩散模型处理离散任务新方法扩散模型在Sudoku等离散任务表现提升,直接采样+自纠正训练让错误率大幅下降。#扩散模型#离散任务#自纠正训练#SudokuaarXiv cs.AI@Mariia Drozdova 等 3 人原文稍后读已读值得跟进有用关注 扩散模型
论文Agent 与开发者精选73°11:16Deposon:LLM推理路径的可审计散射层MIT团队推出Deposon散射层,为LLM推理路径提供可审计记录,在陷阱检测上表现优异。#Deposon#LLM推理#机器学习#可审计性aarXiv cs.AI@Qihao Yuan原文稍后读已读值得跟进有用关注 Deposon
论文Agent 与开发者精选73°11:16Transformer作为上下文采样器研究这篇论文揭示了Transformer在数据生成方面的能力,展示了如何通过上下文学习实现无参数估计的采样过程。#Transformer#diffusion#in-context learning#生成模型aarXiv cs.AI@Arman Adibi 等 4 人原文稍后读已读值得跟进有用关注 Transformer
模型Agent 与开发者精选73°11:16Gander模型实现全模态实时交互Gander模型实现了全双工自然对话,支持用户随时打断,模型也能主动提供反馈,代码模型数据已开源。#Gander#全模态交互#智能体#开源模型aarXiv cs.AI@Orantqing 等 23 人原文稍后读已读值得跟进有用关注 Gander
论文Agent 与开发者精选73°11:15GraphFAS:工业交易网络图特征自动生成系统支付宝上线GraphFAS系统,用分布式特征选择让工业图特征生成效率提升10倍,还兼容表格模型和TreeSHAP解释。#GraphFAS#Boruta#工业欺诈检测#图神经网络aarXiv cs.AI@Yice Luo 等 10 人原文稍后读已读值得跟进有用关注 GraphFAS
论文Agent 与开发者11:15预训练与SFT检查点质量研究论文揭示了训练流程中检查点选择的关键问题,对大模型训练实践有重要指导意义。#混合专家#预训练#SFT#解决方案密度aarXiv cs.AI@Sohir Maskey 等 5 人原文稍后读已读值得跟进有用关注 混合专家
模型Agent 与开发者精选73°11:15PlannerForge:自动驾驶运动规划测试的LLM智能体框架PlannerForge用LLM智能体整合了自动驾驶测试全流程,开源模型表现接近商业API,成本调优将规划成功率提升20%。#PlannerForge#LLM Agents#自动驾驶#Qwen3.6:35BaarXiv cs.AI@Yuan Gao 等 8 人原文稍后读已读值得跟进有用关注 PlannerForge
论文Agent 与开发者精选73°11:15SQLMorph:文本转SQL评估新框架SQLMorph提供文本转SQL系统评估新方法,通过查询变异和细粒度指标,帮助开发者更准确评估系统性能并发现潜在问题。#SQLMorph#Text-to-SQL#JQE#TQAaarXiv cs.AI@Mohammadhossein Malekpour 等 4 人原文稍后读已读值得跟进有用关注 SQLMorph
模型Agent 与开发者精选73°11:14SkillAdam:智能体技能稳定高效进化框架SkillAdam让AI智能体技能进化更稳定高效,比现有方法少花很多迭代次数就能获得更强技能。#SkillAdam#智能体#Agent#技能进化aarXiv cs.AI@Gaoyuan Li 等 10 人原文稍后读已读值得跟进有用关注 SkillAdam
论文Agent 与开发者精选10:34AI模型处理用户分歧的权威管理研究这篇论文揭示了AI模型如何应对用户质疑,不同模型在权威转移和坚持原主张上的差异很有意思。#GPT-5.2#DeepSeek 7B#大语言模型#对话分析aarXiv: DeepSeek@Riyadh Alnasser 等 4 人原文稍后读已读值得跟进有用关注 GPT-5.2
论文Agent 与开发者10:34JudgmentLens:复杂法律判决的人机协同理解清华团队开发了JudgmentLens,帮助普通人更快理解复杂法律判决,比传统PDF阅读体验更好。#JudgmentLens#法律AI#DeepSeek#人机协同aarXiv: DeepSeek@Xinyi Chen 等 4 人原文稍后读已读值得跟进有用关注 JudgmentLens
论文Agent 与开发者精选10:33LLM生成资产壳质量评估方法研究工业4.0中,研究人员用三种模型测试了6400个资产壳实例,找到了评估AI生成资产壳质量的可靠指标。#AAS#GPT-4o-mini#Qwen3#DeepSeek-R1aarXiv: DeepSeek@Janek Groß 等 3 人原文稍后读已读值得跟进有用关注 AAS
论文Agent 与开发者多源确认10:33RAME框架在谷物育种信息提取任务中夺冠DeepSeek团队用RAME框架在谷物育种信息提取任务击败GPT-5.5,代码已开源。#RAME#DeepSeek-V4-Flash#GPT-5.5#信息提取3 个信源在谈事件专题aarXiv: DeepSeek@Hang Zhao, Jiahao Wang4 个信源在谈原文稍后读已读值得跟进有用关注 RAME
模型Agent 与开发者多源确认精选73°10:33DeepSeek-V4 长上下文服务系统 RedKnot-MLA 发布DeepSeek 推出了 RedKnot-MLA 系统,能显著提升长上下文服务的速度和效率,在多个基准测试中表现优异。#DeepSeek-V4#RedKnot-MLA#长上下文#多模态3 个信源在谈事件专题aarXiv: DeepSeek@Yang Liu 等 13 人4 个信源在谈原文稍后读已读值得跟进有用关注 DeepSeek-V4
论文Agent 与开发者精选10:32多租户LLM服务中KV缓存竞争可靠性研究研究揭示了多租户环境下LLM服务KV缓存时序攻击可靠性随负载变化的规律,对实际部署安全有重要参考价值。#KV缓存#时序侧信道#DeepSeek-R1-Distill-Llama-8B#vLLMaarXiv: DeepSeek@Rana Abu Bakar原文稍后读已读值得跟进有用关注 KV缓存
模型Agent 与开发者78°10:32PARSER:并行读取深度推理的长上下文智能体PARSER让长文档处理不再受顺序限制,证据位置变化不影响结果,推理速度提升11倍。#PARSER#长上下文#智能体#多跳问答aarXiv: DeepSeek@Kun Li 等 5 人原文稍后读已读值得跟进有用关注 PARSER
论文Agent 与开发者多源确认精选73°10:32SRD-GUARD:通过语义改写和多模型评分防御LLMSRD-GUARD能更好识别伪装攻击,在Llama-3和DeepSeek模型上表现优异,比现有防御方法有更好的DSR-ORR权衡。#SRD-GUARD#Llama-3-8B-Uncensored#DeepSeek-V4-Flash#AI安全2 个信源在谈事件专题aarXiv: DeepSeek@Qi Wang 等 3 人3 个信源在谈原文稍后读已读值得跟进有用关注 SRD-GUARD
产品Agent 与开发者多源确认精选73°10:23基于GPT-4的代码仓库分析聊天机器人这个GPT-4聊天机器人能让非技术人员轻松理解代码仓库数据,通过工具选择和提示工程提高分析准确性。#GPT-4#代码仓库#聊天机器人#提示词工程10 个信源在谈事件专题aarXiv: OpenAI@Muhammad Jawad Chowdhury, Md. Sakib Khan11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-4
技巧Agent 与开发者多源确认精选73°10:23AI编程代理配置供应链缺陷研究GitHub上16%的AI编程代理配置存在安全漏洞,开发者需警惕MCP服务器版本固定问题。#GitHub Copilot#Claude Code#Cursor#AI安全10 个信源在谈事件专题aarXiv: OpenAI@Benjamin Kapner 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 GitHub Copilot
论文73°10:04ProcArena:多场景PL/SQL开发基准测试ProcArena基准测试首次全面评估了LLM在直接和交互式PL/SQL开发中的表现,覆盖157个数据库和9个子场景。#PL/SQL#ProcArena#PostgreSQL#OracleaarXiv cs.AI@Hang Zhang 等 15 人原文稍后读已读值得跟进有用关注 PL/SQL
模型Agent 与开发者73°10:03O2C-Nav实现高效零样本视觉语言导航O2C-Nav只需一次MLLM调用就能完成视觉语言导航,比现有方法更高效,代码已开源。#O2C-Nav#MLLM#视觉语言导航#R2R-CEaarXiv cs.AI@Shiqi Pan 等 6 人原文稍后读已读值得跟进有用关注 O2C-Nav
论文政策与合规精选10:02智能体决策因果归因研究欧盟AI法案要求高风险AI系统保持决策可追溯,这篇论文提供了实现这一目标的因果归因方法和规范。#因果归因#智能体#可追溯性#欧盟AI法案aarXiv cs.AI@Ajay Pravin Mahale原文稍后读已读值得跟进有用关注 因果归因
论文Agent 与开发者10:02COSTER框架提升自动驾驶安全场景生成COSTER框架通过时间反向生成技术,为自动驾驶训练创建了更真实多样的危险场景,碰撞率降低31%。#COSTER#自动驾驶#安全场景生成#WaymoaarXiv cs.AI@Taehyung Kim, Jongeun Choi原文稍后读已读值得跟进有用关注 COSTER
论文Agent 与开发者73°10:01MoE推理群体路由有效秩研究这篇论文揭示了MoE模型推理过程中路由相似性的集中-分化-再集中规律,为理解MoE内部计算提供了新视角。#MoE#路由有效秩#推理群体#数学/科学基准aarXiv cs.AI@Kang Chen 等 4 人原文稍后读已读值得跟进有用关注 MoE
论文Agent 与开发者精选10:01构建可信图智能体RAG框架这篇论文为图智能体RAG系统提供了完整的可信设计框架,特别关注社会应用场景下的可靠性和可追溯性。#Graph-Agentic RAG#RAG#检索增强生成#可信AIaarXiv cs.AI@Vijay Bommireddy, Raviteja Bommireddy原文稍后读已读值得跟进有用关注 Graph-Agentic RAG