FluxMem 把智能体记忆从静态存储升级为动态拓扑,解决了长期任务中记忆碎片化和干扰问题。做智能体系统或记忆建模的团队值得看看这个新范式,可以直接参考其论文思路。
全部动态
做视觉检测或机器人感知的团队,LocateAnything 的并行解码思路能直接提升实时性,值得点开看看项目页。
离散扩散模型在文本、图结构等离散数据生成中至关重要,但采样效率一直是瓶颈。这篇论文提出的对比分布匹配方法直接解决了这个问题,做生成模型研究的开发者值得关注。
多模态智能体推理是当前 AI 的前沿方向,AEPO 为开发者提供了一种可落地的训练优化思路,做智能体或多模态应用的团队值得关注。
这篇论文戳中了 AI 智能体部署后的核心隐患——性能会随时间悄悄下降,做智能体运维或长期对话系统的团队值得细读,看完会重新审视记忆管理策略。
多智能体系统开发者终于有了能处理超过两个智能体的世界模型——Gamma-World 解决了传统双玩家建模的瓶颈,做游戏 AI 或机器人协作的团队值得关注。
做智能体部署和运维的团队终于有了衡量长期可靠性的工具——AgingBench 能告诉你智能体何时、如何退化以及该修哪里,建议做 agentic 工程的开发者点开看看。
这份报告把大模型从数据到部署的全链路细节都摊开了,做模型训练或智能体开发的团队可以直接参考其中的 Model Factory 和 Agent RL 实践,值得细读。
做Agent框架或提示词工程的开发者,终于有了系统级的方法来优化Skills,不用再靠手动瞎改和调试了。建议直接看论文实验数据,特别是编辑预算的设置,对实际落地很有参考价值。
这项研究戳破了AI基准测试的盲区——如果你在评估智能体工具或做AI产品,会发现现有测试可能误导了你的判断,建议点开看看如何修正评估标准。
做长上下文AI应用或RAG系统的团队,这个发现会颠覆你对上下文管理的认知——不是堆更多文档就能提升效果,少而精才是关键,建议点开看看具体实验数据。
做AI科研自动化的团队会发现,这个框架把失败变成了系统的一部分,而不是bug——CoPilot模式87.5%的接受率值得所有做AI Scientist的人点开看看。
Self-Play SWE-RL 解决了编码智能体依赖人类标注数据的瓶颈,做 AI 编程助手或智能体训练的团队值得关注——它展示了智能体自我进化的新路径,看完会对训练数据来源有全新认识。
这篇论文点破了 LLM 幻觉的核心矛盾——不是知识不够,而是不知道什么时候该说“不确定”。做 AI 产品、智能体或对话系统的团队,看完会对“诚实比正确更重要”有更深理解,建议直接读原文。
这篇论文为AI智能体架构提供了一个清晰的设计原则——用代码作为核心工作层,做智能体系统或工具链的开发者值得一读,能帮你理解为什么代码比纯文本更适合作为智能体的“思考环境”。
做智能体开发的工程师别再手写技能文档了——SkillOpt 证明自动优化技能文件能带来显著性能提升,且零推理开销,值得在你的 Agent 工作流中尝试。
做 RAG 系统的团队终于有了解决检索错配的实用方案——CRAG 在检索后加一道评估关卡,直接过滤掉相似但不相关的文档。做知识库问答或搜索增强应用的开发者,值得看看这个改进管道的方法。
部署MoE模型的团队终于可以省下一半专家计算——ZEDA让Qwen3和GLM等模型自动跳过简单token,推理速度提升20%且几乎不掉精度,做模型推理优化的开发者可以直接参考论文方法。
这篇论文戳中了编码智能体效率低下的核心痛点——不是试得不够多,而是记不住经验。做 AI 编程工具或智能体开发的团队,可以直接借鉴其摘要复用和锦标赛选择方法,值得点开看看。
穿戴设备厂商和健康 AI 研究者终于有了一个通用基础模型,不用再为每个健康任务单独设计特征工程。做可穿戴健康分析的团队可以直接参考 SensorFM 的预训练思路,大幅降低模型开发成本。
这篇论文展示了 AI 在数学证明中的实际进展,做形式化验证或数学研究的团队值得关注——它把 LLM 从“讲故事”变成“可验证的候选生成器”,直接解决了幻觉问题。
这项发现打破了“只有专用模型才能做前沿研究”的认知,做AI科研或数学研究的团队值得关注——它意味着你的通用模型可能比想象中更聪明,只是需要给它更多思考时间。