6月3日
10:27
10:27官方账号arXiv cs.AI@Yu Xia, Zhouhang Xie, Xin Xu, Byungkyu Kang, Prarit Lamba, Xiang Gao, Julian McAuley
精选72°
ACTS提出了一种新方法,通过智能体控制器自适应地引导冻结的推理模型,在推理过程中动态调整思考策略和预算,从而在保持生成连续性的同时大幅节省token。该方法将推理引导建模为马尔可夫决策过程,控制器根据推理轨迹和剩余预算发出策略动作。实验表明,ACTS在全思考性能下实现了显著的token节省,并支持不同推理器和任务间的可控精度-效率权衡。代码已开源。
推荐理由:ACTS解决了LLM推理中token浪费和缺乏控制的问题,做推理优化或部署大模型的开发者可以直接用开源代码尝试,实现更经济的推理。
10:16
10:16官方账号arXiv cs.AI@Eric Cho, Shawn Huang, Alice Lu, Andy Lyu
精选
Hedge-Bench 1.0 是一个针对金融推理的 AI 智能体基准测试,包含 102 个来自对冲基金分析师实际工作中的真实任务。与现有依赖模型评判的基准不同,它基于专家推理轨迹进行确定性评分,避免了噪声和循环论证。测试结果显示,前沿模型和智能体在该基准上的得分低于 16%,说明当前 AI 在复杂金融推理上仍有巨大差距。该数据集和评估工具已在 GitHub 开源。
推荐理由:金融 AI 终于有了硬核的推理基准——不是算公式或查文档,而是真正考验分析师级别的开放式问题。做量化、金融 NLP 或智能体评估的团队值得关注,可以直接用这个 benchmark 检验自家模型。
10:13
10:13官方账号arXiv cs.AI@Jiabei Cheng, Jingbo Zhou, Jun Xia, Changkai Li, Zhen Lei, Chang Yu, Stan Z. Li
精选
单细胞多组学数据同时测量多种模态,但实验成本高、噪声大,催生了多种计算翻译方法。然而,现有方法缺乏系统性的基准评估。为此,研究者提出了scTranslation基准,包含多样化数据集、集成最新模型并提供全面评估指标。该基准还评估了特征选择、特征质量和小样本设置等影响因素,这些因素此前很少被系统研究。通过大规模实验,scTranslation揭示了多项重要发现,为未来研究开辟了新方向。基准已开源,代码可在GitHub获取。
推荐理由:单细胞组学研究者终于有了系统评估翻译模型的工具——scTranslation覆盖了数据、指标和影响因素,做多模态分析的团队可以直接用这个基准来对比方法,省去自己搭建评估流程的麻烦。
08:48
08:48官方账号Simon Willison’s Weblog博客/媒体
micropython-wasm 0.1a1 版本发布,主要修复了作者在构建 datasette-agent-micropython 时遇到的一些限制。该项目将 MicroPython 编译为 WebAssembly,可在浏览器或 Node.js 中运行 Python 代码,适用于沙箱化执行场景。新版本解决了此前版本中的兼容性问题,提升了在 WebAssembly 环境下的可用性。对于需要在 Web 端安全运行 Python 脚本的开发者来说,这是一个实用的工具。
推荐理由:如果你需要在浏览器或 Node.js 中安全运行 Python 代码,micropython-wasm 提供了一个轻量沙箱方案,这次更新修复了关键限制,做 Web 端 Python 沙箱的开发者值得关注。
06:05
06:05Google AI Developers@googleaidevs
Google DeepMind 在 GitHub 上开源了 Science Skills 工具包,旨在帮助开发者构建用于科学发现的自主智能体。该工具包提供科学基础和高 token 效率,可加速智能体工作流。开源版本允许社区直接使用和贡献,推动 AI 在科学研究中的应用。
推荐理由:做科学 AI 智能体的开发者可以直接用上这个开源工具包,提升 token 效率和科学推理能力,值得一试。
01:16
01:16Philipp Schmid@_philschmid
开发者Phil Schmid分享了一种使用GEPA自动优化任何CLI Agent提示词的方法。GEPA接受任何`(str) -> str`的可调用对象,兼容自定义CLI、本地模型或API Agent。只需将Agent封装在Python函数中,即可让其自我优化提示词。该方法可显著提升Agent的响应质量和效率,减少手动调优的工作量。

推荐理由:做Agent开发的团队终于有了自动化提示词优化的工具——GEPA支持任何CLI Agent,封装成函数就能自优化,省去反复手动调参的麻烦,建议试试。
6月2日
22:55
22:55官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 是一款面向快速智能体编码的开源权重模型,支持可靠工具调用和多模态理解。该模型已从模型卡片阶段进入实际编码工作流,由 @kilocode 团队在博客中详细介绍。其设计重点在于提升智能体编码效率,适合开发者集成到自动化编程任务中。这一进展标志着开源模型在实用化方面迈出重要一步。
推荐理由:做智能体编码的开发者终于有了一个可直接使用的开源模型——Step 3.7 Flash 的可靠工具调用和多模态能力能显著提升自动化效率,建议点开博客了解具体集成方式。
17:13
12:03
12:03官方账号arXiv cs.AI@Wenhao Wang, Peizhi Niu, Gongyi Zou, Xiyuan Yang, Jingxing Wang, Haoting Shi, Yaxin Du, Jingyi Chai, Xianghe Pang, Shuo Tang, Yanfeng Wang, Siheng Chen
精选72°
MCP-Persona 是首个专门评估 LLM 智能体在真实个人化 MCP 工具上表现的基准。它覆盖了 Reddit、小红书、飞书、Slack 等主流社交和协作平台,测试智能体与个人账户和本地数据库交互的能力。实验发现,当前最先进的智能体在处理个人化工具时表现挣扎,凸显了该基准在识别和解决这些局限性的关键作用。该基准已开源,可供开发者直接使用。
事件专题

推荐理由:MCP-Persona 填补了现有基准忽视个人化工具交互的空白,做智能体开发和 MCP 工具集成的团队可以直接用它来测试和优化自己的模型。
11:07
11:07官方账号arXiv cs.AI@Lukas Johanns, Marilin Moor, Davide Panzeri, Yu Zhou, Xinyi Chen, Nora F. K. Pauly, Zixuan Pan, Matthias Gunzer, Andreas Müller, Yiyu Shi, Hedi Peterson, Jianxu Chen
精选
Agentic-J 是一个容器化的多智能体AI助手,专为ImageJ/Fiji设计,使生物学家能用自然语言指定分析任务,如细胞核分割、细胞追踪和多条件量化。该智能体生成可执行的脚本并组织成有文档的项目结构,确保每个分析决策可追溯,工作流可复现或共享。其专门子智能体负责插件管理、代码生成、调试、质量保证和统计报告。论文展示了系统设计、真实生物显微镜图像分析工作流及技术实现细节。
推荐理由:生物图像分析研究者终于有了一个能理解自然语言并自动生成可复现工作流的工具——Agentic-J 解决了跨工具集成和编程门槛的痛点,做细胞生物学或显微镜分析的团队值得一试。
10:19
10:19官方账号LangChain@LangChainAI
LangChain 将于 6 月 17 日在慕尼黑举办技术圆桌会议,由 Steffen Hausmann 主持,聚焦生产级智能体、智能体框架以及开源 Deep Agents SDK。活动旨在探讨如何构建可靠、可扩展的智能体应用,并分享实际落地经验。参与者将有机会与专家深入交流,了解最新工具和最佳实践。注册链接已开放。
推荐理由:做智能体应用落地的开发者别错过——LangChain 团队亲自拆解生产级智能体架构和开源 Deep Agents SDK,现场还能直接交流踩坑经验,建议在慕尼黑或附近的朋友报名。
00:56
00:56官方一手marktechpost@Michal Sutter
精选
Memory OS 是一个基于 Hermes Agent 的开源项目,通过六层记忆架构、门控检索和 Wiki 功能,为智能体添加本地持久记忆。该项目解决了智能体缺乏长期记忆的痛点,使 AI 能跨会话保持上下文。六层结构包括工作记忆、情景记忆、语义记忆等,支持高效检索和更新。开发者可直接集成,提升智能体的连续性和个性化能力。
推荐理由:做智能体开发的团队终于有了开箱即用的记忆方案——Memory OS 的六层架构解决了长期记忆缺失的痛点,建议做对话系统或个性化助手的开发者直接集成试试。
00:33
00:33官方一手Hugging Face: Blog博客/媒体
精选72°
JetBrains 发布了 Mellum2,一个 12B 参数的混合专家(MoE)模型,专为代码生成和软件工程任务优化。该模型在 HumanEval 和 SWE-bench 等基准测试中表现优异,超越了同等规模的模型。Mellum2 基于 JetBrains 的代码数据训练,旨在为开发者提供更高效、更准确的代码补全和生成能力。该模型现已开源,可在 Hugging Face 上获取。
推荐理由:JetBrains 的 Mellum2 为 IDE 内代码生成带来了更精准的 MoE 方案,用 JetBrains 全家桶的开发者可以直接在 Hugging Face 上体验,看看它能否提升你的编码效率。