01:21Geek@geekbbVercel 发布了完全开源的 agent-browser,这是一个命令行浏览器工具。它运行在 Vercel Sandbox 中,为 AI agent 提供远程、可编程的浏览器会话。该工具支持命令共享,方便多个 agent 协作操作同一浏览器实例。AI产品Vercelagent-browser智能体推荐理由:Vercel 开源了 agent-browser,把命令行浏览器塞进云端沙盒,AI agent 能远程编程控制、共享会话,比本地方案更方便。原文稍后读已读值得跟进有用关注 Vercel
01:20Y Combinator@ycombinatorHappyRobot 宣布完成 1.5 亿美元 C 轮融资,估值达到 12 亿美元。这家公司用 AI 智能体自动处理企业运营中的电话、邮件和日程安排。其平台先在物流行业跑通,现在正扩展至保险、能源、电信和航空。自不到一年前的 B 轮融资以来,营收增长超 5 倍,目前服务 150 多家企业,包括 DHL、Uber 和 Repsol。行业HappyRobotDHLUber推荐理由:HappyRobot 拿 1.5 亿美元做后台电话邮件自动化,客户有 DHL、Uber,B 轮后收入涨了 5 倍多,可以关注下。原文稍后读已读值得跟进有用关注 HappyRobot
00:58官方账号NVIDIA AI@NVIDIAAI精选NVIDIA Jetson AI Lab在X平台发布直播,主题为在Jetson上构建NemoClaw Agents。直播演示了在Jetson硬件上部署NemoClaw并搭建智能体的流程。该活动面向开发者,提供边缘端运行NemoClaw智能体的参考。技巧NemoClawJetsonNVIDIA4 个信源在谈事件专题推荐理由:NVIDIA官号直播教你在Jetson上搭NemoClaw智能体,想搞边缘Agent的可以看看。原文稍后读已读值得跟进有用关注 NemoClaw
00:57Julien Chaumond@julien_cNot Diamond 发布 Code,号称世界最强大的智能模型路由器,专为长时程编码代理设计。该路由兼容 Claude Code 等网关或框架,可为每个步骤选择最佳模型和推理力度。官方称其能将成本降低 20-65%,同时不影响输出质量。AI产品Not DiamondClaude Code模型路由推荐理由:新出的 Not Diamond Code 能在编码代理跑每一步时自动选最合适的模型,省 20-65% 的钱,效果还不打折。原文稍后读已读值得跟进有用关注 Not Diamond
00:52Firecrawl@firecrawl_dev72°Firecrawl 今日发布开源文档解析引擎 anydoc,基于 Rust 编写。它能在 5 毫秒内将 PDF、Word、幻灯片等 13 种格式转换为 Markdown,处理 500 个 docx 文件仅需 1.7 秒。anydoc 已全面支撑 Firecrawl 的 /parse 端点,开发者和智能体可获得百倍速本地解析能力。AI产品anydocFirecrawl文档解析4 个信源在谈事件专题推荐理由:Firecrawl 把解析器开源了,anydoc 用 Rust 写,PDF、Word 转 Markdown 只要几毫秒,装个包就能跑,比原来快 100 倍。原文稍后读已读值得跟进有用关注 anydoc
00:44Paul Couvert@itsPaulAiGOAI 全球开源 AI 挑战赛现已开放报名,面向全球 AI 开发者、研究者、创业团队和开源贡献者。赛事设有 Agent 基础设施、无界智能体、AI for research、具身未来四条赛道,总奖池约 73 万美元。主办方将于 8 月 8 日在圣何塞 Q Bay Center 举办线下社区活动,包含赛道说明、炉边谈话和组队环节。报名可通过海报二维码或访问 goaihz.com 完成。行业GOAI开源智能体推荐理由:开源 AI 比赛来了,四条赛道奖池 73 万美元,8 月 8 日圣何塞还能线下找队友。原文稍后读已读值得跟进有用关注 GOAI
00:35掘金本周最热@老王以为文章用公式"Agent=决策引擎+信息视野+执行通道"解释AI Agent的本质。介绍了2022年提出的ReAct循环,让模型交替进行思考与行动。提到Claude Code、千问、豆包等日常工具都属于Agent形态。用"上海到北京3天旅行"的伪代码展示轨迹的消息序列结构。对比了Agent与聊天机器人的差异,强调其能调用工具并循环改进。技巧智能体ReActClaude Code推荐理由:这篇用公式加旅行规划案例拆解AI Agent,比空谈概念的文章实在,看完能跟人讲清楚。原文稍后读已读值得跟进有用关注 智能体
00:27官方账号LangChain@LangChainAI精选LangSmith LLM Gateway 支持用户定义跨模型和主机的模型回退规则。当某家模型提供商出现宕机或速率限制时,网关会自动把请求路由到备用模型。该功能面向所有基于 LangChain 构建的智能体,避免单一服务故障拖垮整个 Agent。AI产品LangSmithLangChainLLM Gateway推荐理由:LangChain 给 LangSmith 网关加了个模型回退功能,一个模型挂了自动切另一个,省得智能体跟着宕机。原文稍后读已读值得跟进有用关注 LangSmith
00:09小互@imxiaohuCloudflare 推出钱包功能,支持免费认领。该钱包疑似为 Agent 准备。用户可通过 cloudflare.pay 进行认领。AI产品Cloudflare智能体钱包1 个信源在谈事件专题推荐理由:Cloudflare出了免费钱包,疑似给Agent用,入口在cloudflare.pay。原文稍后读已读值得跟进有用关注 Cloudflare
23:41lmarena.ai@lmarena_ai74°Agent Arena 使用数百万个真实世界长程智能体任务评测模型。模型获得网页搜索、文件系统和终端工具,完成写代码、制作幻灯片、网络研究、构建应用和分析文档等工作流。评测采用因果追踪方法衡量模型的净改进,即相对平均模型提升结果的程度。完整排行榜见 arena.ai/leaderboard/ag…。AI模型Agent Arena智能体模型评测推荐理由:想知道哪个模型最能搞定真实长任务?Agent Arena 用几百万个任务跑分,还给模型上网、文件、终端工具,比谁净提升大。原文稍后读已读值得跟进有用关注 Agent Arena
23:39lmarena.ai@lmarena_ai精选DeepSeek 发布 DeepSeek-V4-Flash-20260731(High)版本,在 Agent Arena 综合排名第 21,净提升 +1.98%,开源模型中位列第 3。该成绩基于 12.5K 次真实智能体会话评估,比 DeepSeek-V4-Pro 高 6 位(-0.47%),比上一代 V4-Flash 高 13 位(-2.81%)。分项信号中 Confirmed Success 达到 +6.99%,而 Steerability 为 -2.31%。官方 API 同步开放公开测试,原生支持 Responses API 格式,并已适配 Codex。AI模型DeepSeek-V4-FlashAgent Arena智能体9 个信源在谈事件专题推荐理由:DeepSeek 新模型在 Agent Arena 排开源第三,API 上线且支持 Codex,做智能体可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:36官方账号LangChain@LangChainAI在Max Agency播客中,Cognition总裁Russell Kaplan分享了团队构建主动式智能体的经验。他讲解了proactive agents的开发思路。完整节目可在YouTube、Apple Podcasts和Spotify收听。技巧Cognition主动式智能体智能体推荐理由:Cognition总裁在Max Agency播客里讲了他们怎么做主动式智能体,想搞Agent的都该听听。原文稍后读已读值得跟进有用关注 Cognition
22:35官方一手Hugging Face: Blog(博客/媒体)Liquid AI 推出 LFM2.5-2.6B,一个 26 亿参数的语言模型。该模型面向本地智能体部署,减少对云端依赖。模型权重托管在 Hugging Face,开发者可直接下载。其体积适合在边缘设备上运行。AI模型LFM2.5-2.6BLiquid AI智能体1 个信源在谈事件专题推荐理由:想在自己电脑上跑智能体?Liquid AI 的 LFM2.5-2.6B 只有 2.6B 参数,不用联网,下载就能用。原文稍后读已读值得跟进有用关注 LFM2.5-2.6B
21:40官方一手Cloudflare Blog@Brendan Irvine-BroqueCloudflare正式推出Agent Development Lifecycle,为开发、部署和维护AI代理提供统一流程。该生命周期覆盖从编码到运维的完整阶段,并依托Cloudflare Workers等基础设施原语。开发者可在同一平台上构建、测试和监控智能体应用。此举旨在缓解代理代码产出速度远超人工审查和部署速度的问题。AI产品Cloudflare智能体开发工具推荐理由:Cloudflare出了个Agent开发全流程框架,从写代码到上线运维都管了,用它的基础设施就能直接搭。原文稍后读已读值得跟进有用关注 Cloudflare
21:30官方一手Cloudflare Blog@Will PapperCloudflare发布Cloudflare Wallets,这是一个面向AI智能体的可编程钱包。该钱包基于x402协议,为智能体提供原生支付与可验证身份。智能体可在预设安全护栏内自主购买API和数字内容。AI产品Cloudflare Walletsx402智能体1 个信源在谈事件专题推荐理由:Cloudflare整了个给AI代理用的钱包,能靠x402协议自动付钱买API,还带安全限制,挺实用。原文稍后读已读值得跟进有用关注 Cloudflare Wallets
21:28官方一手Cloudflare Blog@Tomáš Hobza精选Cloudflare 发布 CI SDK,可在其平台上用 TypeScript 构建可定制的沙箱化 CI/CD 流水线。该流水线使用 Workflows 和 Artifacts 替代传统 YAML 配置,把复杂逻辑拆分为可编程步骤。方案面向数百万个仓库的批量运行场景,并配有自愈 AI 代理自动处理失败任务。技巧CloudflareCI/CDWorkflows推荐理由:Cloudflare 搞了个 CI SDK,可以直接用 TypeScript 写流水线,不用再折腾 YAML 了,还带 AI 代理自动修复失败任务。原文稍后读已读值得跟进有用关注 Cloudflare
21:27官方一手Cloudflare Blog@Timo Reimann精选Cloudflare 创建了 Codex,一个由 AI 代理在开发生命周期中消费的治理工程标准体系。它将结构化 RFC 与代理审查结合,让团队在代码、规格说明和事件报告中自动执行一致性标准。这套机制帮助工程组织减少人工核对环节,让规范落地更统一。技巧CloudflareCodex智能体推荐理由:Cloudflare 把工程标准塞给 AI 代理去执行,代码和文档不合规会被自动揪出来,省了大把人工审查时间。原文稍后读已读值得跟进有用关注 Cloudflare
21:25官方一手Cloudflare Blog@Fred SchottCloudflare发布了新工具Cloudflare Agents。它将所有已部署的Agent会话整合到单一界面中。该工具会展示关键运行信息与性能洞察。用户可借此观察Agent在规模化运行时的表现。AI产品Cloudflare Agents智能体会话管理推荐理由:Cloudflare出了个Agents面板,能把所有部署的Agent会话汇总到一起,看运行表现和关键指标,挺实用的。原文稍后读已读值得跟进有用关注 Cloudflare Agents
21:23官方一手Cloudflare Blog@Matthew Phillips精选Cloudflare 工程师用 GitHub Actions 跑隔离的 AI 子代理,替代人工验证 issue,把 Astro 的未关闭 issue 数削了 85%。这套自动化流水线覆盖 bug 复现、补丁验证和预览发布三个阶段。文章拆解了子代理如何隔离运行、如何与仓库交互,以及为什么选择这种架构。技巧AstroCloudflareGitHub Actions推荐理由:Cloudflare 用 AI 子代理自动处理 Astro 的 issue,积压少了 85%,这套流水线可以搬回自己项目用。原文稍后读已读值得跟进有用关注 Astro
19:10Geek@geekbb精选71°Cloudflare 发布了一个为 AI agent 设计的持久化工作区工具。它使用 SQLite 存储文件,确保 agent 在会话结束后数据不丢失。该工具提供三种运行环境:完整容器、shell 和 JavaScript,可随时切换。三种环境之间切换时文件保持同步,让 agent 在不同场景下使用同一份数据。项目代码已开放在 GitHub 上。AI产品CloudflareSQLite智能体4 个信源在谈事件专题推荐理由:Cloudflare 开源了一个给 agent 用的持久工作区,文件存 SQLite,容器和 JS 环境随便切,数据不丢。原文稍后读已读值得跟进有用关注 Cloudflare
18:59The Rundown AI@therundownai多家AI实验室前往白宫,与政府讨论AI安全议题。HeyGen创始人用AI克隆版本取代自己,参与公司对外事务。业界开始尝试构建一个项目室,让人和AI智能体在同一空间协作。金融业高管发现,AI技能比MBA学位更有价值。行业HeyGenAI安全智能体推荐理由:今天AI圈几条重点:白宫聊安全,HeyGen创始人直接让AI克隆替自己上班,还有金融大佬觉得AI技能比MBA值钱。原文稍后读已读值得跟进有用关注 HeyGen
18:40AI产品黄叔@PMbackttfutureWorkBuddy被视为腾讯历史上第三个战略级产品,前两个是QQ和微信。作者花4800元购买了两个企业版年会员席位,开始重度使用并研究。文中提到超级个体让AI干活后效能可翻10倍,团队整体提效30%~50%。AIBP作为组织内部AI伙伴岗位,被认为优于传统的FDE驻场模式。9月计划举办“走进腾讯”活动,现场教企业用WorkBuddy解决实际业务问题。行业WorkBuddy腾讯AIBP推荐理由:腾讯把WorkBuddy放到了和QQ微信同级的位置,还带出了AIBP这种新岗位。作者自己掏4800元实测,做Agent的可以留意生态合作机会。原文稍后读已读值得跟进有用关注 WorkBuddy
17:44小互@imxiaohuCloudflare 发布 @cloudflare/computer,为 AI Agent 提供云端虚拟电脑。该方案由云端文件系统和多种执行环境组成,文件操作、数据处理、git 管理等任务在毫秒级启动的 isolate 轻量环境中完成。只有需要完整 Linux、安装第三方包或运行二进制程序时,才临时调用容器环境。相比为每个 Agent 常驻独立容器,这一设计把决策与重计算分离,以降低算力开销并支持大规模并发。AI产品Cloudflare@cloudflare/computer智能体推荐理由:Cloudflare 给 AI Agent 配了个云端虚拟电脑:日常操作走毫秒级隔离区,需要 Linux 时才开容器。原文稍后读已读值得跟进有用关注 Cloudflare
17:14Geek@geekbbVercel Labs 在 GitHub 发布了营销团队 AI 智能体模板。该模板基于 eve 构建,集成了 Notion、Resend、Typefully 等工具。用户可以通过模板快速搭建自动化的营销协作流水线。模板代码已开源在 Vercel Labs 的 GitHub 仓库中。AI产品VerceleveNotion1 个信源在谈事件专题推荐理由:Vercel Labs把eve智能体跟Notion、Resend、Typefully串起来了,装好模板就能跑通营销自动化流程,适合团队直接抄作业。原文稍后读已读值得跟进有用关注 Vercel
16:50官方一手pandaily@contact@pandaily.com (Pandaily)金山灵犀、腾讯QClaw、阿里千问办公和字节豆包与飞书的集成正在重塑企业办公,智能体取代传统功能成为任务入口。飞书、钉钉和企业微信则退居为支撑性基础设施。字节、腾讯、阿里和WPS四大厂商围绕企业AI工作流展开竞争。这场变革的核心是让智能体直接承接用户指令并调度办公工具。AI产品智能体飞书钉钉4 个信源在谈事件专题推荐理由:字节、腾讯、阿里和WPS都在做办公智能体,豆包现在能直接进飞书接活,腾讯QClaw也来抢入口,办公软件要变天了。原文稍后读已读值得跟进有用关注 智能体
16:46官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯WorkBuddy 5.0发布安全中心,在操作系统API层引入默认安全沙箱。文件删除改为回收站式机制,支持恢复。文档编辑支持版本回滚,防止误操作。这些安全设置作为Agent默认选项,不牺牲执行效率。AI产品WorkBuddy腾讯AI安全推荐理由:腾讯把WorkBuddy的安全底子做厚了,默认开沙箱和回收站,删错文件还能恢复,打算用Agent办公的可以看看。原文稍后读已读值得跟进有用关注 WorkBuddy
16:43官方一手pandaily@contact@pandaily.com (Pandaily)Moonshot AI的Kimi K3、阿里Qwen3.8-Max和字节Doubao-Seed-2.1均采用原生多模态训练,而DeepSeek、智谱和腾讯混元仍坚持纯文本路线。在长程智能体任务中,视觉信息的实时参与成为决定性因素。这一差异将影响下一代模型在复杂环境中的表现。AI模型Kimi K3DeepSeek V4多模态6 个信源在谈事件专题推荐理由:Kimi K3和DeepSeek V4现在走了两条路:一个搞原生多模态,一个纯文本硬扛。长任务里能不能看懂画面,差距会越来越大。原文稍后读已读值得跟进有用关注 Kimi K3
14:26IT之家(博客/媒体)8 月 3 日,Cloudflare 以早期预览版形式发布 @cloudflare/computer 开源库,为每个 AI 智能体分配带文件系统与命令执行能力的虚拟工作计算机。该库基于 Workers 的轻量执行环境 Isolate 构建,使用 SQLite 实现虚拟文件系统,支持从云存储、Git 仓库或自定义文件导入内容。软件包提供两类后端:隔离环境后端用 just-bash 将 Shell 代码转为 JavaScript,适合文件处理与 Git 管理;容器后端借助 Cloudflare Containers 提供完整 Linux 环境,适合运行 npm 和原生二进制文件。AI 智能体执行命令时,会根据工具描述选择执行环境,轻量任务在隔离环境完成,需要 Linux 或编译型可执行文件时才调用容器。所有操作可设定权限门槛、审计和观测,并能限制智能体获准执行的操作。AI产品Cloudflare@cloudflare/computerIsolate4 个信源在谈事件专题推荐理由:Cloudflare 出了个新开源库,给每个 AI 智能体配独立虚拟电脑,能跑文件操作和命令,轻任务用 Isolate,重任务用容器。原文稍后读已读值得跟进有用关注 Cloudflare
13:35Hailuo AI@Hailuo_AIMiniMax H3 展示了单次生成视频的能力,仅凭一句提示词“Jim and Dwight from The Office discuss autonomous coding agents”便输出对应画面。演示片段中两位《办公室》角色围绕自主编码智能体展开对话,场景与人物神态连贯。目前官方未公布具体基准分数,效果以演示视频为准。AI模型MiniMax H3视频生成多模态6 个信源在谈事件专题推荐理由:MiniMax H3 不用多步迭代,一句 prompt 就能生成情景对话视频,直接看片源最有说服力。原文稍后读已读值得跟进有用关注 MiniMax H3
12:52官方账号arXiv cs.AI@Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan StojkovicAtumAI 是 arXiv 上的一篇论文提出的数据中心控制平面策略生成框架,能把策略设计从数月工程缩短为撰写一段文字描述。它通过 Datacenter Task Compiler 把自然语言目标编译为形式化、可搜索的规格,再由 Evolutionary Design Discovery Loop 结合扩散模型、进化算法和代理模型搜索候选策略。论文在负载放置、资源扩缩和功耗管理三个控制任务上测试,AtumAI 生成的策略均优于专家手工设计的基线。论文AtumAI智能体数据中心推荐理由:AtumAI 能自动写数据中心控制策略,你输入一句话它就出方案,论文里三个任务都赢过专家手调基线。原文稍后读已读值得跟进有用关注 AtumAI
12:50官方账号arXiv cs.AI@Taye Akinrele, Sindhuja Penchala, Noorbakhsh Amiri Golilarz, Sudip Mittal, Shahram Rahimi该论文提出一种针对生成式与智能体AI认知能力差距的分类法综述,围绕持久状态建模、目标导向自主性、自我监控与控制、环境交互、学习与适应五个维度组织现有研究。论文回顾了各维度的最新进展,指出常见局限,并提出自适应认知智能架构(ACIA)作为统一框架。还讨论了以认知为中心的评价方向,为迈向长期可靠推理和持续学习的认知AI提供路线图。论文认知智能智能体生成式AI推荐理由:这篇综述把生成式和智能体AI的认知短板按五个维度梳理清楚了,还给了个ACIA架构思路,适合想系统了解认知AI研究现状的人。原文稍后读已读值得跟进有用关注 认知智能
12:48官方账号arXiv cs.AI@Ortal Ashkenazi, Vitalii Kloz, Mykhailo UlianchenkoWix在客服助手Helpmate中部署三阶段技能选择管线:语义匹配、确定性可执行性门控、LLM决策。在756.6K条用户消息和267.6K对话中,门控移除了59.4%的技能-消息对,节省228.8百万token。相比暴露全部十个技能,上下文减少90.5%。反事实测试中,若不设门控,模型会在7.8%的对话中选择无法执行的技能。论文HelpmateWix智能体推荐理由:Wix用确定性门控砍掉59.4%无用技能调用,省2.3亿token,还量化了不设门控的7.8%误选率。做客服Agent的可以参考。原文稍后读已读值得跟进有用关注 Helpmate
12:35官方账号arXiv cs.AI@Natalie Isak, Matthew Dressman该论文指出,最强大的AI部署由多个专业智能体协作完成,而现有滥用检测只覆盖单会话或多轮对话,无法拦截跨会话攻击。攻击者可将有害目标拆解为多个无害步骤,分别在隔离的智能体会话中执行,从而累积出危险能力。作者提出Magnet检测方法,以用户ID为关联维度,跨会话聚合能力痕迹,并将分散的证据碎片组装为紧凑的证据包供检测器判断。实验表明,跨会话目标分解比等效单会话或多轮攻击更能诱发有害能力。论文MagnetAI安全智能体推荐理由:讲清楚了跨会话攻击怎么绕过检测,还给了个叫Magnet的解法,做AI安全的值得看看。原文稍后读已读值得跟进有用关注 Magnet
12:27官方一手marktechpost@Asif RazzaqY Combinator于2026年7月31日以MIT许可证开源了内部智能体协作框架QM。该框架已在会计、法务、活动和工程部门使用,为每位员工提供独立工作区,并为每个Slack房间分配独立的内存、文件、密钥、权限、定时任务和持久化沙箱。Pi、OpenCode、Codex、Claude Code均可驱动同一无头核心,部署时不锁定单一供应商。AI产品QMY CombinatorSlack4 个信源在谈事件专题推荐理由:YC把自己内部用的Agent协作工具开源了,MIT协议随便用,Slack里就能跑,还支持Claude Code等模型换着接。原文稍后读已读值得跟进有用关注 QM
12:17Harrison Chase@hwchase17LangGraph Studio 能对失败的 agent 运行做原样重放。用户在重放时替换任意一个组件,再以相同 trace 重跑。LangGraph Studio 会自动生成新旧运行间的 diff,帮助定位失败原因。该功能来自 LangChain 创始人的推文演示,尚无官方教程。技巧LangGraph StudioLangGraph调试推荐理由:LangChain 创始人在推上演示了 LangGraph Studio 的调试技巧:失败运行能重放和对比,比重新跑一遍省事多了。原文稍后读已读值得跟进有用关注 LangGraph Studio
12:15官方一手arXiv: DeepSeek@Ruiyang Zhang精选基于线性时序逻辑(LTL)和有限自动机(FSA)的运行时监控器用于拦截LLM智能体的不安全工具调用序列。研究发现同一监控器在GPT类和DeepSeek后端上攻击覆盖率约68-75%,在Gemini变体上仅6-13%。攻击分布的Shannon熵差异解释了这一差距:GPT类集中(H≈0.24比特,单个模式覆盖96%),Gemini分散(H≈2.81比特,7个簇各≤7%)。熵对覆盖率变异解释率为76%(Pearson r=-0.87,p=0.005),留一法验证r在[-0.91,-0.82]。论文提出部署前熵测试,可从小样本攻击数据预测监控覆盖率。论文LTLAI安全智能体推荐理由:这篇论文说清了同一安全监控器在GPT/DeepSeek上能拦七成攻击、在Gemini上几乎失灵的原因,还给了部署前预测覆盖率的测试。原文稍后读已读值得跟进有用关注 LTL
11:53官方账号arXiv cs.LG@Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying TaiRoMeRL将轨迹索引效用空间表示为按结果极性和记忆动态分解的固定维度任务记忆状态。在ALFWorld和LifelongAgentBench上,RoMeRL将Cold-Q比率降低80.0%,反馈密度提高约6.0倍。同时维护记忆大小减少84.4%,LLM调用减少21.1%。论文从理论上证明降阶参数化能增加每个效用坐标的平均反馈,代码已开源。论文RoMeRL智能体记忆系统推荐理由:这论文把智能体记忆里反馈分散和奖励污染的问题一起解决了,Cold-Q降了80%,记忆体积缩了84%,效果很硬核。原文稍后读已读值得跟进有用关注 RoMeRL
11:46官方一手arXiv: DeepSeek@Sicong Liao, Zhi Chen, Yaohua TangTCPO是一种面向验证器引导多轮强化学习的回合级信用分配方法,将验证器分数转换为回合级优势。它通过参考比较构建三种信用估计:回溯信用衡量相对最优状态的即时进展,事后延迟信用识别有后续回报的非改进回合,选择性反事实估计修正高意外回合。在数学推理、代码生成和AppWorld智能体任务上的实验显示,TCPO在Qwen3-4B和DeepSeek-R1-Distill-Llama-8B上取得最佳或并列最佳的最优回合Pass@8,并减少成功所需轮次。论文TCPO强化学习多轮推理推荐理由:TCPO把验证器分数拆成每一步的信用,让模型知道哪个回合真正有用,在数学、代码和Agent任务上都有效果。原文稍后读已读值得跟进有用关注 TCPO
11:26官方账号arXiv cs.AI@Sunny Dubey该研究提出用单类回声状态网络集成加CUSUM警报监控LLM Agent的步骤遥测,成本约每步200微秒。在2,823条episode上,以5%误报率检出71%的故障,AUROC达0.872。在外部数据集AFTraj-2K和ATBench上,排名迁移分别达0.745和0.779。确定性验证层在63个负例中零误报地捕获60%失败,回滚重跑将任务成功率从52%提升至73%。论文智能体故障检测模型监控推荐理由:不用每步都请大模型当裁判,用轻量监控就能抓到71%的Agent故障,自动回滚重跑后成功率从52%涨到73%。原文稍后读已读值得跟进有用关注 智能体
11:25官方一手arXiv: Anthropic@Hayder Tirmazi, Sam Markelon, Allison Bishop, Michael Mitzenmacher精选一篇arXiv论文首次对LLM上下文压缩进行形式化分析。作者提出两个博弈框架:Context Selection Game和Context Generation Game,分别对应子集保留和摘要生成两种压缩策略。论文证明Context Generation Game与单向通信复杂度等价,压缩预算等于同一误差下的单向通信复杂度。还证明存在一组查询,生成式压缩比选择式压缩需要更少预算。案例研究评估了Anthropic上下文压缩端点在一组集合成员查询上的表现。论文上下文压缩通信复杂度智能体3 个信源在谈事件专题推荐理由:这篇论文把上下文压缩和通信复杂度打通了,还测了Anthropic的端点,适合搞Agent的人看看。原文稍后读已读值得跟进有用关注 上下文压缩