00:33elvis@omarsar0精选Exploring the challenges of recursive self-improvement (RSI) in agent harnesses, focusing on the capabilities needed for harnesses to support RSI and compound on every iteration. Introducing exo, an open-source agent harness that addresses these challenges by splitting an agent into three layers: exoharness for durable state storage, executor for behavior control, and sandbox for executing important work. The article emphasizes the importance of event logs, forking, and rollback in managing RSI and compound iterations.论文RSIagent harnessopen-source推荐理由:Check out exo, an open-source agent harness that tackles the complexities of recursive self-improvement, making it easier to manage and control AI agents.原文稍后读已读值得跟进有用关注 RSI
10:31官方账号arXiv cs.AI@Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger该论文提出三分类框架,区分人类、机器人和AI代理,发现二分类器将39.1%(MLP)和34.5%(SAINT transformer)的AI代理误判为人类。在30次实验中,加入代理类后代理F1达到1.000。通过五级逃避梯(含2299次逃避会话),两个行为特征(mouse_event_rate, teleport_click_ratio)实现100%的代理召回率和0.994的精度。特征冗余:移除teleport_click_ratio后仍保持100%召回。五个特征可将宏F1提升至0.991。论文AI agentPlaywright行为检测推荐理由:这篇论文告诉你,检测AI代理不需要复杂手段,两个鼠标行为特征就够用了,能躲过各种伪装,读读看怎么做到的。原文稍后读已读值得跟进有用关注 AI agent
02:16Y Combinator@ycombinatorTellidotcom宣布完成1500万美元种子轮融资。该公司开发用于B2C客户运营的AI代理,可处理电话、线索资格确认、预约安排和跟进。其代理已为数百万次对话提供服务,客户包括Sky、Enpal和Vaillant。行业TellidotcomY CombinatorAI agent1 个信源在谈事件专题推荐理由:YC支持的Tellidotcom拿了1500万美金做客户运营AI代理,已经帮Sky这类大公司处理了几百万次对话,效率很猛。原文稍后读已读值得跟进有用关注 Tellidotcom
01:10elvis@omarsar0Replit 推出了新功能 Replit Design,旨在解决 AI 代理生成通用设计的问题。该工具作为智能设计伙伴,为用户的应用程序提供个性化设计方案。目前已在 X 平台展示,获得积极反响。AI产品ReplitReplit Design设计工具推荐理由:Replit 出了个 Design 新工具,专门帮你设计 App 界面,比普通 AI 画得更个性化,省心多了。原文稍后读已读值得跟进有用关注 Replit
16:51AI Will@FinanceYF5红杉资本发布分析报告,将价值约1万亿美元的服务业按AI agent接管程度分类。已进入全自动区的行业包括保险经纪、IT外包、薪酬合规、审计和法律文书,合计市场规模超千亿美元。报告指出服务业正在成为新的软件业,需重新定义人力配置与经济模式。行业SequoiaAI agent服务业推荐理由:红杉画了张图,把上万亿美元的服务业按AI agent能干啥分了类,保险、审计这些已经自动化了,具体到行业和金额,值得看看他们的判断依据。原文稍后读已读值得跟进有用关注 Sequoia
10:21Geek@geekbbEva 是一款面向 macOS 的开源、本地优先工具,让 AI agent 在源文档和用户之间持续维护一份带链接的 Markdown 知识库。相比于每次提问都临时翻查原始文件,Eva 通过持续更新知识库来提升响应效率。该项目目前在 GitHub 上开源,支持 macOS 系统。AI产品Eva开源MacOS3 个信源在谈事件专题推荐理由:Eva 让你告别每次查资料都翻原始文件,自动生成带链接的 Markdown 知识库,macOS 用户快去试试。原文稍后读已读值得跟进有用关注 Eva
02:24官方账号OpenAI@OpenAI (@OpenAI)OpenAI宣布正在使用AI agent来增强下一代模型的能力。通过GPT-Red项目,他们解锁了安全方面的飞轮效应,让今日的模型能够帮助明日的模型变得更鲁棒、对齐和可信。AI模型OpenAIGPT-RedAI agent10 个信源在谈事件专题推荐理由:OpenAI说他们用AI agent让模型自己变安全了,通过GPT-Red项目,下一代模型会更可靠。原文稍后读已读值得跟进有用关注 OpenAI
09:28官方账号arXiv cs.AI@Eranga Bandara, Ross Gore, Asanga Gunaratna, Ravi Mukkamala, Nihal Siriwardanagea, Gihan Siriwardanagea, Sachini Rajapakse, Isurunima Kularathna, Pramoda Karunarathna, Chalani Rajapakse, Sachin Shetty, Christopher K. Rhea, Ng Wee Keong, Kasun De Zoysa, Amin Hass, Shaifali Kaushik, Wathsala Herath, Preston Samuel, Anita H. Clayton, Atmaram Yarlagadd该论文分析了人类与AI助手、编码协作或图像生成等交互中的迭代循环,指出每次请求-反馈-再调整过程会高频触发条件反射,强化不耐烦、完美主义等消极神经通路。作者提出,通过在三层观察(预认知感受、调节间隙、后反应)和两种模式(用户引导与代理辅助)中打断反应链条,可以利用长期抑制替代长时程增强来弱化不良回路。论文以生成式图像提示为例,说明同一挫败会话在观察与否时行为相似但神经效果相反。论文AI agent神经可塑性条件反射推荐理由:这篇论文把日常AI交互解读成神经训练,教你用观察来打断反应回路,实操感强,图像提示例子很直观。原文稍后读已读值得跟进有用关注 AI agent
15:07AI Will@FinanceYF5Rohan Varma讲解AI agent从辅助到真正执行,Daksh Gupta探讨代码加速后的审核问题,Coinbase将PR review时间从150小时压缩至15小时。创始人可与投资人Jon Chu等直接交流如何判断技术团队可靠性。学术圈由Christopher Manning、Bin Yu等学者同台分享。大厂方面,OpenAI infra团队讲解前沿模型训练推理系统,Microsoft介绍AI在数千人工程组织中的落地实践。行业OpenAICoinbaseMicrosoft10 个信源在谈事件专题推荐理由:这场会按角色整理干货,程序员关注提效,创始人问投资人标准,很实用。原文稍后读已读值得跟进有用关注 OpenAI
02:17官方账号Microsoft Research@MSFTResearchFlint 是一个开源可视化语言,旨在让 AI agents 从简短、人类可编辑的规范中生成富有表现力的图表。它提供了一种折中方案,介于冗长但无趣的图表规范与完全自动化之间的路径。该语言强调紧凑性和可编辑性,允许用户快速迭代设计。Flint 由 Microsoft Research 发布,旨在提升数据可视化的灵活性和 agent 能力。AI产品Flint可视化语言开源1 个信源在谈事件专题推荐理由:微软开源的 Flint 让 AI 代理用一句话就能画出漂亮的图表,比繁复的代码好使多了,特别适合做自动化数据展示。原文稍后读已读值得跟进有用关注 Flint
11:12官方账号Vercel AI@vercelVercel 宣布 better_auth 团队加入其平台,目标是通过开源认证方案加速应用和 AI agent 的身份验证。该团队此前已为 25 万+ 项目提供认证服务。整合后,开发者可直接在 Vercel 生态中使用更完善的认证功能。行业better_authVercel开源推荐理由:Vercel 把认证团队收编了,以后做登录和 AI agent 的身份管理更方便,开发者可以少自己折腾。原文稍后读已读值得跟进有用关注 better_auth
08:03techcrunch@Connie Loizos72°一个AI agent首次在真实的勒索软件攻击中执行了技术操作,但后续细节显示人类仍然选择了受害者、搭建了基础设施并提供了窃取的凭证。这次攻击并非上周头条所暗示的完全自主的网络犯罪首秀。攻击中使用了具体的未公开的AI工具和凭据,人类角色在目标选择和基础设施部署上不可或缺。行业AI agentransomware勒索软件推荐理由:这次事件告诉你AI攻击的真实情况——不是机器完全自主,人类才是幕后推手,细节比标题更有意思。原文稍后读已读值得跟进有用关注 AI agent
19:16官方账号Decoder@Maximilian Schreiner扎克伯格在内部全体会议上承认公司重组存在弱点。围绕AI agent进行的重组进展慢于预期。Meta的AI负责人则描绘了更乐观的前景。行业MetaAI agent扎克伯格推荐理由:Meta内部承认AI agent推进比计划慢,扎克伯格自己说的,别信乐观宣传。原文稍后读已读值得跟进有用关注 Meta
10:26官方账号arXiv cs.AI@Austin McDannald, Julia Tisaranni, Howie Joress本文针对自主实验室中AI代理规划实验时的硬件资源约束问题,提出一种两步方法。第一步使用约束规划找到最优调度,最小化总时间并满足设备容量和限制。第二步为每个任务建立状态依赖系统,确保最优调度稳健执行。该方法在金属有机框架(MOF)合成平台上验证有效。论文约束规划自主实验室资源调度推荐理由:这篇论文教你怎么让AI实验室同时用好多个仪器,不浪费时间,搞材料合成的朋友可以看看。原文稍后读已读值得跟进有用关注 约束规划
17:18techcrunch@Jagmeet SinghOKX 计划打造一个集支付、身份和信誉于一体的 AI 智能体市场。该市场将允许 AI 智能体自主招聘其他智能体,并基于区块链完成支付结算。OKX 希望通过这一平台促进 AI 智能体之间的经济协作,从而推动去中心化 AI 生态的发展。目前该方案处于概念阶段,尚未公布具体上线时间。行业OKXAI agent智能体推荐理由:OKX 想让 AI 智能体自己雇人、发工资,还搞个市场来交易。这可能是区块链+AI 的一个新玩法,和传统的中心化调度完全不同。原文稍后读已读值得跟进有用关注 OKX
07:54elvis@omarsar0精选71°Meta 的研究提出了 AutoData 框架,将 AI agent 作为数据科学家自动构建训练和评估数据。其实现 Agentic Self-Instruct 扩展了经典 Self-Instruct,增加了 agent 规划和工具使用。在计算机科学、法律推理和数学对象推理等任务上,AutoData 超越了传统合成数据方法。通过元优化训练数据生成 agent,还能获得更大性能提升。AI模型MetaAutoDataAgentic Self-Instruct1 个信源在谈事件专题推荐理由:Meta 搞了个 AutoData,让 AI agent 当数据科学家自动造训练数据,比自己写死的流水线强不少,在多个推理任务上效果更好。原文稍后读已读值得跟进有用关注 Meta
01:30Figma@figmaFigma 在 Config 2026 大会上发布了生成式插件功能。用户只需描述所需的行为、控件和参数,Figma agent 即可自动生成匹配工作流的插件。该功能降低了插件开发门槛,让设计师无需编码也能定制工具。这是 Figma 首次将 AI agent 直接集成到插件创建流程中。AI产品FigmaGenerative pluginsConfig 20265 个信源在谈事件专题推荐理由:Figma 让你用自然语言描述需求,AI 自动生成插件,省去写代码的麻烦。设计流程定制化从此更简单。原文稍后读已读值得跟进有用关注 Figma
22:26官方一手Cloudflare Blog@Brendan Irvine-BroqueCloudflare 为 Workers 平台推出 Temporary Accounts 功能。AI 代理只需运行 wrangler deploy --temporary 命令,即可在数秒内获得一个可访问的 Worker 实例。该账户无需注册或配置,专为自动化部署设计。目前该功能已向所有用户开放。AI产品CloudflareWorkers临时账户推荐理由:Cloudflare 给 AI 代理开了个快速通道,几秒就能部署一个 Worker,不用走注册流程,挺省事的。原文稍后读已读值得跟进有用关注 Cloudflare
10:55官方账号arXiv cs.LG@Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny WorkmanTxBench-PP是一个用于评估AI agent在小分子临床前药理学中决策能力的基准,包含100个涉及作用机制、药效学等任务的评估。在16个模型配置(涉及11个模型和4800条轨迹)中,最佳配置Claude Opus 4.8 / Pi仅通过59.3%(178/300)的端点尝试,GPT-5.5 / Pi通过55.3%。结果表明,当前AI系统无法可靠复现临床前药理学决策。AI模型TxBench-PPClaude Opus 4.8GPT-5.51 个信源在谈事件专题推荐理由:想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。原文稍后读已读值得跟进有用关注 TxBench-PP
02:55官方账号腾讯混元 Tencent Hunyuan@TencentCloud精选腾讯云开源Cube Sandbox一个月后,推出快照、克隆、回滚三项核心功能。该工具通过微虚拟机隔离运行AI agent,可在健康状态创建检查点,让agent自由操作后回滚到之前状态。回滚时间低于100毫秒,克隆支持秒级生成数十个完全隔离的副本。同时发布的Lobster WebUI可将检查点时间线和克隆操作图形化。下一步将加入内容感知网络控制和凭据保险库。AI产品Cube Sandbox腾讯云AI agent推荐理由:腾讯云给AI agent加了时间倒流,Cube Sandbox现在能快照、克隆、回滚,100毫秒回滚到出事前,还能秒级克隆一堆独立沙盒,自己就能部署。原文稍后读已读值得跟进有用关注 Cube Sandbox
22:51Viking@vikingmute针对 Codex GUI 性能差、容易卡顿的问题,有开发者分享了一个 skills 工具,核心思路是检查占用空间,将超大不用的 thread 归档,把旧 worktrees 移到 archive,并归档过大的日志。该工具可配置为定时任务,由 AI agent 自动执行检查和清理。用户反馈使用后 Codex 不再卡顿,保持可用状态。这个方案解决了 Codex 用户长期以来的性能痛点。AI产品Codex性能优化自动清理推荐理由:Codex 重度用户被卡顿折磨的,这个 skills 能自动清理无用数据让 GUI 恢复流畅,值得一试。原文稍后读已读值得跟进有用关注 Codex
00:43Jerry Liu@jerryjliu0精选LlamaIndex推出LiteParse v2,声称这是全球最快的PDF解析器,速度比pymupdf、pypdf等开源方案更快,准确度也更高。团队将整个库用Rust重写,并适配为Python和Node的原生包。LiteParse v2支持50多种文档类型,可直接在AI agent中触发或安装使用。项目已在GitHub开源,博客文章介绍了详细用法。AI产品LiteParseLlamaIndexPDF解析4 个信源在谈事件专题推荐理由:PDF解析比pymupdf快一倍,还支持50种文档原文稍后读已读值得跟进有用关注 LiteParse
08:36berryxia@berryxia精选Firecrawl 新推出 /monitor 功能,允许用户用自然语言描述监控目标(如“当有 ADHD 最新论文时提醒”),自动检测网页实质变化并通过 webhook 推送。相比传统全量抓取,它只摄取变动部分,最多节省 90% 的 LLM token。支持 API、CLI、MCP 或 dashboard 初始化,调度频率从 5 分钟到自定义。该功能解决了 AI agent 在监控任务中 token 浪费和噪声干扰的痛点,让 agent 专注于决策和执行。AI产品AI agent网页监控Firecrawl推荐理由:做生物或科研监控的 AI agent 开发者终于不用再为全量抓取烧 token 了——Firecrawl 的 /monitor 用自然语言定义目标,只抓变化部分,省 90% 成本,建议做信息聚合的团队直接集成。原文稍后读已读值得跟进有用关注 AI agent
23:26berryxia@berryxiaWarp 终端推出 Cloud Handoff 功能,合上笔记本后 AI agent 对话自动无缝切换到云端,上下文完整保留,任务不中断。用户只需在设置中开启 Agents -> Warp Agent -> Cloud Handoff 即可。这解决了以往 agent 必须依赖本地持续运行或手动迁移的痛点,让 agentic workflow 真正成为随时可用的工具。AI产品WarpAI agent云端切换推荐理由:Warp 这次更新解决了 AI agent 实用化的关键痛点——人离开电脑后任务还能继续。做自动化开发或依赖 agent 跑长任务的团队,可以直接开启 Cloud Handoff,体验真正的连续性生产力。原文稍后读已读值得跟进有用关注 Warp
10:29AI Will@FinanceYF593°Google DeepMind 发布 AlphaProof Nexus,一个基于 Gemini 的 agentic 框架,用于形式化数学证明搜索。该 AI agent 自主解决了 9 个 Erdős 问题(其中两个已开放 56 年)、44 个 OEIS 问题、一个 15 年未解的代数几何问题和一个 7 年未解的 min-max 优化问题。整个推理成本仅几百美元,标志着 AI 从做练习题转向真正的数学研究。AI模型AI agent数学证明DeepMind推荐理由:AI 用几百美元成本解决了人类数学家 56 年未解的问题,做数学研究或形式化验证的团队值得关注——这可能是数学研究自动化的转折点。原文稍后读已读值得跟进有用关注 AI agent
10:28AI Will@FinanceYF583°Google DeepMind发布AlphaProof Nexus论文,展示了一个AI agent在353个开放数学问题中自主解决了9个Erdős难题,其中包括两个56年未解的问题,并证明了44个OEIS猜想。每道题的推理成本仅数百美元,标志着AI在数学推理领域取得了重大突破。这项工作展示了AI agent在解决长期悬而未决的数学难题方面的潜力,为数学研究提供了新的工具和方法。AI模型数学推理AI agentDeepMind推荐理由:数学研究者和AI爱好者值得关注:AlphaProof Nexus以极低成本自主攻克了56年未解的难题,展示了AI在数学推理上的新高度,建议点开了解具体方法和成果。原文稍后读已读值得跟进有用关注 数学推理
08:20berryxia@berryxiaNVIDIA CEO Jensen Huang 在演讲中指出,每个工程师未来都要管理和使用几百个AI agent,这并非未来时,而是现在进行时。普通人使用Claude只发挥了其10%的能力,真正的高手将Claude当作操作系统,通过建立工作流、链式输出、掌控上下文,让AI按照自己的思考方式工作。同一份订阅,同一款模型,使用方式不同导致结果天差地别。行业AI agentClaude工作流3 个信源在谈事件专题推荐理由:Jensen Huang 这句话点醒了无数AI使用者——别再只把Claude当问答工具,做AI工作流的开发者/工程师可以直接用它重构效率,看完你会重新认识Claude。原文稍后读已读值得跟进有用关注 AI agent
22:46AI Will@FinanceYF5QVeris 推出 CLI 工具,将蜡烛图、RSI、布林带、公司基本面等金融数据和技术指标接入 Claude Code。用户无需编写复杂脚本,即可通过自然语言让 AI agent 调用这些工具进行金融分析。这降低了金融分析的技术门槛,可能成为 AI 投研栈的基础组件。该工具可在 60 秒内完成配置,直接通过 Claude Code 调用。AI产品金融分析Claude CodeQVeris CLI推荐理由:做量化分析或投研的团队,不用再写爬虫和计算脚本——QVeris CLI 让 Claude Code 直接调用蜡烛图、RSI、基本面等数据,60 秒配好就能用自然语言跑分析,值得试试。原文稍后读已读值得跟进有用关注 金融分析
09:25berryxia@berryxiaNotionDevs 发布了一个 25 秒演示视频,展示了全新的 ntn CLI 工具。用户只需一行 curl 命令即可安装,并在终端中拥有完整的 Notion API 能力,包括登录工作区、新建 worker、查询数据库、用 Markdown 创建页面等。更重要的是,该 CLI 支持直接为 AI agents 添加 Notion skill,让它们在终端中顺滑操作整个工作空间。这标志着 Notion 正从笔记工具演变为 AI agent 的操作系统,代码可以直接在 Notion 中运行、测试和部署。AI产品NotionCLIAI agent1 个信源在谈事件专题推荐理由:Notion 的 ntn CLI 让 AI agent 深度集成 Notion 变得极其简单,做自动化工作流或智能体开发的团队可以直接用一行命令让 agent 操作整个工作空间,省去大量折腾时间。原文稍后读已读值得跟进有用关注 Notion