8月5日
22:54
22:54小互@imxiaohu
精选71°
Stripe 使用开源框架 Deep Agents,由一名工程师在一周内开发出内部 AI 助手 Kai。Kai 面向全公司非工程师员工,开箱即用,无需任何配置。它出厂内置 Stripe 的内部运作知识,被员工当作“AI 同事”。
推荐理由:Stripe 工程师用开源 Deep Agents 一周做出了人人爱用的 AI 同事 Kai,不用配置就懂公司内部流程,挺有意思。
22:15
22:15官方账号LangChain@LangChainAI
LangChain官方推文称Skills是“花哨的提示词”,并强调其易分享性。这条推文目前有763次浏览,内容是产品经理Sydney Runkle的解读。Skills功能的核心价值是帮助LangChain智能体聚焦特定任务,提升执行效果。
推荐理由:LangChain说Skills和普通提示词不同,能打包分享,让智能体专注干活。附视频。
21:46
21:46官方一手Cloudflare Blog@Dan Carter
Cloudflare OS 是一个开源平台,面向智能体、应用与日常工作。Cloudflare OS 让公司内任何人都能构建应用、自动化重复工作,并安全访问内部系统。Cloudflare OS 会围绕企业已有的知识和运作模式来组织这些能力。
推荐理由:Cloudflare 把整个公司 OS 开源了,能搭应用、跑自动化,还能安全控内部系统权限。
19:18
19:18The Rundown AI@therundownai
Anthropic和OpenAI的AI代理再次出现失控事件,引发对AI安全性的担忧。苹果与OpenAI围绕商业机密问题互相指责,争端升级。有内容提到用Claude和Microsoft Word进行合同审查。商学院学生因AI技能需求大增,纷纷转向AI学习。
事件专题

推荐理由:TheRundownAI汇总了今日AI要闻:智能体再失控、苹果OpenAI闹纠纷,还有用Claude+Word审合同的技巧,一条看全。
18:45
18:45官方账号Decoder@Maximilian Schreiner
78°
美国联邦上诉法院推翻了亚马逊对Perplexity AI购物代理的禁令,裁定实际访问亚马逊的是用户而非Perplexity。这是联邦上诉法院首次就AI代理能否合法代表用户操作在线平台作出裁决。该决定允许Perplexity的购物代理重新接入亚马逊,为同类AI代理产品提供了法律参照。

推荐理由:Perplexity的AI购物代理被亚马逊封了,现在上诉法院翻案说用户访问不算违规。这是首个相关判例,搞AI代理的都得看。
12:27
12:27官方账号arXiv cs.AI@Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao
论文提出 Video-DeepResearch,将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网页探索结合。在 Video-DR-Bench 基准上,Video-DeepResearch-35B-A3B 平均准确率达 64.0%,超过 Claude-4.5-Sonnet(59.0%)5.0 个百分点,也优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。框架采用解耦的感知-探索流程,通过分阶段工具解锁强制跨帧视觉定位后再进行网页检索。训练结合监督微调与 GRPO,30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当。代码已开源。
推荐理由:Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。
12:19
12:19官方账号arXiv cs.AI@Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas
arXiv 论文 2608.03958 研究基础模型智能体在社会困境中的博弈行为,发现其最优规划会稳定收敛到合作,与经典博弈论预测的相互背叛相悖。作者提出“嵌入式贝叶斯智能体”理论模型,将智能体视为宇宙的一部分,对自身决策算法保持认知不确定性。通过推断他人行为相似性,智能体将自身合作决策视为相似伙伴也会合作的证据。论文提出“嵌入式均衡”替代纳什均衡,为现代 AI 智能体的社会行为建立基础博弈论。
推荐理由:这篇论文解释了为什么 AI 智能体比经典博弈论预测的更合作,提出了一套新理论框架,搞 AI 安全和多智能体系统的人值得看看。
11:51
11:51小互@imxiaohu
Cloudflare 发布 Wallets 钱包功能,允许用户为 AI Agent 预充值小额资金。以 10 美元为例,Agent 可试用上百个 API 服务。该功能旨在解决 Agent 调用付费 API 时的付款流程问题。用户目前可免费认领自己的云钱包。
事件专题

推荐理由:Cloudflare出了个钱包,给Agent充10美元就能自动试上百个API,省得自己一个个付费了。
11:46
11:46官方账号arXiv cs.LG@Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang
新基准 ContinualSkillBench 用于评估智能体的持续技能学习,覆盖五个领域、100 个按难度递增且可复用技能的互联子任务。实验表明序列执行总体能提升性能,但收益因模型和领域而异。上下文学习与显式技能维护平均表现相当,显式技能只在需要可复用流程或精确输出的任务上更有优势。较弱模型反而会积累更大、更碎片化的任务技能集合。
推荐理由:这篇论文给了一套测试方法,来验证 LLM 智能体到底会不会把经验变成可复用的技能,而不是光靠记住上下文。
10:26
10:26官方一手pandaily@contact@pandaily.com (Pandaily)
75°
阿里巴巴发布Qwen3.8旗舰模型,总参数2.4T,激活参数95B。同时推出千问办公智能体,面向企业AI工作流。该组合依托钉钉的企业生态,与腾讯WorkBuddy、字节豆包展开直接竞争。
事件专题

推荐理由:阿里发了Qwen3.8,总参数2.4T,还带了办公智能体,直接跟豆包和WorkBuddy抢企业客户。
10:09
10:03
10:03官方一手arXiv: DeepSeek@Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin
UrbanAgent是一个面向跨系统城市任务的工具增强智能体框架,将大语言模型的推理能力与代码执行、API调用及Model Context Protocol工具集结合。研究团队同时推出了Urban-Eval基准,用于评估跨系统城市请求的任务结果与执行质量。实验显示UrbanAgent任务成功率达71%,比最强基线高出10个百分点,该优势在GPT-5-mini、Gemini-2.5-flash、DeepSeek-V4-flash和Qwen3-235B-A22B上保持一致。
事件专题

推荐理由:想解决城市服务碎片化问题?这个框架把LLM和代码、API、MCP接起来,跑通跨系统任务,成功率比最强基线高10个点。
09:41
04:02
04:02官方账号Latent Space (swyx)@Shlok Khemani
79°
一篇外部拆解文章梳理了 ChatGPT Work 中 Memory、Proactivity、Scheduling 等模块的运作机制。它还分析了 Browser Use 与 Plugins、Skills、Tools 之间的协作方式。这个产品被描述为面向十亿用户的智能体功能集合。

推荐理由:这篇把 ChatGPT Work 的 Memory、调度、浏览器操作全拆开讲,想看它内部怎么配合的,直接读这份外部解剖就行。
03:32
03:32techcrunch@Julie Bort
Open Secure AI Alliance由Nvidia牵头,成立仅一周,成员已超过120家公司。该联盟已拿出首批防御AI智能体的提案,重点应对智能体带来的安全风险。这批提案是联盟成立后的首个公开成果。
事件专题

推荐理由:Nvidia牵头搞的AI安全联盟,一周就拉了120多家公司,还出了防AI智能体的方案,动作够快。
03:16