8月22日
01:34
01:33
01:14
00:03
00:03Philipp Schmid@_philschmid
智能体正在检查失败的运行,编辑自己的工具、技能和代码,并保留有效的改进。作者总结了递归自我改进的理解和现状,更多信息请访问 philschmid.de/recursive-self…

推荐理由:Phil Schmid 分享了智能体如何进行递归自我改进,了解智能体如何自我学习和优化自己的工具和技能,值得一读。
00:03
8月21日
23:28
21:38
21:35
19:58
18:53
18:38
18:07
17:08
16:13
16:07
16:07官方一手pandaily@contact@pandaily.com (Pandaily)
78°
开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。
事件专题

推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!
16:02
14:34
12:35
11:13
11:13IT之家博客/媒体
阿里云MaaS新增GLM-5.3和Deepseek-V4-Pro模型,覆盖编程和智能体应用场景。GLM-5.3强化编程、长程任务处理和网络安全,Deepseek-V4-Pro增强智能体能力。千问AI平台已接入多款主力模型,支持API调用和模型订阅。
事件专题

推荐理由:阿里云新上线GLM-5.3和Deepseek-V4-Pro,编程和智能体应用场景更强大,值得开发者关注。
11:02
10:48
10:48官方账号arXiv cs.AI@Narges Ahmadi, Yubo Jiao, Jônatas Augusto Manzolli, Jiangbo Yu, Luis Miranda-Moreno
本研究提出了一种三智能体工作流程,结合对话数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查收集了学生通勤者在五种预定义天气场景下的出行方式选择,共获得454个受访者-场景观察。使用多项logit模型分析了与天气相关的关联,而逻辑回归和随机森林提供了机器学习基准。评估了九个本地部署的大型语言模型(LLMs),参数量从2亿到35亿不等,在四种零样本提示和上下文条件下进行评估,并通过角色、少量样本和基于视觉的配置进行扩展。随机森林实现了69.6%的五分类准确率,而最佳纯文本零样本LLM达到了69.9%的准确率,无需特定任务调整。习惯性出行信息产生了最一致的收益,专家框架通常优于角色扮演,而当习惯性出行信息不可用时,角色信息最有用。少量样本提示提高了几个模型的预测能力,在少量示例后收益稳定。使用向受访者展示的相同天气图像,最佳基于视觉的配置达到了71.5%的五分类准确率,表明视觉上下文可能为某些模型提供额外的预测信息。总体而言,该研究展示了如何在可审计的多智能体工作流程中协调对话调查、结构化数据处理、传统行为建模、机器学习和多模态LLM预测。
推荐理由:这篇论文提出了一种结合多种数据收集和预测方法的创新工作流程,对于研究出行行为和天气敏感需求预测非常有用,特别是对于想要了解如何将不同技术整合在一起的人来说。
10:20
10:20Viking@vikingmute
精选
Memmy 是一个开源项目,可将 Cursor、Claude Code、Codex 等多个 coding agent 的历史导入,统一整理后供所有 agent 共享。它能自动扫描并存储所有 agent 的相关内容,如架构、踩过的坑和进度。切换工具时,它通过 hooks 模式自动检索并注入相关记忆,无需手动输入重复上下文。
事件专题

推荐理由:最近发现一个叫 Memmy 的开源项目,能把多个 coding agent 的记忆抽出来共享,比如 Codex 额度用完了,直接用 Cursor 接着干,相关进度和内容能无感注入,以后换 Agent 也很方便。
10:10
10:10官方账号arXiv cs.LG@Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry
RGA-Designer 是一种新的图生成模型,用于设计多智能体系统的通信拓扑。该模型通过引入奖励模型来指导生成过程,奖励模型同时考虑任务正确性和结构紧凑性。在保持与 ARG-Designer 相同任务准确率的同时,RGA-Designer 将平均令牌消耗降低了 20.5%。
推荐理由:OpenAI 推出的 RGA-Designer,能让多智能体系统在保持性能的同时,减少 20.5% 的 token 消耗,比之前的 ARG-Designer 更高效。
09:08
09:08阮一峰的网络日志博客/媒体
Qwen 3.8 27B 是目前最强的个人电脑本地模型,但推理深度默认最高导致过度思考。OpenRouter 以 70 亿美元被 Stripe 收购,其估值在三个月内从 13 亿美元大幅增长。欧盟规定大模型生成内容必须带有水印,文本水印通过控制单词出现频率实现。
事件专题

推荐理由:看看 Qwen 3.8 27B 的过度思考问题,以及 OpenRouter 70 亿美金收购案,了解 AI 时代程序员和工具的变局。
08:28
08:28官方账号Simon Willison’s Weblog博客/媒体
精选
Promptwatch 的数据显示,ChatGPT 搜索中使用 site: 运算符的查询比例在 GPT-5.6 推出后显著增加。该比例从 0.3%-0.5% 跃升至 16-17%。OpenAI 曾宣布 GPT-5.6 Sol 在 Chat 中将提供更可靠的事实和更聚焦的答案。Promptwatch 还发现 ChatGPT 搜索中 Reddit 的使用概率大幅降低。
事件专题

推荐理由:Promptwatch 发现 ChatGPT 搜索里 site: 运算符的使用比例从 0.5% 暴增到 17%,这和 GPT-5.6 的更新有关,还发现它现在不怎么用 Reddit 了。
08:19
08:19Aravind Srinivas@AravSrinivas
Perplexity Agent API 为开发者提供访问 41 个前沿模型的单一端点。该 API 整合了 9 个不同提供商的模型。开发者可构建多模型智能体工作流,并使用内置工具如网页搜索、金融搜索、数据获取和沙盒代码执行。
推荐理由:Perplexity 推出了 Agent API,把 9 家的 41 个前沿模型都整合到一个接口里,还能直接用网页搜索、代码执行这些工具,比单独调用各家 API 方便多了。
07:51
07:51IT之家博客/媒体
OpenAI为macOS版ChatGPT应用添加了控制苹果“信息”应用的能力。该功能允许ChatGPT在用户授权后读取、撰写和发送短信。用户需要在ChatGPT应用和Mac系统设置中完成多项授权。彭博社分析师认为此举可能触及苹果Siri AI的设备优势。
事件专题

推荐理由:OpenAI给Mac版ChatGPT加了个新功能,能直接读你Mac上的短信,还能帮你发。这和苹果自家的Siri AI有点像,挺有意思的。
06:19
06:18
06:18官方账号LangChain@LangChainAI
精选
LangChain 推出 deepagents 工具,与 Browserbase 的 stagehand 配合,可轻松构建浏览器智能体。这些智能体能够执行点击、滚动、截图和提取结构化数据等操作。例如,用户已使用该工具构建了用于导航地图的智能体。
推荐理由:LangChain 推出了 deepagents,能帮你轻松搭建能操作浏览器的智能体,比如自动点击、截图、抓取数据,比以前方便多了。
06:13
06:05
05:39
05:39官方账号LangChain@LangChainAI
AI 原生律所 Vector Legal 使用 LangSmith 管理其法律工作流中的 AI 智能体。VectorOS 是其一站式法律操作系统,处理日常法律事务。该公司近期完成由 Base10 Partners 领投的种子轮融资,YC 参投。
推荐理由:看看 AI 律所 Vector Legal 怎么用 LangSmith 管理智能体,他们刚拿了 YC 和 Base10 的钱,挺有意思的。
05:35
05:35Browser Use@browser_use
Opus 5 和 GPT-5.6 Sol 在浏览器使用基准测试中表现接近。该基准由数百名用户参与,将真实用户任务转化为测试。测试采用原子化、可验证且明确的评估标准。这是目前最好的浏览器智能体基准测试。
推荐理由:Opus 5 和 GPT-5.6 Sol 在一个新浏览器基准上打平了,这个基准是真实用户任务,评估标准很细,看看谁更会上网吧。
05:32
05:03
05:03elvis@omarsar0
精选
一篇关于持续学习的新论文提出了一种名为“受保护 harness 演化”的方法。该方法将 harness 组件的更新提议与实际提交分离开来。通过使用持续优化器和持续评估器,该方法在文本推理、多模态感知和开放世界交互等任务上实现了超过10%的相对增益。论文还定义并量化了“harness 级别遗忘”这一现象。

推荐理由:这篇论文讲的是怎么让AI智能体在更新技能或记忆时,不会把之前学好的东西忘了。它把更新和评估分开,效果比原来好10%以上,对做智能体的人很有用。