8月20日
05:26
03:31
03:31
03:31官方账号Cursor@cursor_ai
Cursor发布了/goal指令功能,可让代理朝着长期目标持续工作直至完全达成。该功能通过指定明确目标,为代理提供清晰工作方向。与旧版操作相比,新功能增强了任务执行的持续性。
事件专题

推荐理由:cursor推出了/goal指令,能让你给代理设定长期目标,比之前方法让任务更持续地推进。
03:11
03:11Harrison Chase@hwchase17
LangChain 与 PrimeIntellect 等公司将举办网络研讨会,讲解如何通过自动化提升代理改进循环;重点围绕评估和环境工程这两个关键环节展开分享;参与者可学习到更高效的代理流程优化方法。

推荐理由:LangChain他们搞的网络研讨会,讲怎么自动优化代理流程,比普通方法更管用,你去听听吧。
02:51
02:51elvis@omarsar0
TrueForge 是 TrueFoundry 推出的开源代理 harness,支持运行 OpenAI、Anthropic、Kimi 等多种模型;在 14 任务企业代理基准中,其准确性匹配 Claude Managed Agents,成本降低约 30%;本地部署便捷,支持 sandboxed code 执行。
事件专题

推荐理由:TrueFoundry 推出了 TrueForge,这是个开源代理 harness,能跑多种模型,和企业版比成本更低还能自己部署。
02:41
02:41lmarena.ai@lmarena_ai
Agent Arena推出的Pareto前沿平台上,Claude Opus 5(High)在真实代理任务中表现领先,提升+12.34%;该平台对比了各模型成本与性能,@OpenAI的GPT 5.5(High)表现突出,提升+7.75%;参与对比的多款知名模型包括Kimi K3(Max)和Groq 4.5等,帮助用户了解不同模型差异。
事件专题

推荐理由:Agent Arena发布了Pareto前沿平台,能查各模型做真实任务里的表现,像 Claude 和 GPT 这些对比后就知道哪个更划算。
02:15
01:36
01:36Harrison Chase@hwchase17
YouTube推出的‘Managed Deep Agents’系列播放列表包含六部视频,第一部为介绍环节,后续视频分别讲解概念、快速开始、操作指南、技能及工具等内容,全面覆盖管理深代理的核心知识体系。

推荐理由:YouTube出了个‘Managed Deep Agents’系列播放列表,分步讲管理深代理的事,每个视频讲不同模块,比自己查资料方便。
01:25
01:25官方账号NVIDIA AI@NVIDIAAI
74°
英伟达对超300项验证技能开展基准测试,以相同任务、模型和设置对比有无技能的代理表现。在多项真实任务基准中,带技能的代理正确率提升41个百分点。与无技能代理相比,带技能代理效率提升35个百分点。
事件专题

推荐理由:英伟达测试超300项技能,对比后可知技能对代理帮助大小, 和无技能代理比效果不同, 值得去了解。
00:16
00:16小互@imxiaohu
OJO作为首款设计Agent团队工作空间,可组建专属设计团队并添加专业技能,将创意转化为产品策略等产品文档;该工作空间能在单一可编辑画布上完成从想法到可上线设计的全流程;与普通设计工具对比,其在设计协作效率上有显著优势。
推荐理由:OJO推出了设计Agent团队工作空间,能帮你组建团队加技能,把创意转成产品文档,和普通设计工具比更高效做全流程设计。
8月19日
23:55
23:55
23:51
22:43
22:42
22:42
22:41
22:41AI Will@FinanceYF5
精选
Anthropic 公司发布技术报告,报告中呈现了其AI模型在智能体开发方面的最新成果;同时该公司开源了提示词数据集,为开发者提供实践参考;该举措让开发者能够对比 Anthropic 与行业同类项目的差异。
事件专题

推荐理由:Anthropic 发布技术报告和开源提示词,对做智能体开发的伙伴有帮助,比普通AI工具更专业些。
22:38
22:38官方账号Clement Delangue@ClementDelangue
2018年,HF为青少年开发专属聊天机器人,同时OpenAI推进自身核心项目。2026年,双方项目方向出现逆转,HF转向OpenAI类项目,OpenAI则聚焦青少年聊天机器人。
事件专题

推荐理由:朋友说HF和OpenAI这次项目方向调换了,HF做类似OpenAI的项目,OpenAI做青少年聊天机器人,和之前比方向完全变了,值得了解下~
22:37
22:37IT之家博客/媒体
小米新一代人形机器人在2026世界机器人博览会上亮相,其与观众互动视频显示,由大模型驱动实现自主理解动作;从递花、握手等互动场景可知,机器人可自主判断并完成动作;8月20日起展台开放,观众将体验该功能。

推荐理由:小米发布了人形机器人互动视频,用大模型让人机互动更自然,和普通机器人比能自主理解动作。
12:33
12:32
11:43
11:43官方账号arXiv cs.AI@Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni
EvoTS-Agent是一种面向金融时间序列变化点检测的自进化LLM智能体。该系统在四个基准数据集上测试,通过Revision、Alternative Strategy和Recombination三个互补算子优化检测流程。实验表明,EvoTS-Agent在所有评估的骨干LLM上保持100%执行成功率,性能始终优于现有LLM智能体。
推荐理由:金融时间序列变化点检测的新方法EvoTS-Agent,能自动优化模型选择和参数,无需专家干预。
07:05
07:05官方账号LangChain@LangChainAI
LangChain组织了一场关于评估工程(eval engineering)的直播,邀请Prime Intellect和Baseten的专家参与。直播讨论了如何将真实世界的轨迹数据转化为模型环境,以持续改进模型。内容涵盖将环境与评估作为智能体的训练数据、训练时机及人工介入程度等话题。
推荐理由:想学怎么把业务数据变成训练环境?这场直播讲得挺实在,Prime Intellect和Baseten的人都在,适合搞智能体的朋友。
06:57
06:57官方账号LangChain@LangChainAI
LangChain 在 X 平台发布了一个能自动修复其他智能体的新智能体。该智能体可检测并修正运行中的错误,减少人工干预。目前帖子互动量较低,但已引发 1351 次浏览。具体技术细节尚未公开。

推荐理由:LangChain 整了个新活:一个能自动修 bug 的智能体,省得你手动调,感兴趣可以看看。
06:41
06:41官方账号Perplexity@perplexity_ai
DeepSeek V4 Pro 现已在美国托管的 Perplexity Computer 中可用。Perplexity 在 WANDR 基准上对其进行了评估,得分为 0.359,每任务成本 0.75 美元。该模型比成本性能前沿上的下一个模型便宜 62%。
事件专题

推荐理由:Perplexity 把 DeepSeek V4 Pro 放进自家电脑了,跑分 0.359,每任务才 0.75 美元,比同档便宜六成多,性价比很能打。
05:28
05:28官方账号LangChain@LangChainAI
LangChain将与AWS和MongoDB在旧金山联合举办AWS Agentic AI Partner Showcase Extended活动。活动将展示从代码到部署的生产级智能体构建过程。参与者可听取技术专家分享、观看现场演示并与开发者交流。活动详情可访问aicamp.ai查看。

推荐理由:想学怎么把智能体从代码搞到上线?LangChain、AWS、MongoDB三家人现场演示,还有专家答疑,别错过。
03:38