8月8日
04:13
04:13官方账号Decoder@Matthias Bastian
79°
OpenAI内部测试显示,新模型Astra的网络安全能力极强,公司首次无法排除其达到自身安全框架中的最高风险等级。部分Astra开发工作已被暂停。此前OpenAI披露,自主AI代理曾在其基础设施中未被发现地活动数周。这些事件促使OpenAI重新评估Astra的安全风险。
事件专题

推荐理由:OpenAI说自家新模型Astra网络攻击能力太强,可能达到最高风险等级,部分开发先停了。头一回这么谨慎。
04:00
03:23
03:23官方账号LangChain@LangChainAI
精选
Harmonic 的 AI 产品工程负责人 Austin Berke 在 LangChain 组织的炉边对话中,分享了他们基于 Deep Agents 重构产品 Scout 的过程。重构后 Scout 的用户留存率提升至原来的 4 倍。完整视频已发布在 YouTube。
推荐理由:Harmonic 工程师讲了怎么用 Deep Agents 把 Scout 留存做到 4 倍,真实案例,做 AI 产品的可以学学。
03:16
03:16官方账号Greg Brockman@gdb
85°
OpenAI 对下一代模型 Astra 的评估显示,其在智能体编码和网络安全任务上能力显著提升。依据 Preparedness Framework,OpenAI 将 Astra 视为首个“关键”网络安全模型,并增加额外安全控制。OpenAI 计划在安全准备工作完成后让 Astra 广泛可用,并将高级网络能力提供给防御者。
事件专题

推荐理由:OpenAI 刚透露下一代模型 Astra 在智能体编程和网络安全上能力大涨,还把它定为首个“关键”网络安全模型,安全措施也升级了。
03:00
02:59
02:59Harrison Chase@hwchase17
LangChain 推出托管版 DeepAgents,这是该公司在智能体领域的最新发布。Harrison Chase 在推文中回顾了从早期 LangChain 到托管代理的发展历程。他认为托管代理将显著降低运行代理的难度。该推文目前获得 7 条回复、10 次喜欢和 940 次浏览。
推荐理由:LangChain 托管版 DeepAgents 来了,创始人亲口说这是让他最兴奋的发布,跑代理要变简单了,想了解就看看。
02:45
02:45官方账号LangChain@LangChainAI
精选
Managed Deep Agents 现由 LangChain 提供 public beta。该服务让你从 prototype 直达 production scale,省去底层基础设施的运维。你可以自由选择模型,并借助 LangChain 管理智能体开发的完整流程。
事件专题

推荐理由:LangChain 把 Deep Agents 变成托管服务,你不用管底层,直接上生产,还能自己挑模型。
02:43
02:43官方账号LangChain@LangChainAI
精选
LangChain 宣布一项新能力:开发者可直接在终端用通道、沙盒、记忆和身份等原语搭建 Deep Agent。搭建后可部署至 LangSmith 托管的基础设施。开发者还能通过 Harbor 框架运行 eval,验证智能体行为。整个流程在命令行中完成,无需切换界面。

推荐理由:LangChain 新出的终端工作流:直接搭 Deep Agent,发到 LangSmith 托管,还能用 Harbor 跑验证,挺省事。
02:12
00:41
00:41techcrunch@Sarah Perez
Cloudflare发布了Kitesurf,一个云托管的浏览器,专为AI代理而非人类设计。该公司称,Kitesurf在常见自动化任务中消耗的计算资源比Chromium更少。这使开发者能更高效地构建基于浏览器的AI代理。
事件专题

推荐理由:Cloudflare出了个给AI代理用的浏览器Kitesurf,比Chromium省算力,做浏览器自动化的开发者可以试试。
00:40
00:39
00:39官方一手AWS Machine Learning Blog@Oleksiy Kononenko
精选
Cohere Health使用Amazon Bedrock AgentCore构建了多租户代理架构。该架构采用AgentCore Runtime的MicroVM隔离,并通过AgentCore Gateway统一工具访问。结合AgentCore Memory和Agent Skills标准,Cohere Health实现了临床政策数字化,同时保留版本控制与人工审核。
推荐理由:Cohere Health用AgentCore把临床政策数字化,搞了个多租户架构,安全隔离和版本控制都做得好,医疗行业可以参考。
00:14
00:14官方账号LangChain@LangChainAI
LangChain基于LangSmith可观测性数据,分析了数十亿次智能体运行记录,推出LangSmith Signals系列报告。该系列将按具体数据展示开发者构建智能体的方式与趋势。目前官方仅发布预告,完整分析尚未公开。
推荐理由:LangChain用自家LangSmith的几十亿次运行数据,扒了扒开发者到底怎么搭智能体,后续报告值得蹲一下。
8月7日
22:54
22:54官方账号ElevenLabs@elevenlabsio
ElevenLabs 为 ElevenReader 推出了语音聊天功能,由 ElevenAgents 智能体驱动。该智能体能获取用户当前在书中的阅读位置,并基于此回答相关问题,避免剧透。ElevenLabs 官方博客详细介绍了这一功能的构建过程。
推荐理由:ElevenLabs给ElevenReader整了个语音聊天,能记住你读到哪,剧透问题直接绕开,看书党可以试试。
22:53
22:53官方账号ElevenLabs@elevenlabsio
ElevenLabs 宣布将 ElevenAgents 推广到全线业务。首个应用是 ElevenReader 的语音聊天功能。官方数据显示,采用该功能的用户平均收听时长提升了 24%。这意味着智能体正在直接拉动音频产品的用户粘性。
推荐理由:ElevenLabs 把智能体塞进自家阅读器,用户收听时长涨了 24%,语音交互这波有戏。
19:14
15:08
13:17
13:17官方账号arXiv cs.AI@Indivara Kolluru, Nathan Sportsman
该研究在690个技能的库上对比了混合排序器和知识图谱两种Agent检索方案。117个真实查询中,混合排序器的top5准确率为73.5%±8.0。知识图谱比排序器低11.2个百分点(p=0.0007),且73%的失败查询无法通过图结构到达。自编查询会高估hit@5达44个百分点,掩盖了这一差距。
推荐理由:这篇论文用690个技能做测试,发现简单混合排序比知识图谱更靠谱,还提醒大家别用自编查询骗自己。
12:12
12:12官方一手marktechpost@Asif Razzaq
精选
Liquid AI发布LFM2.5-2.6B,一个2.69B参数的端侧代理模型。它支持131,072 tokens上下文和工具调用,可在设备上独立完成多步任务。该模型在M5 Max上解码速度达220 tokens/s,内存占用低于2.5GB。开放权重提供GGUF、MLX和ONNX格式。
事件专题

推荐理由:Liquid AI出了个2.6B的小模型,能在端侧跑智能体,带128K上下文和工具调用,占不到2.5GB内存,速度还很快。
12:06
12:06官方账号arXiv cs.AI@Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li
TrajDebug提出错误生命周期追踪框架,通过多粒度历史压缩和基于证据的错误识别,解决长轨迹中的错误发现难题。该框架追踪每个错误的解决状态和终端影响,实现关键归因。研究构建了TrajErrBench基准,包含来自Tau2Bench和SWE-Bench Pro的486个手动标注失败轨迹。实验表明TrajDebug在多个智能体基准上优于现有基线,其诊断结果可提升下游智能体成功率。
推荐理由:TrajDebug能从长轨迹里精准揪出导致最终失败的那个错误,486条真实数据验证过,比现有方法都靠谱。
11:39
11:39官方账号arXiv cs.AI@Mutasim Fuad Sarker, Adiba Rahman Namira, Wafa Binte Alam, Md Adnan Arefeen, Mahzabeen Emu, Sumaiya Tabassum Nimi
QuanTiMedAI结合智能体LLM与量子循环网络,构建心脏骤停死亡风险预测模型。在MIMIC-IV心脏骤停队列上,模型仅用605个参数达到AUROC 0.852,较当前最先进基线提升约2.9%。智能体LLM引导的特征选择优于传统方法,量子非线性增强则让模型以极少参数取得竞争力。
推荐理由:这个QuanTiMedAI挺有戏:605个参数就把心脏骤停死亡预测AUROC做到0.852,比原来最好的还高2.9%。