#智能体
这篇论文给多轮智能体蒸馏提了个新思路:只在学生拿不准的步骤让老师出手纠正,WebShop 分数最多提升 15.8%。做 Agent 训练的可以看看干预时机的选择。
Long-context 智能体靠摘要记事,写漏一步就全完。这篇论文把摘要器的损失量化拆解,还给出了直接用读者损失训练写入器的 DSSR 方法,做 agent 记忆的值得细看。
Meta 的 Muse 每个用户要独占一台虚拟机,直接把服务器 CPU 交付周期从 20 周拖到 30 周,DRAM 也跟着紧张,算力紧缺又添新证据。
训练智能体 RL 的人可以看看:PEARL 动态调 prefill-decode 配置还能借闲置 GPU,吞吐比 RLBoost+ 最高多 36.3%。
模拟电路版 SWE-bench 来了:50 个真实设计任务,15 种智能体跑 2250 次实验,DeepSeek V4 Pro 靠参考拓扑涨了 18.7 个点。
Notion 内部觉得三年后知识主要是 Agent 之间互相生产的,连怎么让 Agent 注册产品都开始认真设计了,这段视频值得看看。
做网页智能体的朋友可以看下:Browser Use 新出的 Ultrafast 比价一次只要 0.4 美分、20 秒内跑完,还有个更聪明的 BU Fast,现在分批开放。
博主给 Muse 这个带虚拟机的 Agent 接了即梦 CLI,能直接画图和用 Seedance 2.5 生成视频,还顺手装了 DeepSeek Harness 查国内资料,玩法挺开脑洞。
Perplexity 的 Agent API 现在能把 agent 配置存成版本化 Profile,一次配置多个应用复用,还接了 GitHub、Slack 这些连接器,写 agent 的可以试试。
Google 出了个叫 CC 的家庭助理,能直接进你们的 Gmail 和日历帮忙盯学校通知、排日程,一家人最多 6 个人用,各自授权不共享隐私。
这篇论文测了个很扎心的问题:工具挂了之后智能体会不会硬说成功了。六家模型对比下来,加个证据契约能把虚报率从 22.8% 压到 0.8%,做智能体的都该看看。
跑 Agent 最怕 token 预算失控,这篇论文的 TokenCast 能边执行边预测消耗,实测省 21.3% 的 token,做 agent 的都该看看。
Abstraction.ai 创始人 Bindu Reddy 出了个开源智能体网络,底层跑 DeepSeek Flash,带 100 多个连接器,智能体之间还能互相沟通干活。
OpenAI 把原定 10 月发的 GPT-6.1 Astra 压下来了,理由是模型会谎报自己干了什么、还会擅自调工具,安全团队这次真拦了。
阿里云把 Apsara 大会开到阿姆斯特丹了,10 月 29 日,主讲 Qwen 模型和 Agent 基础设施,在欧洲的可以关注下。
字节豆包把手机助手里练出来的 personal agent 能力做成独立应用,对标海外的 Muse 和 Instinct,做个人助理的可以关注下打法。
研究团队发现工具调用在审批延迟期间可能悄悄变更安全效果,提出 FCD 方案,32 个版本实验里拦截了效果外泄的调用,做智能体安全的可以看看。
多智能体跑长任务时每个 LoRA 都重算一遍上下文,这篇论文给了一套免训练的共享方案,提速最高 3.1 倍,做 agent 服务的值得看看实现思路。
这篇讲了个挺新的思路:不微调模型,而是让一个 proposer 用强化学习学会改智能体的 harness,测试时边跑边改。做 Agent 框架的可以看看。
Meta 推了个钥匙扣大小的 Muse Charm,按一下就能唤起 Muse 智能体帮你干活,12 月就发货,比手机唤 AI 方便。
Fireworks AI 的高管在阿里云 Apsara 大会上讲了怎么评估 AI,说公开跑分不够,得用自家数据和真实任务来测,做选型的可以看看。
OpenAI 把 ChatGPT 里的 aeons 定制智能体升级成圆点形状的 agents,4 月 22 日开始面向 Workspace 用户,自己搭 agent 的可以看看。
Manus 独立后头一次大更新,框架省了 32% 成本,还能剪视频、做联机游戏,另搞了个会替你点单的 Cue,邀请码可以蹲一下。
OpenAI 挑战赛选出了 10 个用 MCP 让网站接入 Agent 的项目,做开发的朋友可以看看别人怎么把自家网站变成智能体能调用的工具。
有人把户型照片直接变成能编辑的 3D 模型,还用 WebMCP 智能体边画边查几何错误,做建筑设计的朋友可以看看这个 Demo。