08:59SuperTechFans(博客/媒体)精选Zed 发布全新多人协作编码环境 Delta,基于 DeltaDB 构建,可实时同步对话与代码工作树。评论能锚定在任意代码行并随代码演变更新,智能体可直接参与对话线程解释或修复问题。Delta 支持云端运行,关闭笔记本后智能体仍继续工作,通过链接分享线程可在浏览器打开。该应用以对话而非编辑器为中心,目前私人测试已开始邀请用户。AI产品ZedDelta智能体推荐理由:Zed 发布 Delta,专为 AI 智能体协作设计,评论跟代码走,可云端运行,适合智能体开发。私人测试开放。原文稍后读已读值得跟进有用关注 Zed
06:44OpenRouter@OpenRouterAI精选OpenRouter 新增代码检索模型 Voyage Code 4,由 VoyageAI 与 MongoDB 联合推出。该模型支持 Matryoshka 嵌入,可在 256、512、1024、2048 四种维度间灵活切换。同时提供多种量化选项,帮助开发者降低存储与计算成本。开发者可直接在 OpenRouter 平台上调用该模型。AI模型OpenRouterVoyage Code 4VoyageAI推荐理由:写代码的智能体要检索代码库?OpenRouter 上新了 Voyage Code 4,四档嵌入维度可调,还有量化选项,省资源又灵活。原文稍后读已读值得跟进有用关注 OpenRouter
05:42Hailuo AI@Hailuo_AI精选76°MiniMax 正式发布新一代开源权重音乐模型 MiniMax-Music3。该模型定位生产级(production-ready),可用于多种音乐生成场景。官方称其为 SOTA 级开源音乐模型。权重开放,开发者可自行部署和微调。AI模型MiniMaxMusic3开源模型推荐理由:MiniMax 把音乐模型开源了,叫 Music3,号称开源里最强,能直接生成各种风格的音乐,适合想做 AI 音乐应用的人。原文稍后读已读值得跟进有用关注 MiniMax
05:11官方账号Cursor@cursor_ai精选72°Cursor宣布Firetiger团队正式加入。双方将共同开发能跟随代码进入生产环境并自动修复故障的智能代理。这次整合让Cursor的AI代理能力从代码生成延伸到部署后运维。行业CursorFiretiger智能体4 个信源在谈事件专题推荐理由:Cursor把Firetiger团队收了,他们要做能盯生产环境、出问题自己修的代理,和别家只写代码的不一样。原文稍后读已读值得跟进有用关注 Cursor
04:23Fireworks AI@FireworksAI_HQ精选Arcee AI 宣布开源 nac,这是一个用于长时间运行任务的 agent harness,现已以 Apache 2.0 协议发布在 GitHub 上。同时,Arcee 推出开放模型 API 的 beta 版本。Fireworks AI 参与合作,在 Arcee 平台上提供 Kimi-K3 模型供用户试用。nac 专为开发者处理复杂多步骤的工程工作负载而设计。AI产品Arcee AInacFireworks AI2 个信源在谈事件专题推荐理由:Arcee 开源了 agent 工具 nac,能跑长时间任务,还出了 API 测试版,Fireworks 上也就能用 Kimi-K3 了。原文稍后读已读值得跟进有用关注 Arcee AI
03:48宝玉@dotey精选推文认为软件自进化是伪命题,插件要么一次性、要么需要设计验证维护,OpenClaw的Skills已是反例。另一段长文分析DeepSeek Harness(DSH):官方提供Web和headless两种运行形式,核心是“一切皆插件”。DSH目前可让Agent检查自身runtime、现场写插件挂载,但动态插件仅存内存,重启即消失。作者判断DSH有自进化雏形,但插件生态仍处早期,质量参差。AI产品DeepSeek HarnessOpenClaw智能体10 个信源在谈事件专题推荐理由:DeepSeek的Harness框架让Agent能自己写插件扩展能力,比Claude Code更可DIY,虽然还很早期。原文稍后读已读值得跟进有用关注 DeepSeek Harness
03:46宝玉@dotey精选马天翼在社交平台发文称,DeepSeek作为模型厂商,做Agent Harness产品比做SDK更有价值,因为SDK难以获取用户行为数据。他认为Agent Harness产品应优先追求用户体验,其次才是插件可定制化。他类比称,Claude Code和Codex像苹果追求极致体验,而DeepSeek Harness可能走安卓式开源路线,由社区DIY、企业私有化魔改。插件生态是这套模式最核心的环节。行业DeepSeekAgent HarnessClaude Code推荐理由:有人拿DeepSeek和Claude Code对比,说前者该学安卓走开源路线,插件生态才是核心。原文稍后读已读值得跟进有用关注 DeepSeek
03:28官方账号Simon Willison@simonw精选Google DeepMind 发布 Gemini 3.7 Flash,官方称其在调试、问题解决等编码任务上较 3.6 Flash 有明显提升。该模型能用更少提示词设计更实用的网页布局和应用,并在真实业务工作流中提供更好的推理和准确性。API 已上线 Google AI Studio 和 Android Studio,Pro/Ultra 用户可在 Gemini App 中使用。不过 3.7 Flash 的“入门定价”计划于 2026 年 12 月 31 日翻倍,发布者认为五个月后该模型可能已过时。AI模型Gemini 3.7 FlashGoogle DeepMind3.6 Flash推荐理由:3.7 Flash 刚出,定价却预告明年翻倍,有点怪。想试试新模型的可以看看它比 3.6 强在哪。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:23官方账号xAI@xai精选76°Grok 4.6 已上线 Pi 平台。该版本面向长时间运行的智能体任务,编码、知识工作和视觉能力有所提升。定价为输入每百万 tokens 2 美元,输出每百万 tokens 6 美元。用户刷新模型目录即可选用。AI模型Grok 4.6PixAI推荐理由:Pi 上现在能直接用 Grok 4.6,跑长任务智能体更稳,编码和视觉也比之前强,价格也公布了。原文稍后读已读值得跟进有用关注 Grok 4.6
03:05Harrison Chase@hwchase17精选LangChain 联创 Harrison Chase 在 X 上表示,agent 在后台持续运行才是未来,规模化路径是让它们自行触发,而非等待人类逐条提示。团队为 Managed Deep Agents 加入了定时调度(schedule)能力,基于 cron 机制,开发者用几行代码即可让 agent 按设定日程自主启动。代码示例来自新版 MDA 文档。这一功能让 Managed Deep Agents 可从同步交互转为无人值守的定时自动化。AI产品Managed Deep AgentsLangChain智能体推荐理由:LangChain 的 Harrison Chase 说,以后 agent 要在后台自己跑,用 Managed Deep Agents 几行代码就能设置定时触发,不用人盯着了。原文稍后读已读值得跟进有用关注 Managed Deep Agents
03:02lmarena.ai@lmarena_ai精选Gemini 3.7 Flash (High) 在 Text Arena 中以1490分排名第9,较前代 Gemini 3.6 Flash (High) 的第16位明显提升。分项中创意写作从第12升至第3,数学从第7升至第4,指令跟随从第17升至第9,多轮对话从第21升至第10。其得分与 Qwen-3.8 (Max) 的1491分、Claude Opus 5 (Max) 的1493分几乎持平。AI模型Gemini 3.7 FlashText ArenaQwen-3.8推荐理由:Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:00Qdrant@qdrant_engine精选拜耳用 Qdrant Hybrid Cloud 搭建了面向 11.6 万名员工的企业搜索引擎,生产环境已运行三年。该引擎在 4 个节点上管理 3500 万向量数据点,支持混合搜索以服务深度智能体。团队引入语义缓存来控制智能体调用成本,并测出 20% 的效率提升。案例详细介绍了从原型到平台的落地路径。技巧BayerQdrant企业搜索推荐理由:拜耳这套企业搜索跑在 Qdrant 上,4 节点管 3500 万向量,语义缓存控成本,还提升了 20% 效率。原文稍后读已读值得跟进有用关注 Bayer
02:58Harrison Chase@hwchase17精选LangChain 在 docs.langchain.com 更新了 managed deepagents 的官方文档。新文档将每个 agent 组件都定义为独立文件。开发者通过点击即可查看组件在仓库中的位置和具体代码。这样配置生产环境中的 agent 结构变得更加直观。AI产品LangChainDeepAgents智能体推荐理由:搞生产级 agent 的可以看看,LangChain 把 managed deepagents 的文档重写了,每个组件一个文件,点开就能看到代码在哪,省事。原文稍后读已读值得跟进有用关注 LangChain
02:51elvis@omarsar0精选Harness-IF提出一种规则评估方法,通过从执行证据中逐条打分256条规则,并在九个探针构建中撤回每条规则后重跑任务,来区分规则是否真正改变了模型行为。在12个前沿模型上,原始准确率为72.1%到85.9%,剔除巧合后的Against-Prior准确率降至66.1%到78.6%,每个模型下降3.6到7.4个点。研究发现优先级不随提示词深度变化,系统提示、项目文件和用户指令的优先级都高于工具和技能描述。论文见arxiv.org/abs/2608.11727。论文AGENTS.mdHarness-IF智能体推荐理由:如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。原文稍后读已读值得跟进有用关注 AGENTS.md
02:47lmarena.ai@lmarena_ai精选Agent Arena完整排行榜详情已在官网公开,页面地址为arena.ai/leaderboard。官方通过X平台账号发布了链接,该推文目前已有1233次浏览,并附带1张数据图表。用户可前往页面查看各智能体的具体排名与表现。AI模型Agent Arena智能体评测基准推荐理由:想看AI智能体谁强谁弱?Agent Arena完整榜单出来了,去arena.ai/leaderboard就能看。原文稍后读已读值得跟进有用关注 Agent Arena
02:46lmarena.ai@lmarena_ai精选arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。AI模型Code ArenaText Arena帕累托前沿推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。原文稍后读已读值得跟进有用关注 Code Arena
02:34官方一手Hugging Face: Blog(博客/媒体)精选Hugging Face联合亚马逊推出Strands Agents,结合LeRobot与Hugging Face Storage Buckets,为机器人数据循环提供统一工作流。该方案支持从数据记录、模型训练到部署的全流程管理。用户可在同一环境中完成机器人操作数据的采集与存储。LeRobot负责训练行为克隆等策略。Strands Agents则用于部署和推理。技巧LeRobotStrands AgentsHugging Face1 个信源在谈事件专题推荐理由:想搞机器人数据闭环的可以看看,Hugging Face和亚马逊把记录、训练、部署全串在一起了,不用再东拼西凑工具。原文稍后读已读值得跟进有用关注 LeRobot
02:31Philipp Schmid@_philschmid精选3.7 Flash在智能体循环中不再过度急切,而是先进行更多探索。3.7 Flash会先解析错误并运行测试,再修改代码。3.7 Flash的首次通过准确率明显更高,浪费的智能体轮次也更少。AI模型3.7 Flash智能体编程推荐理由:3.7 Flash改代码前先摸清环境、跑测试,少走弯路,能省不少无效循环。原文稍后读已读值得跟进有用关注 3.7 Flash
02:20官方账号Perplexity@perplexity_ai精选Perplexity 发布了两批 Search SDK 更新,用于 Computer 环境。更新后,模型执行可靠性从 81.9% 提升到 92.6%。更高的可靠性让模型能更稳定地完成动作编排。该更新强调 SDK 的形态直接决定了模型的调用能力。AI产品PerplexitySearch SDK智能体推荐理由:Perplexity 把 Search SDK 的执行可靠性从 81.9% 拉到 92.6%,做智能体编排的更稳了。原文稍后读已读值得跟进有用关注 Perplexity
02:16Harrison Chase@hwchase17精选LangChain创始人Harrison Chase在红杉活动上提出智能体由框架、模型和上下文三部分组成。他认为若使用场景偏离模型训练分布,越应自建框架。他验证了LangSmith Engine的评估功能,并展示了如何通过追踪、数据飞轮优化性能。视频中还讨论了为何可观测性常被低估。行业LangChainLangSmith智能体推荐理由:红杉活动上,LangChain创始人聊了智能体三件套:框架、模型、上下文。他说越偏离模型训练数据,越该自己造框架。还演示了LangSmith Engine怎么做评估。原文稍后读已读值得跟进有用关注 LangChain
02:08Firecrawl@firecrawl_dev精选Firecrawl 的 Research Index 新增了 4100 万篇生命科学论文,覆盖药物发现、临床试验和生物学文献。该索引在检索前 10 个结果中召回率达到 90%,数据来自权威来源且完全免费。开发者现在可以通过 API 的 /search/research 接口让智能体直接搜索这些论文。AI产品FirecrawlResearch Index智能体推荐理由:Firecrawl把4100万篇论文开放给AI智能体搜索,召回率90%,还免费,做生物医药检索可以试试。原文稍后读已读值得跟进有用关注 Firecrawl
01:56Augment Code@augmentcode精选78°Google DeepMind的Gemini 3.7 Flash模型已上线Augment的Cosmos智能体编排平台。该平台用于构建软件工厂,开发者可以调用此模型进行代理任务。即日起两周内,输入价格降至每百万token 0.375美元,输出为每百万token 1.875美元。AI产品Gemini 3.7 FlashCosmosAugment推荐理由:Augment把Gemini 3.7 Flash放上Cosmos了,两周内价格砍半,做智能体开发的可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
01:48Google Gemini App@GeminiApp精选谷歌宣布 Gemini Spark 从今天起切换至 Gemini 3.7 Flash。该功能已面向 Google AI Pro 和 Ultra 订阅用户开放,覆盖 160 多个国家。Gemini 3.7 Flash 被称为谷歌最强的“工作马”模型,专攻编程和智能体场景。官方博客 goo.gle/4644tsM 提供了关于 Gemini 3.7 Flash 的更多说明。AI产品Gemini SparkGemini 3.7 FlashGoogle AI推荐理由:谷歌把 Gemini Spark 换上了 3.7 Flash,写代码和跑 agent 更强了,Pro/Ultra 订阅用户现在就能试。原文稍后读已读值得跟进有用关注 Gemini Spark
01:38官方账号Replit@Replit精选Replit Design 是 Replit 推出的新一代设计产品,旨在为 AI 时代重塑设计流程。该产品面向所有用户,相关介绍已发布在官方推文及 replit.com/design 页面。Replit 团队表示,当大家都在做同样的事情时,他们选择构建下一个方向。AI产品Replit DesignReplit设计工具推荐理由:Replit 发布 Replit Design,要在 AI 时代重做设计流程。别人做相同的,他们做不同的。官网已上线。原文稍后读已读值得跟进有用关注 Replit Design
01:35官方账号Cursor@cursor_ai精选Cursor发布新功能Builds,旨在优化云端Agent的启动性能。Faire、Headway和Descript等客户反馈,Agent启动时间从分钟级降至秒级。这些客户正越来越信任云端Agent自主执行端到端任务。具体机制可参考cursor.com/blog/builds。AI产品CursorBuilds智能体5 个信源在谈事件专题推荐理由:Cursor的Builds让Agent启动从分钟级变秒级,Faire等客户都在用,跑端到端更省心。原文稍后读已读值得跟进有用关注 Cursor
01:34官方账号Cursor@cursor_ai精选Cursor 的 Cloud agents 现已将启动速度提升 3 倍,能够接手从开始到结束的复杂长期任务。这一性能提升来自 build——Cursor 在后台持续预生成的即用开发环境,且不额外收费。用户无需等待环境配置,可直接分派更庞大的自动化任务。AI产品CursorCloud agentsbuild8 个信源在谈事件专题推荐理由:Cursor 把云 agent 启动提速到原来的 3 倍,靠后台自动准备好的 build 环境,不用多花钱就能跑长任务,挺实用。原文稍后读已读值得跟进有用关注 Cursor
01:32Fireworks AI@FireworksAI_HQ精选Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。论文J-LensKimi K3Qwen 3.5-9B9 个信源在谈事件专题推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。原文稍后读已读值得跟进有用关注 J-Lens
00:24官方一手AWS Machine Learning Blog@Anand Komandooru精选AWS 发布了一篇基于 Amazon Bedrock AgentCore 的 M&A 尽职调查参考架构教程。该架构利用 AgentCore 实现多智能体编排,并集成知识检索与治理控制。教程附带可在 AWS 账户中直接部署的完整示例代码。示例展示了如何通过 AgentCore 分配任务给不同智能体并汇总审查结果。技巧Amazon Bedrock AgentCoreAWS智能体推荐理由:这篇 AWS 教程把并购尽调拆给多个智能体,用 Bedrock AgentCore 就能搭,还有能直接跑的代码。原文稍后读已读值得跟进有用关注 Amazon Bedrock AgentCore
00:23官方一手AWS Machine Learning Blog@Salman Moghal精选AWS发布博客,介绍如何用Amazon Bedrock AgentCore Browser Tool和Strands Agents自动化需要人工交互的遗留Web应用。方案通过安全隔离的浏览器会话驱动旧界面,同时保留人工监督和完整审计日志。文章给出了参考架构,适合处理无法通过API集成的老旧系统。技巧AWSBedrockAgentCore1 个信源在谈事件专题推荐理由:AWS官方出教程了,教你用AgentCore浏览器工具让AI替你操作老系统,还带审计和人工监控,搞自动化的可以看看。原文稍后读已读值得跟进有用关注 AWS
00:21官方一手AWS Machine Learning Blog@Vipul Rajendra Gargav精选这条 AWS 官方博客演示了如何用 Amazon Bedrock AgentCore Observability 监控 AWS 之外的 AI 智能体。支持本地环境、GCP、Azure 和开发者电脑。通过 AWS Distro for OpenTelemetry (ADOT) 和 IAM 凭证接入后,会话追踪、跨度指标和 token 用量会进入同一个 AgentCore Observability 仪表盘。文章包含从下载 ADOT 到配置 IAM 权限的完整步骤。技巧AgentCore ObservabilityAmazon BedrockOpenTelemetry推荐理由:智能体跑在 AWS 外也能用 AgentCore 监控,ADOT 加 IAM 就能把 trace 和 token 用量接到同一仪表盘。原文稍后读已读值得跟进有用关注 AgentCore Observability
AITOP7月8日 10:58智谱AI GLM-Image:中文AI图像生成领域的破局者智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Midjourney等国外工具虽然在图像质量上表现优异,但对中文的支持却始终不尽如人意。GLM-Image的出现,似乎正在改变这一现状。GLM