15:42小互@imxiaohu精选DeepSeek Harness 的源码显示,它不再把 Prompt 当作一段 System Prompt,而是做成一个运行时(Runtime),通过 Identity、Persona、Tool Guidance、Runtime Context 等模块动态组装。每个能力(如 shell、filesystem、web)都自带 Tool + Schema + Prompt Guidance,由能力负责者告诉模型怎么用。Prompt 还分了 Global Prompt、Agent Scope、Agent-specific Override 三层,支持继承和覆盖。同时,Runtime Context 与稳定 Prompt 分离,cwd、git 状态等动态信息单独注入,避免频繁修改 System Prompt。作者认为 Tool Schema 本身就是 Prompt Engineering,模型最终看到的是 Instructions、Context、Capabilities 的统一组装。技巧DeepSeekHarnessPrompt工程推荐理由:做 Agent 的看看:DeepSeek Harness 把 Prompt 当程序,能力自带 Prompt 指导,分三层作用域,比巨大 system prompt 优雅。原文稍后读已读值得跟进有用关注 DeepSeek
14:32shao__meng@shao__meng精选GLM-5.3于本周正式发布,加入新一轮模型竞赛。同周内Grok 4.6和DeepSeek V4 Pro也已亮相。DeepSeek还推出了Harness工具,并上调了API价格。另外,Gemini 3.7 Flash也在本周被提及。AI模型GLM-5.3Grok 4.6DeepSeek V4 Pro10 个信源在谈事件专题推荐理由:GLM-5.3来了,这周还有Grok 4.6和DeepSeek V4 Pro,模型更新扎堆,看看哪个最强。原文稍后读已读值得跟进有用关注 GLM-5.3
13:11shao__meng@shao__meng精选76°DeepSeek Harness开源发布,开发者可自行安装体验。一位用户使用DeepSeek V4 Flash模型,消耗1390万Token、耗时30多分钟生成一个网站。生成结果不理想,该用户认为远不如Codex搭配GPT-5.6的组合。帖子当前获得729次浏览和4条回复。AI产品DeepSeek HarnessDeepSeek V4 FlashCodex10 个信源在谈事件专题推荐理由:DeepSeek Harness开源了,但有人试完说生成的网站不如Codex+GPT-5.6,你装之前先看看这个。原文稍后读已读值得跟进有用关注 DeepSeek Harness
12:25官方一手arXiv: DeepSeek@Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang精选ARIES-Mission2是一个零样本视觉-语言-动作(VLA)框架,将视觉语义感知与物理路线优化解耦。它用DeepSeek-V3解析自然语言任务,并用Molmo-7B进行零样本目标定位,再通过地理插值将像素坐标转为GPS航点。在UAV-VLPA-nano-30基准上,该框架的飞行距离为62.43公里,比未优化的VLA基线(79.66公里)缩短21.6%,比人工规划(69.00公里)缩短9.5%。30个任务总耗时575.40秒,平均每任务19.18秒,约为人类专家规划速度的3.6倍。其中TSP求解器每任务仅需0.16秒,而VLM推理占据主要耗时。AI模型ARIES-Mission2DeepSeek-V3Molmo-7B推荐理由:这个框架让无人机看卫星图就能自动规划路线,比人工规划快3.6倍,飞行距离还缩短近10%,适合大规模任务。原文稍后读已读值得跟进有用关注 ARIES-Mission2
12:18Fireworks AI@FireworksAI_HQ精选DeepSeek-V4-Pro-0813已在Fireworks上线,提供Day-0使用。该模型面向智能体与工具增强工作流,在Terminal Bench 2.1、Cybergym和DeepSWE基准上超越Opus 4.8,成本效率最高达6倍。它在Vals Index的Coding和Legal基准上与领先前沿模型持平。Fireworks建议Pro-0813用于重推理与编码,Flash-0731用于预算较低的任务。AI模型DeepSeek-V4-Pro-0813Fireworks智能体推荐理由:DeepSeek-V4-Pro刚在Fireworks上线,跑智能体和编码任务比Opus 4.8强,成本效率还高6倍,可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
11:58官方账号arXiv cs.AI@Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi精选AaLLM 是一个开源的端到端多智能体 LLM 工作流,输入规格即可输出网表,同时覆盖拓扑生成和电路尺寸确定。它从论文和教科书中自动构建知识库,并采用 RAG 模型模拟电路设计专家知识。AaLLM 使用设计师、评论家和评估器组成的三智能体反馈系统,减少尺寸迭代次数。生成的创新拓扑在品质因数上与已知拓扑相当,部分电路高出 3 倍。与最先进的多智能体 LLM 管线相比,SPICE 调用次数减少 3-4.5 倍,墙钟时间减少 40 倍。论文AaLLM模拟电路设计RAG推荐理由:想用 LLM 做模拟电路设计的话,AaLLM 是开源端到端方案,给规格直接出网表,SPICE 调用和耗时都比现有方法少一个数量级。原文稍后读已读值得跟进有用关注 AaLLM
11:51宝玉@dotey精选用户将一段提示词写入 ~/.claude/CLAUDE.md,让 Fable 5 主代理自动多开 Opus 子代理执行实现类工作。Fable 5 只负责需求澄清、方案拆解、任务分发和结果验收。这样默认使用 Fable 5 High 时,Token 消耗不算厉害。作者不用 Opus 5,因为速度太慢且 Token 消耗巨大。技巧ClaudeFable 5Opus6 个信源在谈事件专题推荐理由:在 CLAUDE.md 里加一段话,让 Fable 5 指挥 Opus 干活,省 Token 又不慢。可以试试。原文稍后读已读值得跟进有用关注 Claude
11:43Aravind Srinivas@AravSrinivas精选Perplexity宣布将Sonar迁移至Agent API。该API在保持联网搜索的基础上,新增多步研究、代码执行、内建工具,并可通过单一接口访问多种模型。在BrowseComp和WideSearch基准上,Agent API的得分超过Sonar最佳成绩的两倍。AI产品PerplexityAgent APISonar推荐理由:做联网搜索Agent?Perplexity Agent API支持多步研究、代码执行,基准分翻倍,值得一试。原文稍后读已读值得跟进有用关注 Perplexity
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song精选Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。论文VeroLean 4形式化验证推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。原文稍后读已读值得跟进有用关注 Vero
11:15官方一手marktechpost@Sana Hassan精选本教程演示了从Hugging Face流式获取SupraLabs推理语料库,并完成质量过滤与数据策展。以SmolLM2-135M-Instruct为基座、LoRA为微调方法,进行监督微调(SFT)并跑通端到端流程。该方案在135M参数规模下验证,无需过多GPU资源即可打造专用推理模型。技巧SupraLabsSmolLM2LoRA推荐理由:教程用SupraLabs语料库+SmolLM2+LoRA,教你在小显卡上微调出推理模型,比追大模型省资源。原文稍后读已读值得跟进有用关注 SupraLabs
10:46阮一峰的网络日志(博客/媒体)精选DeepSeek V4 Flash 的缓存命中输入价格仅 2 分钱,是未命中价格 1 元的五十分之一。各家缓存有效期不同:Anthropic 5 分钟、DeepSeek 10 分钟、OpenAI 10-30 分钟、Google 1 小时。对话间隔超过缓存期限,模型就要重新计算并重新收费。AI Agent 可以通过定时发送请求保持缓存有效,推荐间隔为 4 分钟而不是常见的 30 秒。技巧DeepSeekAnthropicOpenAI10 个信源在谈事件专题推荐理由:阮一峰讲清了AI缓存的门道,DeepSeek命中价格比未命中便宜50倍,还教你卡着4分钟省Token费。原文稍后读已读值得跟进有用关注 DeepSeek
08:59SuperTechFans(博客/媒体)精选Zed 发布全新多人协作编码环境 Delta,基于 DeltaDB 构建,可实时同步对话与代码工作树。评论能锚定在任意代码行并随代码演变更新,智能体可直接参与对话线程解释或修复问题。Delta 支持云端运行,关闭笔记本后智能体仍继续工作,通过链接分享线程可在浏览器打开。该应用以对话而非编辑器为中心,目前私人测试已开始邀请用户。AI产品ZedDelta智能体推荐理由:Zed 发布 Delta,专为 AI 智能体协作设计,评论跟代码走,可云端运行,适合智能体开发。私人测试开放。原文稍后读已读值得跟进有用关注 Zed
06:44OpenRouter@OpenRouterAI精选OpenRouter 新增代码检索模型 Voyage Code 4,由 VoyageAI 与 MongoDB 联合推出。该模型支持 Matryoshka 嵌入,可在 256、512、1024、2048 四种维度间灵活切换。同时提供多种量化选项,帮助开发者降低存储与计算成本。开发者可直接在 OpenRouter 平台上调用该模型。AI模型OpenRouterVoyage Code 4VoyageAI推荐理由:写代码的智能体要检索代码库?OpenRouter 上新了 Voyage Code 4,四档嵌入维度可调,还有量化选项,省资源又灵活。原文稍后读已读值得跟进有用关注 OpenRouter
05:42Hailuo AI@Hailuo_AI精选76°MiniMax 正式发布新一代开源权重音乐模型 MiniMax-Music3。该模型定位生产级(production-ready),可用于多种音乐生成场景。官方称其为 SOTA 级开源音乐模型。权重开放,开发者可自行部署和微调。AI模型MiniMaxMusic3开源模型推荐理由:MiniMax 把音乐模型开源了,叫 Music3,号称开源里最强,能直接生成各种风格的音乐,适合想做 AI 音乐应用的人。原文稍后读已读值得跟进有用关注 MiniMax
05:11官方账号Cursor@cursor_ai精选72°Cursor宣布Firetiger团队正式加入。双方将共同开发能跟随代码进入生产环境并自动修复故障的智能代理。这次整合让Cursor的AI代理能力从代码生成延伸到部署后运维。行业CursorFiretiger智能体4 个信源在谈事件专题推荐理由:Cursor把Firetiger团队收了,他们要做能盯生产环境、出问题自己修的代理,和别家只写代码的不一样。原文稍后读已读值得跟进有用关注 Cursor
04:23Fireworks AI@FireworksAI_HQ精选Arcee AI 宣布开源 nac,这是一个用于长时间运行任务的 agent harness,现已以 Apache 2.0 协议发布在 GitHub 上。同时,Arcee 推出开放模型 API 的 beta 版本。Fireworks AI 参与合作,在 Arcee 平台上提供 Kimi-K3 模型供用户试用。nac 专为开发者处理复杂多步骤的工程工作负载而设计。AI产品Arcee AInacFireworks AI2 个信源在谈事件专题推荐理由:Arcee 开源了 agent 工具 nac,能跑长时间任务,还出了 API 测试版,Fireworks 上也就能用 Kimi-K3 了。原文稍后读已读值得跟进有用关注 Arcee AI
03:48宝玉@dotey精选推文认为软件自进化是伪命题,插件要么一次性、要么需要设计验证维护,OpenClaw的Skills已是反例。另一段长文分析DeepSeek Harness(DSH):官方提供Web和headless两种运行形式,核心是“一切皆插件”。DSH目前可让Agent检查自身runtime、现场写插件挂载,但动态插件仅存内存,重启即消失。作者判断DSH有自进化雏形,但插件生态仍处早期,质量参差。AI产品DeepSeek HarnessOpenClaw智能体10 个信源在谈事件专题推荐理由:DeepSeek的Harness框架让Agent能自己写插件扩展能力,比Claude Code更可DIY,虽然还很早期。原文稍后读已读值得跟进有用关注 DeepSeek Harness
03:46宝玉@dotey精选马天翼在社交平台发文称,DeepSeek作为模型厂商,做Agent Harness产品比做SDK更有价值,因为SDK难以获取用户行为数据。他认为Agent Harness产品应优先追求用户体验,其次才是插件可定制化。他类比称,Claude Code和Codex像苹果追求极致体验,而DeepSeek Harness可能走安卓式开源路线,由社区DIY、企业私有化魔改。插件生态是这套模式最核心的环节。行业DeepSeekAgent HarnessClaude Code推荐理由:有人拿DeepSeek和Claude Code对比,说前者该学安卓走开源路线,插件生态才是核心。原文稍后读已读值得跟进有用关注 DeepSeek
03:28官方账号Simon Willison@simonw精选Google DeepMind 发布 Gemini 3.7 Flash,官方称其在调试、问题解决等编码任务上较 3.6 Flash 有明显提升。该模型能用更少提示词设计更实用的网页布局和应用,并在真实业务工作流中提供更好的推理和准确性。API 已上线 Google AI Studio 和 Android Studio,Pro/Ultra 用户可在 Gemini App 中使用。不过 3.7 Flash 的“入门定价”计划于 2026 年 12 月 31 日翻倍,发布者认为五个月后该模型可能已过时。AI模型Gemini 3.7 FlashGoogle DeepMind3.6 Flash推荐理由:3.7 Flash 刚出,定价却预告明年翻倍,有点怪。想试试新模型的可以看看它比 3.6 强在哪。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:23官方账号xAI@xai精选76°Grok 4.6 已上线 Pi 平台。该版本面向长时间运行的智能体任务,编码、知识工作和视觉能力有所提升。定价为输入每百万 tokens 2 美元,输出每百万 tokens 6 美元。用户刷新模型目录即可选用。AI模型Grok 4.6PixAI推荐理由:Pi 上现在能直接用 Grok 4.6,跑长任务智能体更稳,编码和视觉也比之前强,价格也公布了。原文稍后读已读值得跟进有用关注 Grok 4.6
03:05Harrison Chase@hwchase17精选LangChain 联创 Harrison Chase 在 X 上表示,agent 在后台持续运行才是未来,规模化路径是让它们自行触发,而非等待人类逐条提示。团队为 Managed Deep Agents 加入了定时调度(schedule)能力,基于 cron 机制,开发者用几行代码即可让 agent 按设定日程自主启动。代码示例来自新版 MDA 文档。这一功能让 Managed Deep Agents 可从同步交互转为无人值守的定时自动化。AI产品Managed Deep AgentsLangChain智能体推荐理由:LangChain 的 Harrison Chase 说,以后 agent 要在后台自己跑,用 Managed Deep Agents 几行代码就能设置定时触发,不用人盯着了。原文稍后读已读值得跟进有用关注 Managed Deep Agents
03:02lmarena.ai@lmarena_ai精选Gemini 3.7 Flash (High) 在 Text Arena 中以1490分排名第9,较前代 Gemini 3.6 Flash (High) 的第16位明显提升。分项中创意写作从第12升至第3,数学从第7升至第4,指令跟随从第17升至第9,多轮对话从第21升至第10。其得分与 Qwen-3.8 (Max) 的1491分、Claude Opus 5 (Max) 的1493分几乎持平。AI模型Gemini 3.7 FlashText ArenaQwen-3.8推荐理由:Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:00Qdrant@qdrant_engine精选拜耳用 Qdrant Hybrid Cloud 搭建了面向 11.6 万名员工的企业搜索引擎,生产环境已运行三年。该引擎在 4 个节点上管理 3500 万向量数据点,支持混合搜索以服务深度智能体。团队引入语义缓存来控制智能体调用成本,并测出 20% 的效率提升。案例详细介绍了从原型到平台的落地路径。技巧BayerQdrant企业搜索推荐理由:拜耳这套企业搜索跑在 Qdrant 上,4 节点管 3500 万向量,语义缓存控成本,还提升了 20% 效率。原文稍后读已读值得跟进有用关注 Bayer
02:58Harrison Chase@hwchase17精选LangChain 在 docs.langchain.com 更新了 managed deepagents 的官方文档。新文档将每个 agent 组件都定义为独立文件。开发者通过点击即可查看组件在仓库中的位置和具体代码。这样配置生产环境中的 agent 结构变得更加直观。AI产品LangChainDeepAgents智能体推荐理由:搞生产级 agent 的可以看看,LangChain 把 managed deepagents 的文档重写了,每个组件一个文件,点开就能看到代码在哪,省事。原文稍后读已读值得跟进有用关注 LangChain
02:51elvis@omarsar0精选Harness-IF提出一种规则评估方法,通过从执行证据中逐条打分256条规则,并在九个探针构建中撤回每条规则后重跑任务,来区分规则是否真正改变了模型行为。在12个前沿模型上,原始准确率为72.1%到85.9%,剔除巧合后的Against-Prior准确率降至66.1%到78.6%,每个模型下降3.6到7.4个点。研究发现优先级不随提示词深度变化,系统提示、项目文件和用户指令的优先级都高于工具和技能描述。论文见arxiv.org/abs/2608.11727。论文AGENTS.mdHarness-IF智能体推荐理由:如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。原文稍后读已读值得跟进有用关注 AGENTS.md
02:47lmarena.ai@lmarena_ai精选Agent Arena完整排行榜详情已在官网公开,页面地址为arena.ai/leaderboard。官方通过X平台账号发布了链接,该推文目前已有1233次浏览,并附带1张数据图表。用户可前往页面查看各智能体的具体排名与表现。AI模型Agent Arena智能体评测基准推荐理由:想看AI智能体谁强谁弱?Agent Arena完整榜单出来了,去arena.ai/leaderboard就能看。原文稍后读已读值得跟进有用关注 Agent Arena
02:46lmarena.ai@lmarena_ai精选arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。AI模型Code ArenaText Arena帕累托前沿推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。原文稍后读已读值得跟进有用关注 Code Arena
02:34官方一手Hugging Face: Blog(博客/媒体)精选Hugging Face联合亚马逊推出Strands Agents,结合LeRobot与Hugging Face Storage Buckets,为机器人数据循环提供统一工作流。该方案支持从数据记录、模型训练到部署的全流程管理。用户可在同一环境中完成机器人操作数据的采集与存储。LeRobot负责训练行为克隆等策略。Strands Agents则用于部署和推理。技巧LeRobotStrands AgentsHugging Face1 个信源在谈事件专题推荐理由:想搞机器人数据闭环的可以看看,Hugging Face和亚马逊把记录、训练、部署全串在一起了,不用再东拼西凑工具。原文稍后读已读值得跟进有用关注 LeRobot
02:31Philipp Schmid@_philschmid精选3.7 Flash在智能体循环中不再过度急切,而是先进行更多探索。3.7 Flash会先解析错误并运行测试,再修改代码。3.7 Flash的首次通过准确率明显更高,浪费的智能体轮次也更少。AI模型3.7 Flash智能体编程推荐理由:3.7 Flash改代码前先摸清环境、跑测试,少走弯路,能省不少无效循环。原文稍后读已读值得跟进有用关注 3.7 Flash
02:20官方账号Perplexity@perplexity_ai精选Perplexity 发布了两批 Search SDK 更新,用于 Computer 环境。更新后,模型执行可靠性从 81.9% 提升到 92.6%。更高的可靠性让模型能更稳定地完成动作编排。该更新强调 SDK 的形态直接决定了模型的调用能力。AI产品PerplexitySearch SDK智能体推荐理由:Perplexity 把 Search SDK 的执行可靠性从 81.9% 拉到 92.6%,做智能体编排的更稳了。原文稍后读已读值得跟进有用关注 Perplexity
AITOP7月8日 10:58智谱AI GLM-Image:中文AI图像生成领域的破局者智谱AI最近发布的GLM-Image确实在AI图像生成领域投下了一枚重磅炸弹。免费、无水印、中文文本渲染能力强,这三个特点组合在一起,足以让整个行业重新审视中国AI技术的实际进展。 国内AI图像生成工具一直面临着中文文本渲染的难题。Midjourney等国外工具虽然在图像质量上表现优异,但对中文的支持却始终不尽如人意。GLM-Image的出现,似乎正在改变这一现状。GLM