18:04Poe@poe_platformGrok 4.6 已在 Poe 平台正式上线。该模型拥有 500K token 的上下文窗口。它专为长时间运行的智能体、编程和知识工作设计。用户可通过 poe.com/Grok-4.6 直接试用。AI模型Grok 4.6Poe智能体推荐理由:Grok 4.6 上架 Poe 了,上下文窗口有 500K,跑长任务智能体和写代码都合适,想试直接去 Poe 点开就能用。原文稍后读已读值得跟进有用关注 Grok 4.6
18:02Genspark@genspark_ai71°Grok 4.6已在Genspark平台上线,用户可在AI Chat、Code Agent和Genspark Claw中直接选用。该模型由xAI推出,专为长时间运行的智能体和编码任务设计。相比Grok 4.5,Grok 4.6在保持相同定价的同时实现了显著性能提升,属于前沿智能水平。用户只需在模型选择器中切换即可使用。AI模型Grok 4.6GensparkxAI1 个信源在谈事件专题推荐理由:Genspark上线了xAI的新模型Grok 4.6,专为长任务智能体和写代码优化,价格不变但比4.5强不少,做Agent开发可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
18:01官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 提出以持久递归世界组织软件开发,用 DeepSeek V4 Flash 在 120 小时内构建了约 25 万行 Rust 版 C 编译器,花费仅 44 美元。该编译器通过完整 c-testsuite 及大部分 LLVM 和 Csmith 测试。在 GLM 5.2 生成的另一编译器世界中,即使反复替换开发代理,测试性能仍保持不变。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为近 9 万行 Rust,六个数值工作负载中位数加速达 1.55 至 6.87 倍。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:EvoX Genesis 用持久项目代替持久智能体,DeepSeek V4 Flash 花 44 美元写了能过测试的 C 编译器,MESA 提速 6.87 倍。原文稍后读已读值得跟进有用关注 EvoX Genesis
18:01官方账号arXiv cs.AI@Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon一项研究提出用于遗留HPC代码现代化的智能体工作流,并在GAMESS量子化学包上完成验证。该工作流使用三个提示词专精的智能体角色,以Claude Code在隔离工作树中运行,跨越四代Claude模型。案例将GAMESS两个电子积分核心从Fortran 77转换为Fortran 2008,涉及12个源文件、56,448行代码和225个子程序。合并标准采用位级能量复现,第十二位小数的偏差即视为失败。全部源文件通过51项测试,612次测试运行中化学相关差异为零,且通过Jenkins持续集成测试。论文GAMESSClaude CodeFortran推荐理由:这篇论文用Claude Code搭了个智能体流水线,把GAMESS的老Fortran代码转换了还零误差通过,适合搞科学计算现代化的人看。原文稍后读已读值得跟进有用关注 GAMESS
18:00shao__meng@shao__meng81°Grok 4.6 已通过 Grok Build、Cursor、Grok Bot 和 API 开放。官方对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max,Artificial Analysis 综合指数 61,与 GPT-5.6 Sol Max 持平,距 Fable 5 Max 的 62 差 1 分。长程 Agent 任务提升明显:DeepSWE 从 54% 升至 65.9%,APEX-Agents 从 47.1% 升至 57.5%,Terminal-Bench 从 15.7% 升至 26%。上下文窗口 50 万 token,支持文本与图像输入、文本输出,函数调用和结构化输出。相对 4.5 的 10 项评测全升,但 APEX-SWE 仅增加 2.8 个百分点,编码能力提升不均。AI模型Grok 4.6GrokCursor10 个信源在谈事件专题推荐理由:Grok 4.6 上线,长程 Agent 强化,指数追平 GPT-5.6 Sol Max,试试?原文稍后读已读值得跟进有用关注 Grok 4.6
17:59Browser Use@browser_use一位用户在社交平台分享,他用 Browser Use 的智能体代理购物,自动搜索沙发优惠券并逐一尝试,最终找到一张省下150美元的折扣码。该示例展示了 AI 代理在电商场景中执行多步骤任务的实际价值。Browser Use 是一个可通过自然语言驱动浏览器操作的开源工具,目前该推文获得547次浏览。技巧Browser Use智能体购物推荐理由:你也能用 Browser Use 帮你找优惠券,动动嘴它就自己试完所有折扣码,直接省150刀。原文稍后读已读值得跟进有用关注 Browser Use
17:59IT之家(博客/媒体)支付宝于8月13日宣布,AI版“阿宝”正式向华为鸿蒙用户开放测试。用户需在华为应用市场升级到支付宝12.12.16版本,搜索“阿宝”或“蚂蚁阿宝”即可开启。开启后可通过对话让阿宝办事,例如说“我想查一下公积金”,阿宝会自动匹配对应小程序和服务入口。原本需要多步跳转的流程被折叠成一句话。AI产品支付宝阿宝华为鸿蒙推荐理由:支付宝出了个能聊天的阿宝,鸿蒙用户现在就能试,说句话就能办事,不用自己找入口了。原文稍后读已读值得跟进有用关注 支付宝
17:58IT之家(博客/媒体)小米发布澎湃 OS 4,带来基于 Xiaomi MiMo 模型的超级小爱 2.0,推出“专家模式”并采用积分订阅方案。用户每月可免费获得 1,000 积分,专家模式对话每次约消耗 12-20 积分,约等于 50-80 次。付费订阅入门档连续包月 19 元含 4,000 积分,最高档 99 元含 34,000 积分。快速模式不消耗积分,仍支持日常问答与家居控制。AI产品超级小爱小米Xiaomi MiMo推荐理由:小米超级小爱 2.0 专家模式开始按积分收费,每月送 1000 积分,轻度用免费,重度可花 19 元买 4000 积分,还支持生成 PPT。原文稍后读已读值得跟进有用关注 超级小爱
17:57IT之家(博客/媒体)千问开放平台上线菜鸟智能体,用户可在对话框中@菜鸟或点击右上角圆点图标唤起。该智能体能依据物品类型、价格要求、上门时间等推荐寄件方案和快递公司。例如输入“寄一箱很重的书”可获取哪家快递更便宜的建议,输入“寄一张床垫到武汉”会识别为大件寄件并推荐德邦。在获得授权后,智能体还能结合通讯录关键词和历史寄件记录自动补全收寄件信息。AI产品千问菜鸟智能体智能体推荐理由:千问里现在可以@菜鸟寄快递了,能比价、能管大件,还会记住你的历史地址,省得自己对比。原文稍后读已读值得跟进有用关注 千问
17:57IT之家(博客/媒体)马斯克在SpaceX全员会议表示,将用SpaceX内部数据训练Grok AI,员工数据也被纳入。SpaceX以600亿美元收购AI编程初创公司Cursor,并推出能自主执行任务的Grok Bot。马斯克希望Grok继承员工价值观,以避免超级智能AI与人类目标不一致的风险。SpaceX尚未披露哪些员工数据将用于训练Grok。行业SpaceXGrok AICursor10 个信源在谈事件专题推荐理由:马斯克把SpaceX员工数据喂给Grok,称员工是'AI父母';还收购了Cursor,推出了能自己操作电脑的Grok Bot。原文稍后读已读值得跟进有用关注 SpaceX
17:57shao__meng@shao__mengDeepSeek 静默发布新模型 V4-Pro-0813,官方 X 账号未官宣。Cline 团队实测其在 Terminal-Bench 2.1 上得分 87.9,仅比 Claude Fable 5 低 0.1 分。该模型价格约为 Fable 5 的 1/57,参数规模 1.6T,激活参数 49B,上下文窗口 1M。模型已上线 ClinePass,Cline 称其为当前市场性价比最高的模型。AI模型DeepSeek-V4-Pro-0813Claude Fable 5Terminal-Bench1 个信源在谈事件专题推荐理由:DeepSeek 新模型跑分只比 Claude Fable 5 低 0.1,价格却便宜 57 倍,Cline 用户现在就能用,高性价比首选。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
17:57IT之家(博客/媒体)82°在2026年Internapalooza活动上,OpenAI CEO Sam Altman称未来6个月内OpenAI后续模型将具备“完美理解用户使用情境”能力。该能力可让AI读取用户屏幕、录制会议和通话,并理解用户看到的一切。用户可限定AI访问短信、电子邮件、文档或Slack等范围,且AI不会替用户直接决策。Altman举例称可帮初创公司CEO撰写销售话术、准备战略文件,并表示距离这种能力变得极其有用可能只差1代模型。行业OpenAISam AltmanChatGPT10 个信源在谈事件专题推荐理由:奥尔特曼说6个月内AI就能盯着你的屏幕、记住每场会议,还能帮你回邮件写方案。想看看AI怎么进化到这个程度?原文稍后读已读值得跟进有用关注 OpenAI
17:56IT之家(博客/媒体)韩国 Upstage 发布商用大模型 Solar Pro 4,上下文窗口 512K,输出长度 128K token。定价方面,输入每百万 tokens 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。该模型在 Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。在 Agent Arena 榜单排名第 44,与 MiniMax M2.7 同级,也是首个登上该榜单的韩国实验室模型。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 发了主打智能体任务的 Solar Pro 4,定价不高,Agent Arena 排名和 MiniMax M2.7 同级,适合处理长文档和多轮工具调用。原文稍后读已读值得跟进有用关注 Solar Pro 4
17:55a16z@a16zYC总裁Garry Tan在a16z播客中提出“tokenmax”概念,主张创始人应在单次请求中加载80万至100万token。他将可复用的任务流程封装为Markdown文件加代码和测试,再放入cron定时任务。Tan认为这样的Markdown文件相当于一名永不失误、可无限次执行的员工。他强调小团队借助AI能实现过去400人团队的效果。行业Garry TanYCa16z1 个信源在谈事件专题推荐理由:YC老板说把工作流程写成Markdown文件再挂个定时任务,AI就能当员工天天干活,一次干对。想用AI放大个人效率的可以听。原文稍后读已读值得跟进有用关注 Garry Tan
17:55官方账号NVIDIA AI@NVIDIAAIUniphore实测NVIDIA Nemotron 3.5 Lightning在企业级智能体工作负载中的表现。与参数规模相近的Gemma 4 31B IT相比,Nemotron 3.5 Lightning吞吐量提升5倍,准确率也有明显增长。Uniphore已将其纳入Business AI Cloud高流量路径的评估范围。AI模型Nemotron 3.5 LightningNVIDIAGemma 410 个信源在谈事件专题推荐理由:NVIDIA新模型在企业任务上直接碾压Gemma 4,吞吐量翻5倍,跑真实负载的数据很硬核。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:55爱范儿@彭海星DeepSeek V4 Pro正式版发布,实测性能直逼Fable 5。DeepSeek V4 Pro在AI Agent方向上发力,还藏了一个大招。爱范儿实测显示,DeepSeek V4 Pro在智能体任务中表现抢眼。AI模型DeepSeek V4 ProDeepSeekFable 510 个信源在谈事件专题推荐理由:DeepSeek V4 Pro正式版来了,实测跟Fable 5有得一拼,还藏了个大招,想玩智能体的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
17:54Guillermo Rauch@rauchgDigg 重启两个月后,平台运行着 100 多个任务、智能体和评估器。新版 Digg 实现了自动化内容聚类、情感分析、图像生成和新闻通讯等功能。其流量月环比增长超过 20%,基础设施由 Vercel 提供。Grok 模型在提供事实依据方面表现出色。AI产品DiggVercelGrok推荐理由:老牌 Digg 复活了,这次用 AI 智能体驱动,流量涨了 20%,还接了 Grok 模型,你可以去体验下新版。原文稍后读已读值得跟进有用关注 Digg
17:54AI Will@FinanceYF575°Grok 4.6正式发布,延续4.5的定价策略。新版本在Agent能力和编程任务上有所提升,并能更长时间处理复杂任务。在AA Intelligence Index基准上,Grok 4.6得分追平GPT-5.6 Sol。API价格为每百万输入Token 2美元,输出Token 6美元。AI模型GrokGPT-5.6 Sol智能体推荐理由:Grok 4.6发布,价格不变,Agent和编程更强,AA Intelligence Index追平GPT-5.6 Sol,API输入2美元/百万Token。原文稍后读已读值得跟进有用关注 Grok
17:53官方账号Decoder@Matthias BastianxAI 发布 Grok 4.6,在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 持平,仅次于 Claude Opus 5。在智能体任务中,Grok 4.6 完成复杂工作流平均约 53 步,而 Claude Opus 5 需要约 103 步。Grok 4.6 的 API 价格比 OpenAI 最强模型低 60% 以上。AI模型Grok 4.6GPT-5.6Claude Opus 510 个信源在谈事件专题推荐理由:xAI 的 Grok 4.6 跑分追平 GPT-5.6,智能体任务比 Claude 更省步数,价格还便宜一大截,想换 API 的可以看看。原文稍后读已读值得跟进有用关注 Grok 4.6
17:52AI Engineer@aiDotEngineer精选在记忆与持续学习专场,演讲者举例称 ChatGPT 认为 Shlok Khemani 在 2025 年去过土耳其,但他从未去,模型只是读过他犹豫要不要去的对话,无法识别记录冲突。在首个真实持续学习基准上,普通上下文学习击败了专用记忆系统。将策略自蒸馏扩展到 100 次工具调用后,教师模型的频繁纠正会让模型退化成一个劲说“maybe”。另一个实验里,教师不改动工具调用 token,只重塑调用前的推理,就把智能体任务完成率从 22% 提到 60%。演讲者还提醒,智能体不擅长发现异常,最好直接让它调查你已经发现的异常。论文ChatGPT持续学习上下文学习推荐理由:记忆专场金句:ChatGPT 记错旅行,上下文学习赢过专用记忆,改推理就让任务完成率从22%提到60%。原文稍后读已读值得跟进有用关注 ChatGPT
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor精选研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。论文VAKRAIBM智能体推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。原文稍后读已读值得跟进有用关注 VAKRA
17:49官方账号arXiv cs.AI@Aaron Chatterji, David Holtz, Neel Rakholia, Prasanna Tambe, Gawesha Weeratunga一项研究通过链接ChatGPT Enterprise账户记录与员工角色、任务分类及上市公司财务数据,分析了截至2026年3月的企业AI采用情况。样本涵盖6个月采用期内的1500多家组织和超过1700万条消息。研究发现,ChatGPT Enterprise使用量快速增长,既有新企业加入,也有现有用户提高使用强度。美国上市公司的采用集中在规模更大、市值更高、研发和销售管理费用更密集的企业。使用强度在早期职业员工中尤其高,任务覆盖写作、技术工作、沟通和信息综合。论文ChatGPT EnterpriseOpenAI企业AI10 个信源在谈事件专题推荐理由:这篇论文用真实数据告诉你哪些公司在用ChatGPT、谁在用、用来干嘛,比拍脑袋靠谱多了。原文稍后读已读值得跟进有用关注 ChatGPT Enterprise
17:48IT之家(博客/媒体)小米澎湃OS官方公布,澎湃OS 4 Beta版将于8月14日下午起陆续推送。本次升级引入柔光玻璃材质和新桌面系统,支持小部件堆叠与文件夹自由调节。系统内核新增负载精算、内存预载两项技术,提升流畅度。超级小爱2.0带来上岛和灵感球交互,并支持Mac及三方PC。同时推出AI语音笔记和超级小爱输入法,以及端云隐私计算系统。AI产品澎湃OS小米超级小爱2.0推荐理由:小米澎湃OS 4 Beta明天就推送了,超级小爱2.0支持Mac和PC,还有柔光玻璃新界面,想尝鲜可以关注。原文稍后读已读值得跟进有用关注 澎湃OS
17:47IT之家(博客/媒体)微软于8月12日推出Visual Studio Code 1.133更新。新增实验性设置chat.agentHost.allowSignedOutWhenUsable,用户无需登录GitHub即可打开Agent窗口。免登录行为目前仅支持Claude,Copilot和Codex将在后续版本加入。会话期间用户可在Anthropic与Copilot两组模型之间切换提供商。更新还加入提示词固定滚动,集成浏览器会自动刷新HTML文件。AI产品VS CodeClaudeCopilot10 个信源在谈事件专题推荐理由:VS Code 1.133来了,Agent窗口不用登录GitHub就能用Claude,聊天时还能随时换模型商,写代码的可以试试。原文稍后读已读值得跟进有用关注 VS Code
17:47官方一手marktechpost@Michal SutterSpaceXAI于8月12日发布Grok 4.6,这是基于Grok 4.5的后训练升级而非更大基础模型。Grok 4.6在Artificial Analysis Intelligence Index上以61分追平GPT-5.6 Sol Max,支持500K上下文并新增xhigh推理等级。定价保持每百万token输入2美元、输出6美元。不过在编码基准上仍然落后于竞品。AI模型Grok 4.6SpaceXAIGPT-5.6 Sol Max推荐理由:Grok 4.6来了,500K上下文还加了xhigh推理,跑长任务更稳。编码还是短板,但智能体场景可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
17:46IT之家(博客/媒体)DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。AI模型DeepSeekDeepSeek V4 Pro智能体10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
17:45官方账号LangChain@LangChainAI精选LangChain的Viv在AI Engineer World Fair上分享持续改进智能体的方法论。他认为智能体会遵循Evals中编码的行为,因此高质量Evals来自大规模挖掘生产数据。他还提出了用开源模型搭配Harness与PostTrain的“三明治”配方来定制智能体系统。演讲强调不存在通用模型或通用Harness,针对具体任务优化模型与框架组合效果更好。技巧LangChain智能体数据挖掘推荐理由:LangChain的Viv分享了一套改进智能体的实战思路,核心是用生产数据挖Evals,还给了Harness-PostTrain的开源模型配方。原文稍后读已读值得跟进有用关注 LangChain
17:45官方账号NVIDIA AI@NVIDIAAIApplied Compute 平台现已支持 NVIDIA 的 Nemotron 3.5 Lightning 进行训练和推理。该模型在 agentic coding benchmark 中,当并发和总 token 吞吐量扩展 16 倍时,解码吞吐量、首 token 时间和用户中位延迟保持不变。其 LatentMoE 和 Mamba 架构能以最小开销扩展稀疏性、上下文长度和批大小,显著提升后训练迭代吞吐量。AI产品Nemotron 3.5 LightningNVIDIAApplied Compute10 个信源在谈事件专题推荐理由:Applied Compute 支持 Nemotron 3.5 Lightning 了,并发翻 16 倍延迟不涨,训练迭代快多了。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:44IT之家(博客/媒体)荣耀CEO李健在Robot Phone发布会后表示,内存涨价和行业竞争构成当前压力。荣耀通过战略调整,AI、影像、设计能力均在提升。YOYO用户接近3亿,全球IoT设备超3000万台。李健认为荣耀已具AI生态终端公司雏形,逆势破局需要经历磨难。行业荣耀Robot PhoneYOYO1 个信源在谈事件专题推荐理由:荣耀CEO亲自聊内存涨价压力,还透露YOYO用户近3亿、IoT设备超3000万,想看他怎么逆势破局可以读这篇。原文稍后读已读值得跟进有用关注 荣耀
17:44IT之家(博客/媒体)Anthropic于8月13日宣布升级Chrome版Claude扩展,侧边栏支持完整Claude Cowork会话。浏览器内对话现可跨桌面端、网页端及移动端同步。用户无需二次设置即可使用已配置的Agent Skills和Connectors。Claude能查看当前网页并执行点击、输入、填表等操作。该功能已面向Max和Team客户开放,Pro用户将在未来几周内获得。AI产品ClaudeAnthropicChrome10 个信源在谈事件专题推荐理由:Claude的Chrome扩展升级,侧边栏会话全平台同步,还能操作网页,Max和Team用户已可用。原文稍后读已读值得跟进有用关注 Claude
17:43IT之家(博客/媒体)约克大学与卡尔加里大学分析了Reddit上2023年2月至2026年3月间的3801个LLM热门帖子,筛选出446个AI编程安全相关帖子及6000多条评论。研究显示2025年7月是问题帖子数量最多的月份。按工具划分,Cursor报告的问题最多,其次是Claude、Codex、Copilot等。Cursor多涉及运行安全和未授权数据访问,而Claude的问题主要与第三方工具集成风险相关。论文CursorClaudeAI编程9 个信源在谈事件专题推荐理由:约克大学和卡尔加里大学扒了6000条Reddit评论,发现AI编程工具里Cursor出事最多,Claude的第三方集成风险也高,用AI写代码的可以看看。原文稍后读已读值得跟进有用关注 Cursor
17:43Scott Wu@ScottWu46精选Hone 是一家新公司,创始团队来自 Cognition、Mercor、Ramp 和 OpenAI。Hone 构建能持续创造、编排并改进智能体和软件的 AI,目标是在数周至数月内承担组织级成果。团队认为,模型能力与经济价值之间的差距在扩大,需要围绕组织成果而非单个任务重构工作。Scott Wu 在 X 上转发该公告,并表示“有时你就是知道”。AI产品HoneOpenAICognition10 个信源在谈事件专题推荐理由:OpenAI、Cognition 老将成立 Hone,说要用 AI 长期打理组织目标,专治模型强但落地难的问题。原文稍后读已读值得跟进有用关注 Hone
17:42官方账号NVIDIA AI@NVIDIAAI72°CrowdStrike 定制 NVIDIA Nemotron 3.5 Lightning,用于网络安全 agent 工作流。该模型达到分析师级准确率,训练速度更快、计算需求更低。它能自动关闭最高 88% 的良性检测,让安全团队专注真实威胁。AI模型Nemotron 3.5 LightningCrowdStrikeNVIDIA10 个信源在谈事件专题推荐理由:CrowdStrike 用 Nemotron 3.5 Lightning 做了安全智能体,自动关掉 88% 误报,训练快又省算力。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:42Viking@vikingmutevikingmute在推文中总结了七条产品原则:产品要小,只关注一个点。从自身真实需求出发,不凭空想象。AI产品需支持BYOK或集成本地agent。沟通用邮件和Issue,不建群,支持直接退款。技巧vikingmute产品设计BYOK推荐理由:这哥们做产品挺实在:小、便宜、支持退款,AI产品要BYOK,用邮件沟通不扯淡。原文稍后读已读值得跟进有用关注 vikingmute
17:41elvis@omarsar0精选一项研究追踪了1,867个仓库中247,694条指令的生命周期,发现CLAUDE.md等指令文件会无限增长。追加一条指令无需成本,而删除一条需付出指数级验证成本,因此无人删除。文件中的提示词在生命周期内增长超过三倍,每次提交净增4.9条指令。研究者提出用注释记录指令理由,在可验证环境中消除了99.3%的多余指令,并将真实智能体指令遵循度提升至多23.1%。论文CLAUDE.mdAGENTS.md提示词工程推荐理由:这条论文用24万条指令数据告诉你CLAUDE.md为什么越写越长,还给了注释法这个解法,提升多到23%。原文稍后读已读值得跟进有用关注 CLAUDE.md
17:41AI产品黄叔@PMbackttfuture一位用户在X上吐槽,Agent数量稍多内存就爆,计划下一台换更大内存。该推文在X上目前只有1次点赞,却获得了236次浏览。这236次浏览说明这个痛点并非个例。技巧智能体内存多Agent推荐理由:这位老哥的吐槽太真实了,Agent一开多内存直接爆表,想搞多Agent的朋友得先掂量下自己电脑内存。原文稍后读已读值得跟进有用关注 智能体
01:57IT之家(博客/媒体)76°SpaceXAI 发布 Grok 4.6,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 取得相同成绩。该模型在 Grok 4.5 基础上强化长时智能体任务,可处理资料研究、大型代码库和产品构想落地。训练数据包含筛选后的模型生成推理数据与工程数据,并经历比 Grok 4.5 更长的补充训练。Grok 4.6 已上线 Cursor、Grok Build 和 API,每百万输入 Token 定价 2 美元、输出 6 美元,首周两项服务用户获得两倍内含使用额度。AI模型Grok 4.6GPT-5.6 SolSpaceXAI10 个信源在谈事件专题推荐理由:SpaceXAI 的 Grok 4.6 发布,跑分追平 GPT-5.6 Sol,长流程编程和搭应用更强,已上线 Cursor,首周额度翻倍。原文稍后读已读值得跟进有用关注 Grok 4.6
01:55Guillermo Rauch@rauchg精选Vercel为开源库AI SDK搭建了一个软件工厂,流水线每个环节由AI Agent执行,人工只做变更合并。运行四周后,该工厂撰写了全部合并PR中多达35%的代码。7月它关闭了70%的issue,同时开放bug数量下降25%。技巧VercelAI SDK智能体推荐理由:Vercel拿Agent给自己造了个修bug的流水线,35%的PR都是AI写的,效率数据挺实在。原文稍后读已读值得跟进有用关注 Vercel
01:28IT之家(博客/媒体)86°阿里云魔搭社区宣布开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T,每个Token激活95B参数。该模型原生支持262,144 Token上下文,可扩展至1,010,000 Token。模型每个MoE层包含512个专家,每个Token选择10个路由专家并激活1个共享专家。官方评测显示,它在PaperBench、IFBench等基准上取得较高成绩,与Opus 4.8、Fable 5、GPT 5.6 Sol相比互有高低。Qwen3.8重点提升编程、办公、科研和长周期Agent任务的端到端完成能力。AI模型Qwen3.8-2.4T-A95BQwen阿里云推荐理由:阿里开源了Qwen3.8-2.4T-A95B,2.4T参数激活95B,原生256K上下文,编程和Agent能力对标GPT 5.6 Sol和Opus 4.8。原文稍后读已读值得跟进有用关注 Qwen3.8-2.4T-A95B
22:39官方账号LangChain@LangChainAI精选LinkedIn的Tanvi Motwani将参加LangChain在纽约举办的Interrupt NYC活动,分享Agentic Eval Playbook。该手册涵盖将智能体追踪转化为黄金数据集、训练LLM-as-a-Judge系统,以及为生产环境智能体构建离线与在线监控。活动定于9月24日举行。技巧LinkedInLangChain智能体推荐理由:做智能体评估的可以看看,LinkedIn分享怎么把追踪数据变成黄金数据集,还教你怎么训LLM当裁判。原文稍后读已读值得跟进有用关注 LinkedIn