22:29量子位@梦瑶国产具身智能模型在一小时内分拣1816件异形包裹,创下全球新纪录。该模型以30%的成本实现了比Figure AI高45%的分拣效率。其关键在于采用了更聪明的具身大脑,提升了决策与操作能力。这一成果展示了国产具身智能在成本与性能上的双重优势。AI模型具身智能Figure AI分拣机器人推荐理由:国产具身智能一小时拣1816件包裹,成本只有Figure AI的30%,效率还高45%,看看它怎么做到的。原文稍后读已读值得跟进有用关注 具身智能
22:05官方一手AWS Machine Learning Blog@Astrid Bowser, Alex Savage Nick Heap精选OneAdvanced是一家英国企业软件提供商,在AWS上构建了英国主权AI平台。他们通过Amazon SageMaker AI自托管Llama 4 Maverick和Llama Guard 4模型,并使用pgvector搭建RAG管道。基于Strands Agents SDK在Amazon ECS上部署了超过50个AI智能体。该平台确保数据留在英国境内,满足主权要求。AI产品OneAdvancedLlama 4 MaverickAWS1 个信源在谈事件专题推荐理由:看看英国公司怎么在AWS上自托管Llama 4,搞了50多个智能体,数据不出境,适合有合规需求的人参考。原文稍后读已读值得跟进有用关注 OneAdvanced
21:25OpenRouter@OpenRouterAI精选73°Meta Superintelligence Labs 推出首个开源权重模型 Muse Glimmer,已在 OpenRouter 上线。该模型为 30B 参数稠密文本+图像模型,采用 Apache 2.0 许可证。Muse Glimmer 在 MCP Atlas 基准上得分 75.5,在 SWE-Bench Pro 上得分 51.2,定位为可靠的本地智能体。AI模型Muse GlimmerMetaOpenRouter推荐理由:Meta 新出的开源模型 Muse Glimmer,30B 参数,Apache 2.0 随便用,本地跑智能体挺靠谱,MCP Atlas 和 SWE-Bench Pro 分数都不错,想玩本地 AI 的可以试试。原文稍后读已读值得跟进有用关注 Muse Glimmer
21:15官方一手OpenAI: 官网动态(博客/媒体)OpenAI发布研究报告,揭示企业采用智能体AI的现状。报告指出,前沿企业正通过ChatGPT和Codex等工具,将AI从辅助角色转向执行任务。数据显示,这些企业更倾向于将AI嵌入核心业务流程,而非仅用于个别场景。报告还分析了不同行业在AI采用上的差异,以及领先企业如何通过组织变革加速落地。行业OpenAIChatGPTCodex10 个信源在谈事件专题推荐理由:OpenAI官方报告,讲企业怎么用ChatGPT和Codex干活,不是空谈,有具体数据和案例,适合想了解AI落地路径的人。原文稍后读已读值得跟进有用关注 OpenAI
19:58小互@imxiaohu精选xAI 推出新 Agent 产品 Grok Bot,定位为住在云端的 AI 同事。每个 bot 运行在一台常驻 Linux 机器上,能用你的登录状态直接操作网页、应用和文件。遇到登录、验证码或付款时,它会将控制权交还给你,完成后继续执行。你可以演示一次操作,它就会保存为固定流程,支持定时或由 Slack 消息、Git 事件触发。多个 bot 之间还能互相派活,由总控 bot 协调收件箱、报销、招聘等任务。AI产品Grok BotxAI智能体6 个信源在谈事件专题推荐理由:xAI 出了个能住你账号里干活的 Agent,翻网页、开应用、卡住喊你,演示一遍就记住流程,还能一群 bot 互相派活,挺新鲜的。原文稍后读已读值得跟进有用关注 Grok Bot
18:51Fireworks AI@FireworksAI_HQ精选Meta Superintelligence Labs 推出开源权重模型 Muse Glimmer,已上线 Fireworks 平台。该模型为 30B 稠密模型,专为持续运行的智能体设计,支持跨多次顺序工具调用进行推理并可从失败中恢复。Muse Glimmer 支持 128K+ 上下文,原生支持图像和文本输入。开发者可通过 Fireworks 平台开始构建应用。AI模型Muse GlimmerMetaFireworks推荐理由:Meta 新开源了个 30B 模型,专为智能体连续调用工具设计的,还能从报错里恢复,128K 上下文,想玩智能体的可以试试。原文稍后读已读值得跟进有用关注 Muse Glimmer
18:40官方一手arXiv: DeepSeek@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng精选EvoX Genesis 框架将软件项目设为持久递归世界,本地智能体保持有限寿命,通过递归委派推进版本历史。基于 DeepSeek V4 Flash,Genesis 在 120 小时内构建了约 25 万行 Rust 的 C 编译器,花费仅 44 美元,通过完整 c-testsuite 及多数 LLVM 和 Csmith 测试。在 GLM 5.2 生成的编译器世界中,多次替换智能体后开发仍保持全部测试性能。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为约 9 万行 Rust,六个数值工作负载中位数加速 1.55 至 6.87 倍。结果表明,长期软件开发可围绕持久项目而非持久智能体组织。论文EvoX GenesisDeepSeek V4 FlashGLM 5.26 个信源在谈事件专题推荐理由:想低成本搞大型软件项目?EvoX Genesis 用 44 美元让 AI 写了 25 万行编译器,换人也不掉链子,值得看看。原文稍后读已读值得跟进有用关注 EvoX Genesis
18:37shao__meng@shao__meng精选SpaceXAI 发布新型 AI 同事 Grok Bot,目前处于早期测试阶段。与传统 AI 助手不同,Grok Bot 拥有自己的计算机环境,能实际登录 Zendesk、CRM 等工具并像真人一样操作界面,直接交付已完成的工作。它支持异步 7×24 小时运行,用户下达任务后可离开,Bot 在需要审批时才会联系用户。用户可创建多个 Bot 并行处理不同职能,它们之间能共享上下文和相互协作。Grok Bot 还提供销售外联、人才招聘等预置岗位模板,并支持通过示范一次工作流程来创建可复用的例行程序。AI产品Grok BotSpaceXAI智能体推荐理由:想找个能替你干活的 AI 同事?Grok Bot 能登录你的工具、7×24 小时干活,还能学你的工作习惯,值得试试。原文稍后读已读值得跟进有用关注 Grok Bot
18:36shao__meng@shao__meng72°前千问负责人林俊旸宣布在上海成立新公司 Pragmatik Labs(语用科技),简称 p7k,聚焦横跨数字与物理世界的下一代智能体研究。公司同时覆盖软件层面的数字 Agent 和面向真实环境的具身智能。本轮融资由高榕创投与红杉中国联合领投,腾讯与上海未来产业基金跟投。据 The Information 报道,融资规模达数亿美元,投后估值约 20 亿美元。行业Pragmatik Labs林俊旸智能体推荐理由:林俊旸从阿里千问出来单干,搞数字和物理世界通吃的智能体,红杉高榕腾讯都投了,估值 20 亿美元,想了解他下一步动作的可以看看。原文稍后读已读值得跟进有用关注 Pragmatik Labs
18:07官方账号arXiv cs.AI@Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka精选arXiv论文展示了AI在数学研究中改进Grothendieck常数K_G界限的案例。研究者将K_G的已知界限收紧至6π/11 ≤ K_G ≤ π/(2log(1+√2)) - 10^-4。AI系统提出了领域专家认为新颖的见解。论文详细讨论了AI在数学研究中的优缺点,以及创造理想条件让AI产生突破性见解的经验。论文Grothendieck常数AI数学研究arXiv推荐理由:想知道AI怎么帮数学家干活?这篇论文用Grothendieck常数当例子,讲AI怎么把已知界限又收紧了一截,还聊了AI的强项和翻车点,挺实在的。原文稍后读已读值得跟进有用关注 Grothendieck常数
18:05Harrison Chase@hwchase17LangChain 创始人 Harrison Chase 在 X 上宣布,他正在制作一个名为“Managed Deep Agents 101”的大型视频,深入讲解托管深度智能体的核心概念。该视频将基于 LangSmith 的 Python 文档,涵盖相关核心概念。他询问用户偏好,是希望看到一个超过 2 小时的单一视频,还是一个包含约 12 个十分钟视频的 YouTube 播放列表。目前该推文获得 3 个赞和 1123 次浏览。技巧LangChainHarrison Chase智能体推荐理由:LangChain 创始人要出教程了,讲托管深度智能体,还问大家想要长视频还是短视频列表,想学这块的可以去提意见。原文稍后读已读值得跟进有用关注 LangChain
17:57官方账号arXiv cs.AI@Kushal Chakrabarti精选该研究分析了1,867个仓库中247,694条指令的生命周期,发现智能体提示词无界增长,平均增长226%,每次提交净增4.9条指令。指令越旧越难删除,对数风险为-0.032/提交。通过反转IFEval生成可验证世界,提示注释可移除99.3%的多余指令,将增长率从+211.3%降至+1.4%。在WildIFEval上,提示注释使真实智能体指令遵循率提升23.1%。论文CLAUDE.md智能体提示词工程推荐理由:如果你用CLAUDE.md这类文件,会发现它越写越长不敢删。这篇论文告诉你为什么,还给了个注释技巧,能砍掉99%的冗余指令。原文稍后读已读值得跟进有用关注 CLAUDE.md
17:48Yangyi@Yangyixxxx林俊旸宣布在上海创立新公司Pragmatik Labs(语用科技),专注下一代智能体研究,覆盖数字与物理世界。高榕创投与红杉中国联合领投,腾讯与上海未来产业基金参投。林俊旸认为AGI将从网络走向物理世界,物理世界仍缺基建粘合剂。行业Pragmatik Labs语用科技林俊旸2 个信源在谈事件专题推荐理由:林俊旸离开DeepSeek后创业,语用科技拿红杉和高榕的钱做物理世界智能体,方向挺有意思。原文稍后读已读值得跟进有用关注 Pragmatik Labs
17:45AI Will@FinanceYF5AI Agent在电脑操作基准测试中的成绩一年内从42%提升至85%,超过约72%的人类基准。这些Agent已从演示阶段进入真实业务场景。企业关注的重点已从Agent能否点击按钮,转向其能否稳定完成整份工作。AI模型AI Agent电脑操作基准测试推荐理由:AI Agent操作电脑的成绩一年翻倍,已经超过七成人类,现在开始进企业干整份活了,看看它们到底行不行。原文稍后读已读值得跟进有用关注 AI Agent
17:42Aravind Srinivas@AravSrinivas精选NVIDIA 的 Nemotron 3.5 Lightning 现已面向所有开发者开放,可通过 Perplexity Agent API 调用。该模型为开源 30B MoE 架构,仅激活 3B 参数,专为高频智能体执行层设计,适用于工具调用、验证和子智能体任务。输入定价为每百万 tokens 0.0115 美元,输出定价为每百万 tokens 0.17 美元。开发者可将 Lightning 与 Nemotron Ultra 等前沿模型搭配,用于规划与批量执行。AI产品Nemotron 3.5 LightningPerplexityNVIDIA10 个信源在谈事件专题推荐理由:NVIDIA 把 30B MoE 的 Lightning 放到 Perplexity API 上了,每百万输入才 1 分多钱,适合跑高频工具调用,跟 Ultra 搭配干活很划算。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:34官方账号arXiv cs.AI@Shiyu Xuan, Zechao Li该论文提出Test-Time Self-Evolving框架,让GUI智能体在部署后无需人工标注即可自我改进。框架构建探索、评估、反思、内化的闭环,通过MLLM反射器评估预测结果并生成推理反思。反射引导的On-Policy自蒸馏将高层推理转化为密集token级监督,对比校准防止错误前缀污染监督信号。在六个基准上平均准确率提升7.4%,是首个将on-policy自蒸馏用于GUI视觉定位测试时适配的工作。论文GUI视觉定位Test-Time Self-Evolving自蒸馏推荐理由:GUI智能体部署后不会自我进化的问题有解了,这个框架用反射引导自蒸馏,六个基准平均涨7.4个点,做智能体适配的可以看看。原文稍后读已读值得跟进有用关注 GUI视觉定位
17:27Geek@geekbbxAI 推出 Grok Bot,目前处于早期测试阶段。该机器人能登录用户的工具,像真人一样操作并返回完成的工作。Grok Bot 需要 SuperGrok Heavy 订阅,免费用户暂时无法使用。有网友调侃红衣教主周鸿祎会对此感兴趣,并期待 360 安全 Bot 的出现。AI产品Grok BotxAISuperGrok Heavy推荐理由:xAI 的 Grok Bot 能登录你的工具替你干活,早期测试已开始,想尝鲜得先上 SuperGrok Heavy。原文稍后读已读值得跟进有用关注 Grok Bot
17:26官方一手arXiv: OpenAI@Audrey Quessada-VialarXiv 论文提出 Agentic Configuration Management (ACM),一个框架无关的治理与配置参考模型,用于异构智能体系统。ACM 结合类型化且独立版本化的配置项、不可变修订与基线、配置与运行时分离、生命周期与保障语义、依赖感知影响传播及运行时溯源。作者提供 Python 参考实现,适配 LangGraph、CrewAI 和 OpenAI Agents SDK,并用 27 个治理场景和 9 个量化影响传播案例评估。结果显示三个框架在投影后产生治理等价的 ACM 表示,影响语义在有限格上单调传播,保证收敛与唯一最小不动点。论文Agentic Configuration Management智能体LangGraph10 个信源在谈事件专题推荐理由:搞多智能体配置管理头疼的可以看这篇,ACM 把 LangGraph、CrewAI 这些框架统一成一套治理模型,还能做依赖分析和审计。原文稍后读已读值得跟进有用关注 Agentic Configuration Management
17:25Eric Jing@ericjing_aiGrant Thornton CIO Mike Kempe使用Genspark将公司百年积累的提案和报告知识转化为RFP响应,每周节省6-7小时。该工具是Grant Thornton 10亿美元AI和技术投入的早期押注。每个草稿都经过人工审核并保留完整审计轨迹。这一案例展示了AI智能体在大型会计师事务所中的实际应用。AI产品GensparkGrant Thornton智能体1 个信源在谈事件专题推荐理由:看看四大会计师事务所怎么用AI把百年老知识变成提案竞争力,每周省6-7小时,还有人工审核兜底。原文稍后读已读值得跟进有用关注 Genspark
17:23AI Will@FinanceYF5xAI推出Grok Bot,目前处于早期测试阶段。该机器人能登录用户的各类工具,像真人一样操作,并在任务完成后返回结果。用户甚至可以在任务执行期间关闭电脑,让Grok Bot继续工作。这标志着AI代理在自主完成任务方面迈出一步。AI产品Grok BotxAI智能体推荐理由:xAI的Grok Bot能替你登录工具干活,关电脑也能继续,适合想省事的打工人。原文稍后读已读值得跟进有用关注 Grok Bot
17:22Genspark@genspark_aiGrant Thornton使用Genspark将100年的公司知识转化为完整的RFP响应,单个提示即可生成提案。该公司的CIO每周节省6到7小时,提升了提案制作效率。所有草稿都经过人工审核,并保留完整的审计追踪。这是AI智能体在大型公司中实际应用的案例,相关报道见WSJ。AI产品GensparkGrant ThorntonRFP1 个信源在谈事件专题推荐理由:Grant Thornton用Genspark把百年知识变成RFP回复,CIO每周省6-7小时,看看AI怎么在四大所干活的。原文稍后读已读值得跟进有用关注 Genspark
17:21shao__meng@shao__mengManus宣布将恢复为独立公司运营,为符合特定地区监管要求,部分用户需在2026年8月23日7:59(新加坡时间)前备份数据,8月25日8:00起可恢复数据。受影响用户在过渡期间免收费,并获得欢迎回归奖励。Manus团队表示将推出新功能,继续推动通用AI智能体的发展。行业Manus智能体数据备份推荐理由:Manus要独立了,用它的朋友记得8月23日前备份数据,不然可能影响使用。原文稍后读已读值得跟进有用关注 Manus
17:11AI Will@FinanceYF5Grok Bot开放早期测试,能登录用户的工具并像人一样操作,任务完成后带回结果。用户可关掉电脑让其继续工作。已有用户用它谈供应商价格、管理网店客服、自动维护CRM。该功能让Agent从聊天助手进化为可独立执行任务的同事。AI产品Grok Bot智能体自动化推荐理由:Grok Bot能替你登录工具干活,关电脑也能继续,谈价、管客服、维护CRM都有人用了。原文稍后读已读值得跟进有用关注 Grok Bot
17:10AI Will@FinanceYF5Grok Bot 为每个机器人配备独立电脑,能学习用户工作流并使用现有应用。该机器人可自主执行任务,在用户睡眠时持续工作,相当于 24/7 的 AI 员工。此功能可能冲击依赖人工操作的初创企业,引发行业关注。AI产品GrokBot智能体推荐理由:Grok Bot 给每个机器人配了台电脑,能学你干活、用你的应用,睡觉时还在工作,像多了个 24 小时员工。原文稍后读已读值得跟进有用关注 Grok
17:09AI Will@FinanceYF5Grok Bot 现已进入早期测试阶段。该机器人能像 AI 队友一样,登录你的工具并像你一样使用它们,最终返回完成的工作。用户只需给机器人分配任务,即可关闭电脑,从任何地方联系它们。目前该功能处于早期 beta 阶段,尚未公布具体支持的平台和定价。AI产品Grok BotxAI智能体推荐理由:Grok Bot 能替你登录工具干活,关电脑后还能远程联系,适合想省事的用户试试。原文稍后读已读值得跟进有用关注 Grok Bot
17:06IT之家(博客/媒体)美团核心本地商业CEO王莆中在西普会演讲中明确表示,美团不会开设线下药店,而是聚焦于为医药行业商家提供AI转型支持。美团将开放AI经营专家、CatPaw能力及工作流改造方法论,首批AI经营专家已在漱玉平民、科赴等企业应用。其全场景AI Agent平台CatPaw也将面向医药商家启动试点。基于25万家药店与近500家药企的合作伙伴生态,美团目标打造医药零售AI时代的新型基础设施。行业美团AI经营专家CatPaw推荐理由:美团不自己开药店,反而把AI能力开放给25万家药店和500家药企,想做医药零售的AI基础设施,看看它怎么帮商家转型。原文稍后读已读值得跟进有用关注 美团
17:02IT之家(博客/媒体)2026中国算力大会将于9月11日至13日在河北廊坊举行,主题为“共织算力网 智启新未来”。大会采用“1+2+X+Y”架构,设1场开幕式、2场主论坛、X场分论坛及Y场特色活动。首次举办“算力首创首发发布会”,集中发布国产算力芯片、智能体、绿色算力等突破性成果。同期举办“算力中国·AI与算力产业展览会”,面向公众免费开放。大会已连续在山东、宁夏、河南、山西成功举办四届。行业中国算力大会廊坊算力网推荐理由:算力大会9月廊坊开,首次搞首发发布会,国产芯片和智能体新品都会亮相,还有免费展览,关注算力的朋友别错过。原文稍后读已读值得跟进有用关注 中国算力大会
16:55向阳乔木@vista8博主实测Grok bot后认为暂时没必要安装。该工具可创建多Agent并连接Gmail、Github等常用软件,但类似功能Codex等工具已具备。试用需绑定信用卡,消耗极快,三个Agent简单对话一周就用掉32%用量。订阅Super Grok Heavy可免费使用,但月费300美元价格偏高。博主建议等Grok模型更强后再考虑,并推荐了更成熟的替代品Bloome。AI产品GrokAgentBloome推荐理由:实测Grok bot发现要绑信用卡、用量烧得快,三个Agent一周吃掉32%,Super Grok Heavy要300刀一个月。想尝鲜不如先看Bloome。原文稍后读已读值得跟进有用关注 Grok
16:52AI Will@FinanceYF5a16z 发布数据称,电脑使用 Agent 每小时成本为 6–8 美元,已低于离岸外包人才的约 10 美元,更远低于美国本土人才的 30–45 美元。a16z 认为,随着推理成本持续下降和开源模型能力提升,这一成本优势将进一步扩大。该数据基于当前主流 Agent 工作流的实际运行成本估算。行业a16z智能体成本对比推荐理由:a16z 算了笔账:电脑 Agent 一小时 6-8 美元,比请外包还便宜,这趋势值得关注。原文稍后读已读值得跟进有用关注 a16z
16:49Hunyuan@TXhunyuan精选腾讯混元团队发布《Diving into Reliable Self-Evolving Agents: A Survey》综述,系统梳理智能体自我进化机制。该综述定义了L0到L4的五级自进化分类法,并引入可靠性阶梯用于评估每次更新的可信度。研究团队整理了549篇相关论文,建立开放配套目录。核心原则是任何更新都不能仅用自身产生的证据来验证,确保进化过程可审计。论文腾讯混元智能体自进化推荐理由:腾讯混元团队整理了549篇论文,给自进化智能体分了L0-L4五个等级,还提出一套验证更新靠不靠谱的方法,做Agent研究的朋友可以看看。原文稍后读已读值得跟进有用关注 腾讯混元
16:43官方账号arXiv cs.AI@Xiaofan Bai, Hongqiang Lin, Chao Liu, Yantao Zhang, Xuan Jin, Xipeng Cao, Yuhong LiSkillZip 是一种免评估的技能压缩方法,旨在解决自进化智能体技能库膨胀问题。它通过最短忠实结构解释,将重复规则上提至作用域、重复动作序列提取为共享过程,并保留唯一罕见规则。该方法基于类型化最小描述长度目标,满足硬覆盖约束,支持一次性模式和持续 Zip-on-Write 模式。实验表明,SkillZip 在压缩性能、泛化性和成本开销上均优于现有方法。论文SkillZip技能压缩自进化智能体推荐理由:智能体技能越攒越乱?SkillZip 不用跑评估就能压缩,把重复规则提出来、动作序列抽成共享过程,还保住罕见规则。一次性或持续更新都行,省成本。原文稍后读已读值得跟进有用关注 SkillZip
16:32宝玉@dotey72°Manus 在 2025 年 12 月以超 20 亿美元卖给 Meta,成为大模型应用领域当时最大收购案,但 2026 年 4 月 27 日国家发改委作出禁止投资决定,要求撤销交易。拆分期间 Manus 收入增长约 5 倍,从每日 30 万美元涨至近 150 万美元,一度超过 DeepSeek,ARR 首次突破 3 亿美元。8 月 11 日 Manus 正式确认恢复独立运营,产品停留在 1.6 版本,2.0 版本已开发完待发布。150 人团队在动荡中无一人离职,肖弘称这是第三次创业。行业ManusMeta收购推荐理由:Manus 被 Meta 收购又遭撤销,收入反而涨了 5 倍,ARR 破 3 亿美元,这剧情比小说还精彩,值得看看他们怎么翻盘。原文稍后读已读值得跟进有用关注 Manus
16:30Viking@vikingmuteBeautiful UI 是一个新出现的 UI 组件库,地址为 beautifului.dev,因其精致外观在社交平台引发关注。作者此前主要使用 Vercel 的 ai-elements 和其他小组件组合,现在发现 Beautiful UI 组件更全面。该组件库专为 Agent 相关应用设计,覆盖场景更广。作者认为其精致程度优于此前使用的方案。AI产品Beautiful UIVercelai-elements推荐理由:做 Agent 应用缺好看组件?Beautiful UI 比 ai-elements 更全更精致,直接拿来用就行。原文稍后读已读值得跟进有用关注 Beautiful UI
16:06官方一手pandaily@contact@pandaily.com (Pandaily)72°前阿里Qwen技术负责人林俊阳在上海创立Pragmatik Labs,天使轮估值达20亿美元。高榕和红杉中国各领投1亿美元,腾讯追加2000万美元。公司定位数字与物理智能体,而非基础模型。林俊阳曾是阿里最年轻的P10级工程师之一。行业Pragmatik LabsQwen林俊阳推荐理由:前Qwen技术负责人创业,估值20亿美元,高榕红杉腾讯都投了。不做大模型改做智能体,方向值得关注。原文稍后读已读值得跟进有用关注 Pragmatik Labs
16:04AI Will@FinanceYF5精选NVIDIA推出Nemotron 3.5 Lightning,专为长时运行的智能体任务设计。该模型总参数量30B,激活参数3B,支持高达1M token的上下文,并已开放商用。NVIDIA提供BF16和更小的NVFP4量化检查点,支持在单张H100或DGX Spark上部署,也兼容RTX 5090。通过多token预测、DSpark和DFlash投机解码以及NVFP4量化,生成速度最高提升4倍。在PinchBench基准上,其准确率达86%,完成速度比Qwen3.6 35B快30%。AI模型Nemotron 3.5 LightningNVIDIA智能体10 个信源在谈事件专题推荐理由:NVIDIA出了个轻量模型,30B参数但只激活3B,跑长任务上下文能到1M,单卡就能部署,速度还快4倍。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:55IT之家(博客/媒体)精选英伟达、思科和CrowdStrike等120多个组织组成的联盟提出为AI智能体制定事件报告框架SAFE。该框架要求成员披露智能体未经授权访问、泄露机密信息等事故,并保存提示、追踪、工具调用等证据。事故发生后需在4个工作日内提交初步报告,30天内发布事实报告,90天内提供补救更新。该计划以NASA航空安全报告系统为蓝本,旨在建立AI安全故障的标准报告方法。行业英伟达AI安全智能体推荐理由:英伟达牵头120多家组织搞了个AI事故报告标准,以后智能体闯祸得按规矩上报,想了解AI安全怎么管可以看看。原文稍后读已读值得跟进有用关注 英伟达
09:52IT之家(博客/媒体)英伟达于8月11日发布Nemotron 3.5 Lightning,这是一款拥有300亿参数的MoE开源模型,专为大型多智能体系统设计。相比同类模型,其输出速度最高提升4倍,智能体任务整体完成速度加快30%。该模型支持本地运行于NVIDIA RTX PC、DGX Spark等设备,也可扩展至企业级数据中心和云端环境。开源链接已提供在Hugging Face、ModelScope和OpenRouter等平台。AI模型Nemotron 3.5 Lightning英伟达开源模型10 个信源在谈事件专题推荐理由:英伟达新出的30B开源模型,跑智能体任务比同类快4倍,还能本地跑,搞多智能体开发的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
09:46lmarena.ai@lmarena_ai精选Agent Arena发布新评测基准,在数百万个真实世界长程智能体任务上衡量模型表现。评测中模型需使用网络搜索、文件系统和终端工具完成复杂工作流,包括编写代码、制作幻灯片、网络研究、构建应用和文档分析。该基准采用因果追踪方法,可深入分析模型在长程任务中的决策过程。评测结果已上线arena.ai/leaderboard/ag榜单。AI模型Agent Arena智能体评测基准推荐理由:想测智能体真实干活能力?Agent Arena用百万真实任务打分,比普通聊天评测靠谱多了。原文稍后读已读值得跟进有用关注 Agent Arena