VOL.2026.08.13·158 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月十三日 星期四DAILY · 每早八时
01

模型发布/更新

Model Releases
4

开源AI之夏:多款开放权重模型密集发布

X·KOLX:Julien Chaumond (@julien_c)原文 ↗

开源社区迎来开放权重模型密集发布潮。DeepSeek-V4-Flash-0731(304B MoE)在Terminal-Bench 2.1上从61.8升至82.7,逼近Opus-4.8。Meta发布首个开放智能体模型Muse-Glimmer-30B,支持完全本地运行,采用Apache 2.0。Liquid AI LFM2.5-2.6B以2.69B参数在M5 Max上达220 tok/s,内存占用低于2.5GB。MiniMax-H3支持原生立体声音频,可生成2K/15秒视频。Mistral Shieldstral-1.0-3B在HarmBench上得分99.4,超过LlamaGuard-4-12B和ShieldGemma-9B。

NVIDIA发布Nemotron 3.5 Lightning与NeMo Switchyard模型路由器

官方一手X·KOLX:marktechpost (@Asif Razzaq)原文 ↗

NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。

阿里开源Qwen3.8-2.4T-A95B:2.4T MoE、激活95B、原生256K上下文

官方IT之家原文 ↗

阿里云魔搭社区宣布开源Qwen3.8-2.4T-A95B模型权重,总参数2.4T,每个Token激活95B参数。该模型原生支持262,144 Token上下文,可扩展至1,010,000 Token。模型每个MoE层包含512个专家,每个Token选择10个路由专家并激活1个共享专家。官方评测显示,它在PaperBench、IFBench等基准上取得较高成绩,与Opus 4.8、Fable 5、GPT 5.6 Sol相比互有高低。Qwen3.8重点提升编程、办公、科研和长周期Agent任务的端到端完成能力。

比亚迪HyWorldVLA自动驾驶模型刷新NAVSIM基准,自研芯片闭环成型

官方IT之家原文 ↗

比亚迪汽车新技术研究院AI团队发布首篇研究论文,提出混合世界模型HyWorldVLA,结合像素级和潜在空间世界建模,采用VLA架构。该模型在NAVSIM v1基准上取得90.59的PDMS评分,刷新历史最佳,在NAVSIM v2上获89.71分。消融实验显示,移除像素级预测PDMS降至87.50,移除潜在空间处理降至89.91。在655个雨雾噪声场景中,模型得分86.87,比最强基线高19分以上。比亚迪还发布了4nm车规级智驾芯片璇玑A3,算力约700TOPS,支持三芯片并联,形成算法到芯片的闭环。

02

产品发布/更新

Product
4

Solv Labs在Amazon Bedrock AgentCore上构建可验证的智能体支付系统

官方一手X·KOLX:AWS Machine Learning Blog (@Patrick Duffy)原文 ↗

Solv Labs在Amazon Bedrock AgentCore payments上构建了受治理的智能体支付工作流。每笔交易在AWS Nitro Enclave中授权和证明,并基于风险定价,最终锚定到公共区块链。该系统为企业提供了在受监管环境中自主智能体支付的可验证、可审计的轨迹。该模式支持交易前授权、交易中证明和交易后审计,确保合规性。

xAI 发布 Grok Bot:云端常驻 AI 同事,用你的账号替你干活

X·KOLX:小互 (@imxiaohu)原文 ↗

xAI 推出新 Agent 产品 Grok Bot,定位为住在云端的 AI 同事。每个 bot 运行在一台常驻 Linux 机器上,能用你的登录状态直接操作网页、应用和文件。遇到登录、验证码或付款时,它会将控制权交还给你,完成后继续执行。你可以演示一次操作,它就会保存为固定流程,支持定时或由 Slack 消息、Git 事件触发。多个 bot 之间还能互相派活,由总控 bot 协调收件箱、报销、招聘等任务。

03

行业动态

Industry
3

a16z报告:AI智能体成本已低于印度外包劳动力

官方IT之家原文 ↗

a16z合伙人Fabrizio Serafini发布博文称,AI智能体成本已低于印度离岸外包劳动力。OSWorld-Verified基准显示,最强计算机使用型模型得分从2025年初的42%升至2026年6月Claude Fable 5的85%,高于人类测试者约72%的水平。Computer Use智能体完全成本约每小时6-8美元,而印度BPO工人约10美元,美国后台员工为30-45美元。生产案例中,一家CPG数据平台每月运行1500万至2000万次自动化门户交互,维护爬虫的工程团队规模减半。

04

论文研究

Research
4

EvoX Genesis:持久递归世界实现自主软件演进

官方一手X·KOLX:arXiv: DeepSeek (@Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng)原文 ↗

EvoX Genesis 框架将软件项目设为持久递归世界,本地智能体保持有限寿命,通过递归委派推进版本历史。基于 DeepSeek V4 Flash,Genesis 在 120 小时内构建了约 25 万行 Rust 的 C 编译器,花费仅 44 美元,通过完整 c-testsuite 及多数 LLVM 和 Csmith 测试。在 GLM 5.2 生成的编译器世界中,多次替换智能体后开发仍保持全部测试性能。Genesis 还将 13 个 MESA 模块(超 10 万行 Fortran)重写为约 9 万行 Rust,六个数值工作负载中位数加速 1.55 至 6.87 倍。结果表明,长期软件开发可围绕持久项目而非持久智能体组织。

AI助力数学研究:Grothendieck常数界限改进案例

官方账号X·KOLX:arXiv cs.AI (@Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka)原文 ↗

arXiv论文展示了AI在数学研究中改进Grothendieck常数K_G界限的案例。研究者将K_G的已知界限收紧至6π/11 ≤ K_G ≤ π/(2log(1+√2)) - 10^-4。AI系统提出了领域专家认为新颖的见解。论文详细讨论了AI在数学研究中的优缺点,以及创造理想条件让AI产生突破性见解的经验。

CLAUDE.md为何不断膨胀?智能体编程中的灾难性记忆

官方账号X·KOLX:arXiv cs.AI (@Kushal Chakrabarti)原文 ↗

该研究分析了1,867个仓库中247,694条指令的生命周期,发现智能体提示词无界增长,平均增长226%,每次提交净增4.9条指令。指令越旧越难删除,对数风险为-0.032/提交。通过反转IFEval生成可验证世界,提示注释可移除99.3%的多余指令,将增长率从+211.3%降至+1.4%。在WildIFEval上,提示注释使真实智能体指令遵循率提升23.1%。

GitSkills:GitHub 上 380 万份 Agent 技能文件数据集

官方一手X·KOLX:arXiv: Anthropic (@Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, Marco Ortu)原文 ↗

GitSkills 数据集收录了 2026 年 7 月从 282,200 个公共仓库中采集的 3,797,117 个 SKILL.md 文件。这些文件按内容哈希去重后得到 1,877,981 个不同版本,每个版本附带完整文本、front matter、文件夹内容及仓库元数据。数据集以单个 SQLite 文件发布,支持研究 Agent 技能的采用、复用、结构、维护与安全问题。该研究指出技能文件缺乏中央注册表,主要通过复制文件夹传播。

05

技巧与观点

Tips & Takes
3
158
今日事件
53
一手报道
29
新模型
56
信源
AITOP · 编辑系统自动生成