开源模型密集发布,AI智能体与成本优化成焦点
2026年8月13日,开源AI模型密集发布成为当日最大亮点,同时AI智能体部署与成本优化、特定领域AI应用突破等主题备受关注。开源模型方面,阿里开源Qwen3.8-2.4T-A95B(2.4T参数、激活95B、原生256K上下文),DeepSeek-V4-Flash-0731(304B MoE)在Terminal-Bench 2.1上从61.8升至82.7逼近Opus-4.8,Meta发布Muse-Glimmer-30B开放智能体模型,Liquid AI LFM2.5-2.6B以2.69B参数达220 tok/s。AI智能体领域,OneAdvanced在AWS部署超50个智能体,Solv Labs构建可验证支付系统;EvoX Genesis以44美元构建25万行Rust编译器,SkillZip解决技能库膨胀,Test-Time Self-Evolving提升GUI定位准确率7.4%。特定领域与成本优化上,比亚迪HyWorldVLA刷新NAVSIM自动驾驶基准(90.59 PDMS),Surgical WAM用无动作视频预训练提升手术机器人成功率至77.8%;Curvine在SageMaker HyperPod实现分层KV缓存降低推理成本,CausalRepair程序修复成本降至0.029美元。
模型发布/更新
4 篇NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。
阿里开源了Qwen3.8-2.4T-A95B,2.4T参数激活95B,原生256K上下文,编程和Agent能力对标GPT 5.6 Sol和Opus 4.8。
比亚迪AI团队首秀,HyWorldVLA在自动驾驶基准上拿了第一,还自研了4nm芯片,算法硬件一起搞,想了解比亚迪智驾实力的可以看看。
产品发布/更新
4 篇想搞AI自动付钱又怕出事?Solv Labs这套方案把每笔交易都上链、在Nitro Enclave里做证明,给企业留了完整审计轨迹,适合金融、医疗这类严监管场景。
xAI 出了个能住你账号里干活的 Agent,翻网页、开应用、卡住喊你,演示一遍就记住流程,还能一群 bot 互相派活,挺新鲜的。
行业动态
3 篇论文研究
4 篇想知道AI怎么帮数学家干活?这篇论文用Grothendieck常数当例子,讲AI怎么把已知界限又收紧了一截,还聊了AI的强项和翻车点,挺实在的。
想研究 Agent 技能生态的,这个数据集直接给你 380 万份真实 SKILL.md,比你自己爬 GitHub 省事多了。
技巧与观点
3 篇想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。