8月12日
22:05
22:05官方一手AWS Machine Learning Blog@Astrid Bowser, Alex Savage Nick Heap
精选
OneAdvanced是一家英国企业软件提供商,在AWS上构建了英国主权AI平台。他们通过Amazon SageMaker AI自托管Llama 4 Maverick和Llama Guard 4模型,并使用pgvector搭建RAG管道。基于Strands Agents SDK在Amazon ECS上部署了超过50个AI智能体。该平台确保数据留在英国境内,满足主权要求。
事件专题

推荐理由:看看英国公司怎么在AWS上自托管Llama 4,搞了50多个智能体,数据不出境,适合有合规需求的人参考。
21:25
21:25OpenRouter@OpenRouterAI
精选73°
Meta Superintelligence Labs 推出首个开源权重模型 Muse Glimmer,已在 OpenRouter 上线。该模型为 30B 参数稠密文本+图像模型,采用 Apache 2.0 许可证。Muse Glimmer 在 MCP Atlas 基准上得分 75.5,在 SWE-Bench Pro 上得分 51.2,定位为可靠的本地智能体。
推荐理由:Meta 新出的开源模型 Muse Glimmer,30B 参数,Apache 2.0 随便用,本地跑智能体挺靠谱,MCP Atlas 和 SWE-Bench Pro 分数都不错,想玩本地 AI 的可以试试。
18:07
18:07官方账号arXiv cs.AI@Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka
精选
arXiv论文展示了AI在数学研究中改进Grothendieck常数K_G界限的案例。研究者将K_G的已知界限收紧至6π/11 ≤ K_G ≤ π/(2log(1+√2)) - 10^-4。AI系统提出了领域专家认为新颖的见解。论文详细讨论了AI在数学研究中的优缺点,以及创造理想条件让AI产生突破性见解的经验。
推荐理由:想知道AI怎么帮数学家干活?这篇论文用Grothendieck常数当例子,讲AI怎么把已知界限又收紧了一截,还聊了AI的强项和翻车点,挺实在的。
17:45
17:45AI Will@FinanceYF5
AI Agent在电脑操作基准测试中的成绩一年内从42%提升至85%,超过约72%的人类基准。这些Agent已从演示阶段进入真实业务场景。企业关注的重点已从Agent能否点击按钮,转向其能否稳定完成整份工作。
推荐理由:AI Agent操作电脑的成绩一年翻倍,已经超过七成人类,现在开始进企业干整份活了,看看它们到底行不行。
17:10
17:10AI Will@FinanceYF5
Grok Bot 为每个机器人配备独立电脑,能学习用户工作流并使用现有应用。该机器人可自主执行任务,在用户睡眠时持续工作,相当于 24/7 的 AI 员工。此功能可能冲击依赖人工操作的初创企业,引发行业关注。
推荐理由:Grok Bot 给每个机器人配了台电脑,能学你干活、用你的应用,睡觉时还在工作,像多了个 24 小时员工。
16:43
16:43官方账号arXiv cs.AI@Xiaofan Bai, Hongqiang Lin, Chao Liu, Yantao Zhang, Xuan Jin, Xipeng Cao, Yuhong Li
SkillZip 是一种免评估的技能压缩方法,旨在解决自进化智能体技能库膨胀问题。它通过最短忠实结构解释,将重复规则上提至作用域、重复动作序列提取为共享过程,并保留唯一罕见规则。该方法基于类型化最小描述长度目标,满足硬覆盖约束,支持一次性模式和持续 Zip-on-Write 模式。实验表明,SkillZip 在压缩性能、泛化性和成本开销上均优于现有方法。
推荐理由:智能体技能越攒越乱?SkillZip 不用跑评估就能压缩,把重复规则提出来、动作序列抽成共享过程,还保住罕见规则。一次性或持续更新都行,省成本。
16:06
16:06官方一手pandaily@contact@pandaily.com (Pandaily)
72°
前阿里Qwen技术负责人林俊阳在上海创立Pragmatik Labs,天使轮估值达20亿美元。高榕和红杉中国各领投1亿美元,腾讯追加2000万美元。公司定位数字与物理智能体,而非基础模型。林俊阳曾是阿里最年轻的P10级工程师之一。

推荐理由:前Qwen技术负责人创业,估值20亿美元,高榕红杉腾讯都投了。不做大模型改做智能体,方向值得关注。