Meta发布Muse Glimmer:30B开源智能体模型,单消费级GPU可运行
Meta发布Muse Glimmer,一个300亿参数的开源智能体模型,采用Apache 2.0许可。其权重可在24GB显存的消费级GPU上运行,配合DFlash投机解码获得3.1倍速度提升。Muse Glimmer面向工具调用与多步任务,适合本地部署。
Meta发布Muse Glimmer,一个300亿参数的开源智能体模型,采用Apache 2.0许可。其权重可在24GB显存的消费级GPU上运行,配合DFlash投机解码获得3.1倍速度提升。Muse Glimmer面向工具调用与多步任务,适合本地部署。
X Square Robot 开源了推理时学习框架 HOST。该框架让人形机器人观看 29 秒人类演示,以 62% 成功率复现技能。HOST 将具身 AI 从离线微调转向即时模仿。
字节跳动Seed团队发布SeedRealtime,一款原生音视频全双工大语言模型。该模型在统一架构中融合音频、视频与文本,可对连续多模态流进行实时交互,而非逐轮问答。官方宣称三项突破,包括联合音视频理解。Seed表示这是迈向全模态交互的一步。
Milvus 3.0在向量检索基础上加入更多库内处理能力,支持ORDER BY对过滤结果和ANN候选排序。查询侧聚合提供count、sum、avg、min、max,并按标量字段分组。搜索聚合支持分面检索,返回分桶计数、聚合统计和每桶Top-N样本,但分面计数基于ANN结果故为近似值。新增StructArray让单个实体可包含多个向量与结构化元素,适配文档块、视频帧和ColBERT等交互式模型。稀疏检索增强包括压缩版BM25索引和面向SPLADE学习型稀疏向量的SINDI算法。
Anthropic 宣布自 8 月 14 日起,Claude Code 的 Auto 模式将成为 Pro、Max、Team 套餐新会话的默认设置。官方对比测试中,1,053 名付费测试者里有 13.6% 的人批准了被调包的危险命令,Auto 模式可拦截其中 89% 的动作。第三方机构 Trajectory Labs 对 Claude Fable 5、Opus 5、Sonnet 5 进行了 720 次间接提示注入攻击,全部被 Auto 模式拦截。Simon Willison 认为数据有力,但仍希望看到更多独立验证。
ReliableNet 提出一种新的训练方法,直接约束模型同时自信且预测错误的联合概率(JCW),使其低于用户设定的风险预算 α。该方法将问题建模为机会约束的经验风险最小化,并用保守光滑内近似保证可行性。在四个表格和两个图像数据集上,ReliableNet 是唯一在所有分布内数据集和随机种子下满足 JCW 预算的方法。在多种分布偏移下,它取得最低的经验 JCW,同时保持较高的准确率和校准性能。
Model Discovery Agent (MDA) 将大语言模型作为候选结构提议器,与序贯蒙特卡洛、模拟推断和价值信息等贝叶斯方法结合,用于从少量干预实验中学习因果机制模型。MDA 在 M-open 设定下运行,当真实模型超出假设类时,预测检查会触发提议器扩展假设空间。在物理、化学和生物学三个基准上,MDA 实现了数据高效的模型学习和可靠的干预预测,创下新 SOTA。
Matryoshka训练框架将500M、1.5B和3B三个子模型堆叠进单一嵌套架构,端到端训练。相比独立训练基线,该套件在基准性能和困惑度上持平,但训练计算量减少36%。嵌套结构天然支持投机解码,吞吐量提升14-26%。论文还消融了关键架构选择,为构建强Matryoshka套件提供指导。
ColluSkill是一种针对LLM智能体技能扫描器的对抗性攻击框架,通过将恶意意图分解为多个独立包装的技能子负载,利用上下文依赖和工件传递在运行时组合成有害工作流。实验显示,在六个代表性技能扫描器上,ColluSkill平均攻击成功率达96.0%,显著优于单技能和多技能攻击基线。为防御此类攻击,研究者提出ChainGuard,一种上下文感知的技能链扫描器,通过重建跨技能依赖和工件流将攻击成功率降至22.5%,同时允许99.5%良性工作流通过。该研究揭示了现有技能扫描器仅检查单个技能的安全盲区,强调链级安全分析对智能体技能生态系统的重要性。
MoNo提出了一种新的神经算子架构,通过CoTAP方法将跨空间分配建模为熵正则化最优传输问题,解决了现有可学习投影机制中潜在token分配不均的问题。该方法构建了平衡的双向投影和稳定的潜在空间,支持在一般几何上的多尺度架构。实验表明,MoNo在预测性能和计算效率上均优于现有最先进的神经算子。代码已开源。