LlamaParse在视觉定位上碾压通用视觉模型,ExtractBench新基准发布
LlamaIndex发布ExtractBench基准,专门评估文档提取的视觉定位能力。测试显示,通用视觉模型和编码智能体在返回证据时得分为零,而专用VLM文档工具LlamaParse表现领先。LlamaExtract Agentic Plus在页面级F1达84.9%,词级46.4%,长文档上保持87.1%,其他系统在长文档上跌至0%。基准要求字段值和引用都正确才算分,词级框IoU需达0.5。
LlamaIndex发布ExtractBench基准,专门评估文档提取的视觉定位能力。测试显示,通用视觉模型和编码智能体在返回证据时得分为零,而专用VLM文档工具LlamaParse表现领先。LlamaExtract Agentic Plus在页面级F1达84.9%,词级46.4%,长文档上保持87.1%,其他系统在长文档上跌至0%。基准要求字段值和引用都正确才算分,词级框IoU需达0.5。
Cartesia 发布了基于状态空间模型构建的流式 TTS 模型 Sonic-3.6。该模型在 Artificial Analysis 的 Provider Voice 榜单上以 1,283 Elo 排名第一。它还在 Controlled Voice 榜单上取得 1,123 Elo 的成绩,该基准将所有模型克隆到相同的 8 个参考音色上。Sonic-3.6 实现了低于 90ms 的首字音频生成时间。
Axiom 发布了 AxiomProver 模型。该模型完成了 BGP246 定理的机器可验证形式化。BGP246 是素数间隙的最佳已知界限,接近孪生素数猜想。
AI系统压缩长对话时,平均丢弃83%用户规则(如“未经批准不发邮件”)。宾州州立大学研究者提出基于Qwen3.5-9B的附加模块。该模块可保留超90%的用户限制。
Google开源了SAM(Sovereign Agent Mesh),一个零配置、零信任的P2P覆盖网络,让自主智能体能在云、本地、笔记本和边缘环境间发现并调用彼此的MCP工具。SAM基于Apache-2.0协议,无需暴露任何内部端点至公网。身份通过OIDC流转为Biscuit能力令牌,节点在默认拒绝模型下离线授权每个请求。
Mojo 编程语言在发布 1.0 版本后,于 2026 年 8 月 18 日正式开源,编译器与工具链采用 Apache 2 许可证。Mojo 最初计划成为 Python 的超集,但 2025 年 8 月后调整方向,不再强求完全兼容。目前 Mojo 定位为独立语言,专注于简化 GPU 编程,语法受 Python 启发。官方表示 AI 辅助编码工具已能帮助迁移 Python 代码至 Mojo。
阿里云在 8 月 14 日 Apsara 发布会上于百炼平台推出了 Agent Studio。该平台定位为企业级智能体全栈解决方案。它提供托管运行时以及跨 MCP 服务的统一 API 密钥管理。平台还集成了智能体搜索和记忆功能以解决基础设施难题。
LangSmith 推出 Tuned Evaluators,自动对生产环境中的智能体行为进行评分。该功能首发指标为 Perceived Error,用于判断智能体是否提供有效帮助。在基准测试中,LangChain 的专用模型击败了所有测试过的前沿模型。该模型将评估成本降低了 82%。
Hugging Face在ICML复现挑战赛中,1,221名人类与编码智能体合作,复现了2,226篇论文。活动在HF Hub上公开进行,产生了6,816份复现日志、2,962个云任务和35,908条判断记录。Hugging Face CEO表示,Hub的下一个百万用户可能不是人类,这对开放科学是好事。
OpenAI 暂停了针对部署的最新模型的强化学习训练两周。团队在此期间加固了研究环境并进行了红队测试,同时扩大了监控覆盖范围。目前最大规模的前沿 RL 运行仍处于暂停状态。小规模训练和评估正在运行以验证这些安全措施并建立对齐证据。
OpenAI 和 Hugging Face 入侵事件发生 5 周后,防御者发现必须像攻击者一样测试模型。Cotool CEO Max Pollard 和 Neo CEO Nick Warner 指出,现有安全工具是为阻止人或恶意软件设计的,无法应对 AI 智能体。对话预测到 2027 年 50% 的企业应用将具备智能体能力,导致传统签名和行为检测失效。
安谋控股(Arm)首席财务官杰森·柴尔德透露,公司正推进战略转型,从授权芯片设计转向自主制造并销售成品处理器。Arm 于 2026 年 3 月推出 AGI CPU,这是其 36 年历史上首次自研芯片,面向 AI 数据中心推理负载,首批客户包括 Meta、OpenAI、Cloudflare 和 SAP。柴尔德表示,销售成品芯片比授权更复杂,需自行确保晶圆代工和内存供应,预计扩大产能需 2 年。Arm 预计 2027 和 2028 财年客户对 AI 芯片需求将超 20 亿美元。内存被指为 AI 基础设施主要瓶颈之一。
百度发布2026年第二季度财报,总营收313亿元,AI业务收入占比50%,连续两季过半。AI云基础设施中GPU云同比增长283%,连续四季度三位数增长。李彦宏表示将引进顶尖人才,让文心重回基础大模型第一梯队。沈抖称AI云收入下半年有望加速增长,利润率长期有提升空间。
Goldman Sachs预测,到2030年AI代币使用量将增长24倍,企业级Agent每月消耗约120千万亿代币。第一波是聊天,第二波是持续工作的Agent,第三波是物理AI(人形机器人、自动驾驶出租车)。物理AI预计到2040年每月消耗400千万亿代币,成为最大消耗源。每台机器人不仅持续运行推理,还自带硬件,使基础设施投资获得双重回报。
IBM Research 发布博客探讨智能体在长任务中的记忆压缩问题。文章介绍了基于 Hidden Markov Model (HMM) 的 ALTK 方法。该方法通过演化模型状态来减少对上下文窗口的占用。这种技术旨在解决长程推理任务中的记忆管理挑战。
Quipu 是一个可嵌入的知识图谱存储,要求每条事实必须通过治理门控,门控谓词评估待写入的后状态。数据、信任标签、裁决和规则本身都是双时态的,命名图作为权威和信任单位,在格下组合且组合不扩大。在 Census 基准上,门控存储 0/6 种植入缺陷,未门控 6/6;50/50 满意裁决按时间点正确重推导,最新规则集下全部误报。在 DEMM-Bench 上,内容读取回答全部 512 个属性级问题且零过度声明,容器存在基线最多过度声明 87.5%。
BATON是一种针对长时程机器人操作的新方法,通过将探索单元从整个任务细化为子任务,使成本从指数级降为线性。它引入了过渡感知记忆,包括验证器、交接和前瞻机制,以处理子任务间的状态转换。在RoboMemArena基准上,BATON将任务成功率提升了11.6%,累计成功率提升了14.9%。该方法无需更新参数,仅通过语言记忆和智能体协作实现。
Jason Wei在推文中反驳了“小模型加工具就能达到大模型智能”的观点。他认为,虽然理论上1B参数模型配合工具能完成任何任务,但实际体验差距明显。他提出三点理由:速度上直接回答远快于工具调用;理解深度上大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果;可靠性上每次重新查找和推导更容易出错。他以羽毛球训练类比,强调内化知识的重要性,并引用“苦涩的教训”支持扩大规模优于精巧设计。
Agentic AI 会话中缓存失效后发送简单的“hi”可能花费 1 美元。这是因为系统需要重新处理百万级 token 的上下文,而非仅处理当前输入。即使发生 1 个 token 的工具调用,cache miss 也需为上下文支付全额价格。Claude Code/Codex 可能会在 200-300K token 处进行上下文压缩以控制成本。
Axonius 利用 Amazon Bedrock AgentCore 部署了多租户 AI 智能体。这些智能体在数百个客户环境中实现了完全隔离。该方案无需从头构建自定义的计算隔离、身份验证或可观测性基础设施。
本教程介绍如何利用 Strands Agents SDK 在 Amazon Bedrock 上构建多智能体解决方案。方案结合 Claude Haiku 4.5 进行文本分析,并使用 Amazon Titan Multimodal Embeddings 进行视觉相似性搜索。三个专用智能体协同工作,能够准确分类保单和宣誓书等保险文档。
Krea 故意在训练集中移除了 AI 图像,因为蒸馏数据会导致模型走捷径。团队运行了 30 到 40 个内部分类器处理数十亿张图像,并自动替换温度超过 78 度的 GPU。专为小模型设计的框架让开源用户在 90 天内渲染了 130 万个视频。连续视频生成的成本降至 10 美元 3 小时,而旧方式约为 10 美元每分钟。