Granite 4.2 LLMs: How They're Built
IBM发布Granite 4.2大型语言模型,采用全新架构,提升推理速度20%,降低能耗30%。模型基于Transformer-XL,支持多语言,适用于自然语言处理任务。
IBM发布Granite 4.2大型语言模型,采用全新架构,提升推理速度20%,降低能耗30%。模型基于Transformer-XL,支持多语言,适用于自然语言处理任务。
Liquid AI发布开源平台Pipette,用于在边缘设备上基准测试基础模型,与Artificial Analysis合作,独立验证方法。Pipette将设备上的行为作为评估标准,报告在服务器级、全精度条件下的模型卡片质量,这些数字很少能预测模型在手机上的表现。
ProxyFormer提出了一种基于代理标记的通用双流架构,通过压缩局部特征和仅在压缩代理空间中进行全局交互,解决了超长上下文语言模型和高分辨率生成模型的瓶颈问题。该模型在16GB GPU上,压缩比64时,可训练序列长度扩展至约0.7M,且在多针检索任务中保持92%-95%的检索准确率。
Google Research发布AgentHands模型,旨在生成交互式手势,支持在增强现实(XR)环境中进行空间化智能体对话。该模型基于MCP架构,通过微调实现,旨在提高人机交互的自然性和直观性。与现有方法相比,AgentHands在生成手势的多样性和准确性方面有所提升。
Next-Scale Transformer模型在人脸多视角合成方面取得进展,通过高分辨率、多视角输出和跨视角一致性,实现更真实的人脸视图合成。模型在合成数据集上训练,无需2D预训练,使用通用预训练,最终生成清晰、逼真的3D人脸模型。
训练和部署前沿模型已成为网络问题,而非仅计算问题。MetaRoCE 旨在解决网络摩擦,提高 AI 模型训练效率。MetaRoCE 是 Meta AI 最新推出的专为 AI 规模以太网设计的全新 RDMA 传输。
开发者 @b_nnett 逆向构建了 Grok Bot,将其反推成可读 TypeScript 和 React 代码,并扩展了四个实用功能:推理路由器、MCP 工具桥、本地用量统计和本地 Docker 沙箱。
OpenAI发布WeeChat插件,支持ChatGPT交互;插件支持多语言,包括中文;插件可通过ChatGPT进行代码调试和自然语言处理;插件已开源,可在GitHub获取。
ChatGPT桌面应用内置浏览器和ChatGPT Sites新增对WebMCP的支持。兼容网站可自动使用WebMCP完成任务。更新至最新版本后,通过Codex创建WebMCP应用并部署到Sites。
Amazon OpenSearch Service新增MCP Apps功能,提供与AI智能体文本响应的交互式可视化。通过本地运行的单一MCP服务器,智能体可在一次对话中从警报追踪到日志再到根本原因,并在IDE内验证每一步,无需离开开发环境。
OpenAI宣布Build Week获奖项目,八位获奖者展示使用Codex完成的作品。
OpenAI首席财务官Sarah Friar阐述了芯片、计算、模型和产品方面的进步如何协同作用,以更大规模、更低成本提供更有用的智能。
中国AI模型快速缩小与美差距,清华大学等高校人才网络、开源技术、人才回流和高效算力共同推动。智谱AI、月之暗面、DeepSeek等研究者构成重要力量。中美AI模型能力差距已缩小至数月。
@NVIDIAAI 研究副总裁ctnzr分享专用教师模型愿景,助力研究者加速创新。完整视频链接见下文。
第11届世界机器人大会在北京亦庄举行,数百家公司展示了机器人实际应用,同时闭门会议讨论了具身智能的分歧技术路线。
离散扩散模型提供了一种并行更新的替代方案,但其采样效率取决于前向过程和采样器的选择。本文提出了一种基于留一法去噪器的第一阶采样器,适用于均匀和重遮蔽过程,其坐标更新可并行进行。通过建立自适应采样保证,证明了在满足误差要求的情况下,所需的离散化步骤数量与目标分布的内禀依赖结构相关,而非环境维度。实验验证了这一理论预测的行为。
KellyBoost 是一个单多输出 XGBoost 模型,其 softmax 输出是投资组合;训练损失是负对数增长率,拟合模型是条件于特征的成长最优(凯利)分配;目标函数是精确的,而非代理:我们导出梯度、解析对角 Hessian 和完整 Hessian,并通过有限差分验证它们,并提供一个无依赖的参考引擎。
提出局部蒸馏方法,通过黑盒教师模型指导线性学生模型,提高预测准确性并保持可解释性;在17个基准数据集上,局部蒸馏接近教师模型的准确性,同时生成稀疏线性模型;在高维癌症基因表达数据中,识别出使用不同基因的患者亚组,这是全局线性模型和黑盒模型难以实现的。
TANGO模型通过跨token门控残差更新替代了传统的Transformer块,在FineWeb-Edu、Lean和DeepMind Mathematics等基准测试中表现出色,与WANGO模型相比,在序列长度线性复杂度下计算效率更高。TANGO和WANGO均优于Recurrent和Untied Transformer++、full-attention GAU和FLASH模型。
Alibaba introduces a new approach to long-running agents, treating context management as a programming task. It uses an append-only event log and a persistent Python kernel, achieving high scores in LongMemEval_S, BEAM_10M, and LOCA_256K. Paper available at arxiv.org/abs/2608.21690.
Gradio 提供了构建、运行和部署 AI 工作流的工具,支持多种模型和框架,简化了 AI 应用开发过程。Gradio 3.0 版本增加了对 PyTorch、TensorFlow 和 Hugging Face Transformers 的支持,并优化了用户界面。
@Sumanth_077分享长时运行Agent的关键在于运行时——Agent Harness。文章以TrueForge上的研究型Agent为例,详细解析了长时运行的运行机理,包括执行循环、MCP与渐进式披露、Skills规程与能力分离、Sandbox执行与上下文隔离、上下文管理、子Agent、审批门和事件流等。
@addyosmani 发布Web质量审计Skill,基于Lighthouse,涵盖性能、可访问性、SEO等五个维度,提供五步工作流程和四大设计理念。
本文深入探讨上下文工程,解释其如何决定 AI Agent 能力上限,并从 API 消息结构出发,逐层深入上下文工程的各个维度。强调上下文质量对 Agent 能力的决定性作用,并指出上下文工程是开发高效 Agent 的关键所在。
研究人员测试了20个生产智能体配置的上下文压缩效果,Claude Code 在Sonnet 4.6上压缩后保留53%的安全规则,五轮后降至10%。通过知识分类和保留策略,改进方案能保留2到4倍的安全规则,五轮召回率96%。