NVIDIA Nemotron 3.5 Lightning 上线 SageMaker JumpStart
NVIDIA Nemotron 3.5 Lightning 已可在 Amazon SageMaker JumpStart 中部署。这是一款面向高并发智能体工作负载的开源模型,采用 30B 参数的 MoE 架构,其中活跃参数为 3B。该模型可提供最高 4 倍的吞吐量提升,以及最高 30% 更快的任务完成速度。开发者可通过 SageMaker JumpStart 一键启动部署。
NVIDIA Nemotron 3.5 Lightning 已可在 Amazon SageMaker JumpStart 中部署。这是一款面向高并发智能体工作负载的开源模型,采用 30B 参数的 MoE 架构,其中活跃参数为 3B。该模型可提供最高 4 倍的吞吐量提升,以及最高 30% 更快的任务完成速度。开发者可通过 SageMaker JumpStart 一键启动部署。
OpenAI 发布 GPT-5.6 Sol 的基准结果。在 ARC-AGI-3 任务上,得分从 13.3% 提升到 38.3%。同时输出 token 数量减少约 6 倍。OpenAI 称这一改进来自保留推理和压缩机制。该结果由 OpenAI Devs 在 X 平台公布。
房地产初创公司Hypha AI用GPT-5.6 Luna做文档提取,以GPT-5.5 1/18的成本保住了98%的准确率。金融研究公司RogoAI通过程序化工具调用抓取文件并分析数据,输入token减少21%且评估质量持平。该数据由OpenAI开发者官方账号发布。
Agent Arena 新增代码、工作、聊天三个分类榜单。代码榜第一是 OpenAI 的 GPT 5.6 Sol(xHigh)。工作榜和聊天榜第一均为 Anthropic 的 Claude Opus 5(High 和 Max)。该评测基于数百万真实长时程智能体任务,单次长会话成本可达数百至一千美元。
京东创始人刘强东宣布向全球伙伴开放全栈自研AI,称技术壁垒是一种剥削。京东上半年研发支出同比增长53.2%,将建设全球最大具身数据采集中心。公司开源EgoLive与JoyAI模型,并已在物流场景部署机器人。这些动作旨在构建从数据采集到机器人底座的物理AI开放生态。
在HyperAI主办的Meet AI Compiler沙龙上,华为AscendNPU IR架构师Hai Lijuan介绍了开源的编译器基础。该IR基于MLIR提供tile级抽象,连接LLVM IR,支持Triton等前端语言。它已扩展到Ascend 950,覆盖SIMD与SIMT指令集。开源后开发者可直接使用这一层编写和优化昇腾算子。
DeepSeek Harness v0.1 以 MIT 许可发布,采用开发者预览版。其核心设计是每个能力都是一个 Cordis 插件。支持四种运行时模式、追加式会话日志和与提供商无关的模型路由。这一架构让开发者能灵活组合功能。
Claude Code v2.1.234 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量,用于指定每会话配置目录的短名称。新增 selection:clear 键绑定操作,可清除应用内文本选择,并支持代理视图。为 GitLab 远程仓库添加合并请求徽章,经 glab CLI 认证后可显示 MR 的草稿/待定/绿色状态。在 claude.ai 用量限制重置后,Claude Code 会自动继续会话,可在 /config 中关闭。安全方面,远程文件读取、会话恢复等操作拒绝 Windows NT 命名空间路径,防范 NTLM 凭据泄露。
LangChain与AWS合作发布了AgentCore Payments中间件,让智能体在调用付费API时自动完成支付。当工具请求遇到402错误时,中间件会对照会话预算检查价格、签名支付并重试请求。每次支付记录都会同步到LangSmith,与触发支付的推理步骤关联,便于追踪智能体消费原因。该中间件旨在消除智能体调用外部服务的付费障碍,同时保留完整的可审计日志。
Origin 是 Cursor 自研的代码托管平台,定位为面向 AI Agent 的 GitHub。它在 Compile 大会上公布的数据显示,单仓库每秒可处理 22.6 次提交、每小时 29.6 万次克隆,全球同步延迟低于 400 毫秒,并内置 AI 驱动的自动合并冲突解决。该产品基于 Cursor 收购的 Graphite 团队技术,支持堆叠式 PR 管理,适配多个智能体并行开发。目前用户可从 GitHub 同步仓库开始使用,后续将逐步迁移更多托管功能。
第七届全国大学生计算机系统能力竞赛先导杯吸引160所高校超500支队伍、1900余名学生参赛。中科曙光(Sugon)通过国家超算互联网开放中国首个全自主10万卡AI超算集群。比赛设Qwen推理优化和气象模型部署两个赛道。参赛学生需在国产算力集群上完成模型优化任务。
404 Media 在 Biblio 上的一笔约 1000 本珍本书订单中放入 AirTag,追踪发现书被送到拉斯维加斯 LAS8 仓库的 VGT3 角。该设施入口有恐龙叼书的标志,亚马逊工人论坛讨论确认 VGT3 会破坏性扫描大量书籍。此前 Anthropic 在 2025 年 6 月也被曝出类似扫描行为。
Wispr Flow 完成 2.8 亿美元 B 轮融资,估值达 20 亿美元,由 Menlo Ventures 领投。公司同步预览首个自研语音模型 Canto,该模型为 2B 参数,针对嘈杂房间、刮风街道等真实场景训练。Canto 将用于改进 Flow 的听写功能,后续迭代版本也会陆续推出。这笔资金将投向产品、实验室、模型和团队建设,加速语音交互落地。
Scott Gray于2016年加入OpenAI,曾参与稀疏Transformer、Scaling Laws和GPT-3的研发,长期负责底层GPU系统。据Business Insider统计,OpenAI今年已有12位高层离职。这些十年老将的离开比普通高管更难替代。
Stripe技术与业务总裁Will Gaybrick在a16z访谈中称,AI代理会像蜂鸟一样在互联网上迅速采集数据和完成计算,取代人类逐个注册账号。他认为微交易是“代理经济”存在的必要条件,而稳定币让微支付成为可能,比如给代理设定预算后,它可将美元兑换为稳定币完成结账。Stripe内部已用AI代理:一周内编写了30%的代码,全球税务申报耗时仅为美国版的1/3。AI让销售效率提升20%后,Stripe反而增聘了更多销售人员。他还预测结账页面将消失,代币会像美元一样被保护。
北京大学、StepFun与北京邮电大学提出TensorCast,一种面向大模型基础设施的统一可编程张量生命周期管理抽象。在高并发多轮智能体场景中,TensorCast将中位首Token延迟最高降低93.2%。模型实例启动速度最高提升228.6倍。该方案由三所机构联合提出。
一篇论文分析了Agent技能的实际作用机制,基于8135条标准化试验记录发现,程序性锚定解释了65.7%的技能生效案例,显性知识注入只占4.5%。当技能池规模从5个扩大到100个,实际使用精度从29.6%下降到3.3%。在匹配对比中,技能方法比Workflow Memory高出6.06分,但在脆弱假设、不兼容上下文或适应不足时会失效。该论文发布于arxiv.org/abs/2608.14036。
GitSkills 是一个从 GitHub 上 282,200 个公共仓库中挖掘出的智能体技能数据集,包含约 380 万份 SKILL.md 文件。Anthropic 以开放规范发布 SKILL.md 格式九个月后,这些文件已经大量扩散。研究者将内容去重为 1,877,981 个不同条目,并打包成单个 SQLite 文件,附带 front matter、文件夹内容和提交历史。论文已在 arXiv 上公开,编号 2608.10906。
该论文针对Agent技能安装的痛点:现有56,804个公共技能竞争不到100个提示词触发槽位。论文提出将安装拆分为内容、持久化和自动触发三部分,只有触发需占用提示词。路径可指向任意技能或集合,读取即用;目录作为菜单,避免全有或全无。Vendoring可将技能复制进Git树。论文编号arxiv.org/abs/2608.12610。
法国科研团队将死后人脑组织外植体(OPAB)与机械手相连,训练其模仿弹奏LA、TI、DO三个音符。训练三天后,平均模仿准确率从31.22%提升至58.5%,其中3个样本实现100%正确。该系统构成感知、行动、再学习的闭环,验证了生物神经元用于混合AI的可行性。对照实验表明,突触阻断或病毒感染会显著削弱已形成的能力,证明是脑组织本身发生了可塑性变化。
这篇教程演示如何为OpenClaw代理接入Amazon Bedrock AgentCore支付。通过aws-agents-pay插件,代理可在x402协议下发起测试网支付,用于购买付费API、MCP服务器和网页内容。支付受预算限制并需人工批准,避免自主代理随意花钱。文章展示了将OpenClaw与Bedrock AgentCore连接的具体步骤。
Claude Code 成本由模型、输入输出类型和提示词缓存决定,其中输出 token 价格约为输入的 5 倍,thinking token 占输出大头。缓存读取仅 0.1× 价格,但切换 /model、/effort 或开启 Fast mode 会击穿缓存,导致全价重新 prefill。会话中读过的文件和命令输出会在每轮重复计费,第 40 轮需重读前 39 轮,长会话成本超直觉。建议任务间用 /clear、@提及文件省去 Read 调用、给命令加静默参数,并在缓存 1 小时过期前用 /compact 压缩。
这场工作坊围绕上下文工程展开,以开源AI导师为实例,讲解如何设计每次模型调用时看到的指令、历史、检索内容和工具输出。内容分三阶段:解决有限窗口和无状态模型两个根本问题,整理截断、修剪、摘要、卸载到文件等压缩工具,并覆盖跨会话记忆与按需技能加载。团队用Gemini测量了每次运行的token、成本、延迟和内存探针,而非主观评估。在真实负载下Gemini Flash成本偏高,因此他们测试了开源和本地模型是否能以更低成本匹配质量。所有实现均已开源,将在工作坊中分享代码和评估工具。
gregisenberg 提出 AI Agent 五要素测试:重复触发器、稳定输入、明确工具集、可衡量终点、中间需要判断力。前四条回答“能否自动化”,第五条区分 Agent 与普通自动化。以客户退款申请为例,边缘案例需判断力,因此适合用 Agent 而非规则引擎。
OpenAI开发者团队总结了初创公司用GPT-5.6构建智能体的实践经验。核心是通过更精准的模型选择、推理策略和工具调用降低Agent成本。团队发现,让模型在复杂任务中自主决定何时调用工具,能减少无效计算。这些经验来自多个行业的实际部署,而非实验室基准。