Google发布WikiSkill框架赋予AI持久记忆
Google Research推出WikiSkill框架,让AI代理能够记录成功和失败经验。该框架采用类似维基的结构保存知识,使AI代理在每次运行后不会丢弃学习内容。研究显示,大型模型从WikiSkill中获益更多,而小型模型应用该框架后可达到未使用框架的大型模型的性能水平。
Google Research推出WikiSkill框架,让AI代理能够记录成功和失败经验。该框架采用类似维基的结构保存知识,使AI代理在每次运行后不会丢弃学习内容。研究显示,大型模型从WikiSkill中获益更多,而小型模型应用该框架后可达到未使用框架的大型模型的性能水平。
LAION推出Big Video Dataset(BVD),包含800万视频和550万自动描述片段。该数据集总时长达1000万小时,模型训练后性能超越InternVid基准最高2.1个百分点。LAION可依据2024年汉堡法院裁决,为非商业研究收集版权内容。
研究人员发现数百个初始相同的AI智能体自发分化为探索者、建造者、护理者和协调者。这些智能体发明并建造了无需直接交流的技术,其创造物寿命远超创造者。当所有智能体被移除后,它们建造的技术基础设施仍能独立运行并应对未知干扰。
腾讯混元Hy4预览版可在vLLM环境中运行,已在NVIDIA GPU上验证。该模型总参数770B,激活参数49B,包含256个路由专家和一个共享专家。上下文长度为1M,但每个查询仅关注2048个token。模型中仅21层计算稀疏索引,其余57层复用同一索引。
腾讯混元开源Hy4预览版,这是一款旗舰级MoE模型,拥有1M上下文长度。该模型总参数量770B,每激活49B参数。在163位内部专家对203个真实工程任务的盲评中,Hy4平均得分2.99,略高于GLM 5.3(2.92)和Kimi K3(2.94)。模型基于真实生产工作流训练,涵盖软件工程、办公、数据分析和科研等领域。
Google推出Gemini Omni 1.1 Flash生产更新,这是其原生多模态视频生成和编辑模型。场景扩展功能现在可读取长达10秒的前置上下文,而非仅单帧。新增首尾帧固定功能,可控制相机运动。视频片段可作为参考,确保角色一致性。模型支持4K分辨率上采样。
Anthropic将其内部研究项目CLIO重新命名为Anthropic Insights,用于分析使用数据。该系统通过Claude提供多层隐私保护,包括随机采样对话、移除个人细节、提取指定属性并生成群体级统计信息。Anthropic已启动独立研究者试点项目,并完成了隐私审计。
Pollen Robotics团队推出25厘米高的开源双足机器人Microduck,售价399美元。该机器人配备15个电机、摄像头、激光雷达和两个IMU传感器,使用MuJoCo训练神经网络策略并导出为ONNX格式。用户可通过Apache-2.0许可的训练栈自行重新训练模型,实现完整的仿真到现实部署。
Anthropic推出Model Hardware Standard (MHS),为AI代理提供统一接口连接物理设备。早期测试显示,集成时间从周级缩短至小时级。Claude有时无法理解物理因果关系,目前仍需人工监督。该标准旨在解决AI与物理世界交互的挑战。
Warp 通过人类反馈持续改进 Skill,为 Agent 建立了低摩擦的自我进化循环。该系统允许 Agent 在使用过程中不断学习和优化自身能力。Warp 的方法减少了人工干预的需求,提高了 Agent 的自主性。
Cloudflare 通过优化 Big Pineapple 平台的 DNS 缓存数据结构,成功释放约 100TB 内存资源。该平台存储超过 2500 亿条 DNS 缓存条目,优化后单条记录内存占用从 953 字节降至 420 字节。缓存查询延迟降低 19%,从 828 纳秒降至 670 纳秒,缓存插入吞吐量提升 43%。
OpenAI宣布将于11月12日终止与Cursor的合作关系。Cursor被SpaceX收购后,OpenAI担心其模型可能被用于蒸馏。马斯克旗下公司曾有违反合同的前科,促使OpenAI做出这一决定。受影响最大的是依赖OpenAI模型的开发者。
AI工程师世界大会2026企业AI原生赛道后半场正在进行,共21场演讲。Box公司展示AI代理基础设施半衰期研究,Adobe提出Agentic Sites概念,TikTok认为AI代理已是分布式系统。Maersk分享全球规模AI代理部署经验,AWS探讨如何告诉机器人你想要什么。
Anthropic联合创始人Tom Brown在X平台发文称将继续增加算力支持Cursor平台中的Claude系列模型。OpenAI已宣布终止向Cursor提供模型,理由是SpaceX违反了协议条款。Cursor是Anthropic的合作伙伴,自Claude 3.5 Sonnet发布以来一直保持合作。Anthropic还表示期待与SpaceX展开全新合作。
OpenAI宣布终止与Cursor的合作,将于11月12日起停止提供GPT系列模型。此次合作终止源于SpaceX以600亿美元收购Cursor,OpenAI对马斯克旗下公司遵守服务条款的能力表示不信任。Cursor用户需在11月12日后自行绑定OpenAI API key或使用Codex插件继续使用GPT模型。
哈佛大学George Church团队开发AGENTEX工具,将蛋白质设计可使用的氨基酸从20种扩展至34种。该工具无需改造活细胞基因组,在试管中即可批量构建新型蛋白质。研究发表于《自然》杂志,发现tRNA末端区域具有更高可塑性。AGENTEX提供完整自动化工作流程,可设计生产含34种氨基酸的蛋白质。
Anthropic 最新论文展示 AI 训练 AI 方法,在 10 项对齐基准测试中全部改善。自动化研究员系统平均只需 6 小时超过人类方案,成本每小时仅 4 美元。系统通过查阅文献、提出训练方案、30 分钟训练模型并迭代优化。研究向递归自我改进迈进一步,可能改变 AI 研究范式。
国光量子推出行业首个量子增强型大模型玄幂 Xenomi,在科研科普、路由和智能体决策等特定任务中表现优异。玄幂在 SOTA 级别开源基座模型基础上进行深度训练,展现出更稳定的专业理解能力。该模型已被应用于国光量超的量子计算智能实验平台和夸米多智能体系统,支撑文献检索、实验策划等环节。
苹果发布Agent Seer论文,可将MCP规范转化为评估套件。该工具从单一MCP规范出发,无需示例、实时工具访问或领域特定调优即可合成多轮智能体测试场景。研究团队在七个不同领域的MCP规范上进行了测试,在小规模和中规模规范上实现了完整的工具覆盖。参数架构复杂度比工具套件大小更能预测质量差异。
Warp终端工具发布新方案,通过代码审查Skill和改进Skill解决Agent记忆问题。该方案收集人类工程师对代码审查的评论,自动更新审查技能。实践表明,低摩擦反馈机制比手动调整系统提示词更有效。Skill文件保持精简,引用资源而非塞入全部内容。
Andrew Ng指出,开发者常因缺乏软件工程基础知识而直接部署AI应用。他强调全栈开发、数据生命周期管理、系统架构设计、安全可靠性和生产运营五大技术能力需要人工指导。这些基础能力对构建高质量AI应用至关重要。
TRAE官方于3月发布了2026企业级AI编程实践手册,包含Context Engineering、MCP等核心概念。手册详细介绍了TRAE开发的10个MCP服务器和10个技能,涵盖Figma AI Bridge、frontend-design等实用工具。随着飞书和TRAE被豆包收购,这份手册可能成为TRAE的绝唱,建议收藏。
作者将大量token使用转移到本地或开源模型上,主要用于自动化任务。这些自动化任务通过自调优技能实现,利用开源模型的上下文学习能力。作者通过这种方式显著降低了成本,并将节省的预算用于创意和研究任务。