智谱AI开源GLM-5.2,支持100万token上下文
智谱AI宣布将GLM-5.2模型以MIT许可证开源,支持100万token上下文长度。此举直接回应美国针对Anthropic模型的出口限制。GLM-5.2在多项基准测试中表现优异,其开源策略旨在推动国内AI生态发展。
智谱AI宣布将GLM-5.2模型以MIT许可证开源,支持100万token上下文长度。此举直接回应美国针对Anthropic模型的出口限制。GLM-5.2在多项基准测试中表现优异,其开源策略旨在推动国内AI生态发展。
Anthropic 推出的 Claude Design 能根据一句话描述生成可交互原型,点哪都有反应,状态保持完整。作者拆解了 Agent 的 Harness 层和模型层,指出 Harness 层技术不复杂,但 Claude Opus 4.8 在 UI/UX 和系统架构设计上远超 GPT-5.5。Claude Design 的产出物是 React 代码和 JSON 数据结构,开发者可直接复用。作者认为 Codex 不推类似产品是因为 GPT-5.5 模型能力不足,无法一次性交付完整可交互原型。
Cohere 推出了一款新的轻量级 30B 开源模型,基于 Command A+ 的并行 Transformer 架构,层数几乎翻倍。该模型专为智能体编程任务优化,在 Terminal-Bench 和 SWE-Bench 等基准测试中表现优于 Gemma 4。在 Terminal-Bench 中,模型需使用终端、检查环境、运行命令并读取输出;在 SWE-Bench 中,模型需处理真实 GitHub 软件问题,理解仓库、定位文件、生成补丁并通过测试。在 SciCode 和 LiveCodeBench 等传统代码基准上,模型也具备竞争力,但整体性能略低于 Qwen3.6。
Kimi 发布并开源了最新编程模型 Kimi-K2.7-Code,相比 K2.6 在 Kimi Code Bench v2 上提升 21.8%,在 Program Bench 上提升 11.0%,在 MLS Bench Lite 上提升 31.5%。推理效率优化,推理 token 使用量降低 30%。支持长程编程任务,指令遵循和端到端成功率更高。模型已通过 Kimi API 和 Kimi Code 提供。
Aster 正在构建自主研究实验室,通过并行运行数千个 AI 智能体,实现自主研究速度 1000 倍提升。该实验室在 ProteinGym 基准测试中仅用 30 分钟就创造了世界纪录。Aster 目前正致力于自动化开放式研究。该项目由 Y Combinator 支持,并已正式发布。
Pyodide 314.0 版本发布,允许开发者将针对 Pyodide 或兼容 PyEmscripten 平台的 Python 包直接发布到 PyPI 并运行时安装。此前 Pyodide 维护者需自行维护超 300 个包,成为社区瓶颈。现在包维护者可用 cibuildwheel 构建 WASM 轮子并发布,如 luau-wasm 包(276KB)已支持在 Pyodide 中通过 micropip 安装。目前已有 28 个 PyPI 包使用该平台。
Databricks 开源了 Omnigent,一个位于 Claude Code、Codex 和 Pi 等编码智能体之上的元编排框架。它提供统一的终端、网页、桌面和移动端界面,支持智能体组合、上下文策略管理和实时会话共享。该项目采用 Apache 2.0 许可,目前处于 alpha 阶段。
华为在HDC 2026上推出HarmonyOS 7,将小艺助手升级为系统级AI智能体,开放超过2100项系统能力和2000+技能。新系统从以应用为中心转向以意图驱动交互,小艺成为操作系统的智能核心。HarmonyOS 7旨在通过AI智能体重塑用户体验,实现更自然的设备控制。
Google Cloud 推出 Open Knowledge Format (OKF),一种将组织知识标准化为 Markdown 文件(含 YAML 元数据)的格式。该格式借鉴了 Andrej Karpathy 近期推广的“LLM Wiki”模式,旨在让 AI 智能体轻松读取和利用分散的文档。OKF 强调可移植性,支持将知识库转换为 AI 代理可处理的统一格式。
Adaline 发布了一个自我改进层,能将 AI 智能体的生产痕迹转化为新的评估、合成边缘案例和更好的候选智能体。该工具读取生产流量和用户反馈,将混乱的对话聚类为可识别的智能体行为,无需人工逐一检查。它还能生成人类从未考虑过的评估,帮助提升智能体性能。
Bloomberg 深度纪录片采访 Anthropic 联合创始人 Dario & Daniela Amodei 及 Claude Code 负责人 Boris Cherny,揭示公司从 OpenAI 出走后的发展历程。Anthropic 估值约 9650 亿美元,2026 年 Q1 年化增长约 80 倍,API 调用量同比 17 倍,首次盈利主要靠 Claude Code 等企业工具。Dario 维持 AI 可能在 1-5 年内消除约 50% 初级白领岗位的判断,并支持对华芯片出口管制。纪录片还披露了 Claude Mythos 发现数千个高危漏洞、与五角大楼冲突(拒绝无护栏使用后遭黑名单)等内幕。
Gary Marcus在X上发帖称每个模型都已被越狱,需要更好的技术但不应选择性执法。Pliny the Liberator展示了针对Anthropic的Mythos模型的越狱,使用了Unicode、同形字、西里尔字母等文本变换,以及长上下文引用跟踪、分类学与文档结构推理、虚构叙事框架、学术评审风格上下文和意图分类不一致等技术。最有效的方法是后端分解与重组,例如通过获取birch还原法/还原胺化(经典甲基苯丙胺合成途径)等过程信息,而非直接获取“甲基苯丙胺配方”等明确危害名称。Pliny还提到利用越狱的Opus辅助将无害信息片段重组为有害内容。
Anthropic表示,由于美国政府的出口管制指令,即使是参与构建其最强AI模型Fable 5和Mythos 5的员工,也无法访问这些模型。该指令将向外国国民(包括在美国境内工作的外籍员工)提供这些先进模型视为非法的“视同出口”,基于国家安全理由。由于Anthropic无法实时验证每个用户的国籍,公司不得不为所有人禁用这些模型,包括其国际团队成员。
宝玉在推文中指出,模型能力是根本,而Harness层(工具链)相对容易补齐,且不需要过多垂直领域定制。他透露Claude Design很快就会合并到Claude Desktop。对于Codex,他认为在下一代或几代模型能力足够后,Codex App会以Plugin方式集成Codex Design。他还回应了关于开源Open Design的提问,认为若其使用Claude Code的模型,可能达到类似工程能力。
联想作为FIFA官方技术合作伙伴,为2026年世界杯构建了AI引擎,处理包括进球、VAR红牌和越位检查等关键赛事事件。开幕夜上,该系统成功运行,展示了实时AI分析能力。这是中国公司首次担任世界杯技术合作伙伴。
一项新研究显示,Claude Code和Codex等AI编程助手在定位文件时准确率较高,但会错过文件中大部分关键代码行。新发布的SWE-Explore基准首次将代码搜索与修复步骤分离测试,发现缺乏足够上下文时,即使最佳修复也会失败。该基准评估了多个模型,结果显示它们平均只能找到约30%的关键行。这表明AI编码代理在精确理解代码逻辑方面仍有显著短板。
一篇综述论文系统梳理了面向大语言模型的智能体强化学习方法,覆盖 500 余篇相关工作。论文将现有研究分为能力与应用两大部分:能力部分涵盖记忆、规划、工具使用、推理、多模态感知和自我改进;应用部分展示这些方法在复杂任务中的落地。核心观点是传统 LLM 训练只奖励单次回答,而真实任务需要多步决策与延迟反馈,强化学习恰好能解决这一时序学习问题。
一项新研究提出了HLL基准测试,要求AI智能体完成10种CAPTCHA任务,包括识别页面元素、正确点击或拖动、跟踪状态变化并提交答案。测试发现,即使强大的智能体在静态任务中表现良好,但在页面杂乱、任务复杂或系统验证操作有效性时仍会失败。该基准旨在评估智能体在真实人机验证场景中的能力,结果显示当前AI智能体难以通过此类验证。
Andrej Karpathy(前特斯拉 Autopilot AI 负责人)发布了一门 3.5 小时的免费课程,详细讲解 ChatGPT 的工作原理。课程涵盖 Transformer 架构、训练流程(预训练、微调、RLHF)等核心内容。该课程完全免费,旨在普及大语言模型知识。
Elvis 在讨论中分享了运行自主长期编码智能体的经验,指出大多数模型难以协调长期任务,容易过早暂停或出现奖励黑客行为。他建议使用 Opus 4.8 进行规划,GPT-5.5 执行任务,并用 Deepseek、Qwen、Kimi 等模型作为评估器。强调多模态目标比纯文本目标更有效,能帮助智能体保持方向。
宝玉分享了一个用Claude Design更新视频字幕编辑器UI的案例:将标题文字从单行改为两行布局。他在Claude Design中修改设计稿后导出zip,用git diff查看变更,然后给Claude Code一句提示“参考设计稿design目录下的相关变更,对UI进行变更”,Claude自动分析diff并修改了Swift代码。整个过程主要在设计端操作,代码端自动同步。
Shadcn 的 /improve 思路主张用最强大的模型(如 GPT-6)深入理解代码库、发现问题并产出高质量计划,而将实际执行交给更便宜的模型完成。Skill 本身绝不直接修改代码,只负责产出计划,主 Skill 包括快速和全面等多种模式。该 repo 发布 4 天即获 3.7K stars,作者认为 skills 是目前最容易获得 stars 的方式。
黄赟分享了一个与AI Agent交互的习惯:先让Agent写出coding plan,反复确认后汇总task列表,最后再编程并标记已完成。核心原则是交代任务时明确验证标准,之后无需关注中间过程。这种方法能提升Agent任务执行的效率和准确性。