AI 自动化科研终于有了可复现的实例——Recursive 的系统自己写代码、跑实验、拿 SOTA,做 AI 研究的团队值得看看这种“AI 做 AI 研究”的范式是否可行。
GPT-5.5 排名第二,智能体持久化成新趋势
2026年6月12日,AI 领域在长上下文训练、智能体扩展和开放式研究上取得显著进展。Together AI 的 Untied Ulysses 方法让单节点训练 3M 上下文成为可能,降低长上下文门槛。GPT-5.5 (xHigh) 在 Agent Arena 排名第二,仅次于 Anthropic 的 Claude Fable 5,OpenAI 还收购 Ona 为 Codex 智能体提供持久云桌面,强调企业级智能体环境。Recursive 开源的自动化发现系统实现 AI 自主 SOTA,而 xAI 推出 Grok Build 插件市场 和 Perplexity 的 Search as Code 架构分别扩展了模型作为平台和搜索新范式。贝佐斯的 Prometheus 获 120 亿美元融资,旨在打造通用工程 AI,显示资本向实体智能体倾斜。
模型发布/更新
4 篇做智能体开发和 AI 评测的团队值得关注——GPT-5.5 在用户满意度和故障恢复上反超 Claude,说明 OpenAI 在实用场景上有了实质提升,建议直接去 Agent Arena 跑跑自己的任务。
Nemotron 3 的架构创新直击大模型推理效率瓶颈,做模型优化和部署的开发者值得关注其混合 Mamba 和潜在 MoE 的具体实现,可以直接参考其设计思路。
产品发布/更新
8 篇做硬科技、制造业或AI基础设施的从业者值得关注——Prometheus试图用AI把实体产品的设计周期从10年压缩到1年,这直接关系到未来工程研发的效率革命。
企业团队终于有了让 AI 智能体安全、持久执行复杂任务的方案——Codex 结合 Ona 解决了跨设备、断点续传和权限管控的痛点,做 DevOps 或自动化测试的开发者值得关注。
Perplexity 用代码驱动搜索的方式解决了传统深度研究效率低、泛化差的问题,做信息检索或研究分析的团队值得关注这一新范式。
Grok Build 插件市场让开发者无需离开终端就能接入 MongoDB、Vercel 等常用工具,做全栈开发或 DevOps 的团队可以直接用起来,省去切换上下文的麻烦。
Claude Code 重度用户终于不用再被模型选择器迷惑了——Opus/Sonnet 现在正确显示,背景会话的诡异环境变量问题也修了,建议所有使用 Claude Code 的开发者更新。
苹果终于把 AI 壁纸做进系统了,iPhone 用户不用再手动裁图或找第三方工具,直接在图乐园里输入描述就能生成适配屏幕的壁纸。喜欢个性化锁屏的 iOS 用户值得一试。
Claude Fable 5 的主动调试能力让开发者省去大量手动操作,做前端或全栈开发的团队值得看看它如何自主完成从分析到验证的全流程。
行业动态
8 篇想了解 AI 行业顶级团队如何构建技术壁垒和商业飞轮的读者,这篇快速梳理了 Anthropic 的核心优势,看完会对这家公司的战略有清晰认知。
OpenAI 通过收购补齐了 AI 智能体在生产环境中的安全执行短板,做企业级 AI 部署的团队值得关注——Codex 将能更可靠地处理长时间任务,且安全性有保障。
苹果这项低温铝回收专利解决了传统回收能耗高、杂质难除的痛点,做材料回收或关注消费电子环保的团队值得关注,直接关系到未来iPhone和MacBook的可持续制造。
数据中心冷却问题正制约 AI 算力扩展,Ferveret 的方案直接提升 token 产出效率,做 AI 基础设施或大模型部署的团队值得关注这一突破。
奥尔特曼亲自赴韩谈合作,说明 OpenAI 正在加速亚洲市场布局,做 AI 应用集成或关注大模型落地的团队值得关注——Kakao Talk 整合 ChatGPT 可能成为 AI 社交的标杆案例。
芯片巨头带头引入 Copilot 和 ChatGPT,说明 AI 办公工具已进入严肃生产环境。做企业数字化转型或 IT 决策的读者,可以关注其安全评估与分阶段落地的策略,作为内部推广的参考。
Homebrew 6.0.0的tap信任机制和Linux沙箱支持直接提升了包管理安全性,macOS和Linux开发者值得立即升级。Niantic事件揭示了游戏数据被用于军事的伦理雷区,关注隐私和AI伦理的读者不容错过。
AI 从业者和关注 AGI 风险的人值得一看——Amodei 点出了 AI 能力跃迁的关键拐点,而 Claude Code 创作者的真实感受让讨论更有分量。
论文研究
5 篇形式化证明领域终于有了计算高效的实用方案——4B 模型就能超越 671B 巨无霸,做定理证明或形式化验证的团队可以直接用,省下大量算力成本。
长上下文训练一直是显存大户,Untied Ulysses 让单节点就能跑 3M token,做 LLM 训练和推理优化的团队值得关注,能省下不少 GPU 预算。
这项研究解决了 AI 自我改进依赖人工调参的瓶颈,做自动化 Agent 或模型微调的团队值得关注——SIA 的 LoRA 更新思路能低成本让模型学会任务模式,比只改提示更有效。
技巧与观点
5 篇做 AI 编程或 Agent 工作流的开发者,终于有了一个可落地的「需求→实现→校验」闭环方案,Warp 开源了三个 Skills 可以直接用,建议试试。
想用好 Claude Fable 5 的开发者,这篇首日 playbook 帮你避开贵又慢的坑,直接复制社区已验证的工程模式,值得收藏。
做 AI 编程或自动化任务的团队,用 Claude Code 成本高?加个 MCP 服务器就能省 60%,建议直接试这个方案。