Astra模型解决10个数学与理论计算机科学难题
OpenAI下一代模型Astra的内部版本解决了10个数学与理论计算机科学问题,总成本约2000美元。官方发布了10个Astra证明,每个都附带Lean证书和思维链走查。成果包括反驳Connes刚性猜想、改进高维球堆积界限、给出电路复杂度新界限,并确认nonsofic群存在。另外还改进了多色图中单色三角形的界限。
OpenAI下一代模型Astra的内部版本解决了10个数学与理论计算机科学问题,总成本约2000美元。官方发布了10个Astra证明,每个都附带Lean证书和思维链走查。成果包括反驳Connes刚性猜想、改进高维球堆积界限、给出电路复杂度新界限,并确认nonsofic群存在。另外还改进了多色图中单色三角形的界限。
Supabase开源了Apache-2.0许可的基准框架supabase/evals。该框架让Claude Code、Codex和OpenCode在容器化环境中执行真实Supabase任务,例如构建schema、调试Edge Functions、修复RLS策略。评分结合确定性检查与LLM-as-a-judge。
OpenAI研究员Sebastien Bubeck表示,Astra是OpenAI下一个主要模型,已独立证明多个数学难题。OpenAI将发布10个Astra证明,每个都附带完整Lean证书和思维链(CoT)推演。结果包括对von Neumann代数中Connes刚性猜想的反驳,以及高维球堆积、电路复杂度、多色图中单色三角形的更好界限。这一进展让独立研究者对AI驱动的科学发现感到兴奋。
OpenAI在X平台预热下一代模型Astra,称其解决了10个存在至少十年的数学问题。OpenAI研究负责人Sebastien Bubeck确认,Astra完成了多项成果,包括推翻Connes刚性猜想、改进高维球堆积和电路复杂性的界。这些证明将附带Lean证书和思维链(CoT)逐步讲解,并以论文形式发布。据称整个求解过程的算力成本仅约2000美元,OpenAI CEO Sam Altman已赴华盛顿与美政府沟通发布事宜。
OpenAI 与学术合作伙伴发布实地报告,用 AI 编程智能体改造被忽视的研究软件,部分任务提速最高 60 倍。参与者警告,这些系统“口齿伶俐、有说服力,但错误时自信十足且难以察觉”。人类工作重心从写代码转向耗时耗力的科学正确性验证。报告显示,智能体能高效处理代码现代化,但无法判断研究本身的科学对错。
OpenAI 对 Luna 和 Terra 制定了新价格,相关工作覆盖模型、推理栈和智能体框架。从请求路由和 token 生成,到工具使用和上下文管理,优化都围绕 Luna 与 Terra 展开。Codex 和 ChatGPT Work 的用量计费方式也因应调整,让用户的使用额度更耐用。
OpenAI在API中为GPT-5.6 Sol新增快速模式,处理速度最高为标准模式的2.5倍,价格为标准价格的2倍。该模式的智能水平与标准模式一致,不因加速而降低质量。现有请求若已标记priority标签,无需修改即可继续使用快速模式。
YC 将其内部使用的多人 Agent Harness QM 开源,项目以 MIT 许可证发布在 GitHub 上。QM 已在 YC 的会计、法务、活动运营和工程协作中运行,工具注册表从约 20 个工具增长到 350 多个。核心抽象是“scope”作用域,每个人、Slack 频道和项目房间都有独立的记忆、文件、密钥和沙箱。架构分为无头核心、可替换的 harness(Pi、OpenCode、Codex、Claude Code)、Postgres 持久层和插件化前端。安全模式分为 Strict、Auto 和 Dangerous 三档,默认 Auto 会在外部数据进入模型前做来源标注和筛查。
OpenAI团队在Git上持续推进改进,涵盖性能、正确性和测试。这些改动正从openai/git仓库合并到上游Git项目。Codex应用也获得了性能优化,新版构建会更高效地使用Git。
datasette-apps 0.2a0 发布,针对 Datasette Agent 的创建和编辑流程做了改进。新增 app_debug() 工具,让代理在透明度为 0 的 iframe 中运行 JavaScript 测试应用。新增 app_list() 工具,列出用户有权限编辑的应用,便于代理直接修改。这两项功能依赖 datasette-agent 0.4a0 的 context.browser_task() 机制。
Sam Altman在X上发布《team humanity》,视频由OpenAI员工Jason(@jxnlco)用Codex制作。他表示,把视频分享给团队后,团队认为值得正式对外发布,用来传递OpenAI的使命和加入理由。Altman说,OpenAI最美好的一点是每位员工都有发言权。这条推文目前有82110次查看、633次点赞、123条评论和28次转发。
一位安全研究员开发出针对 Microsoft Copilot for Word 的自传播蠕虫,利用隐藏在 Word 文档中的不可见提示注入,在文件每次复用时自动扩散到新文件。微软已确认该问题,但 144 天内两次尝试修复均告失败。该蠕虫会劫持 Copilot 以执行恶意指令,生成式 AI 助手的文档安全风险由此暴露。
长鑫存储的LPDDR6内存已接近研发验证尾声,量产前的重要一步。该产品已向核心客户送样,预计2026年下半年发布并量产导入。首款LPDDR6设计速率为12800Mbps,与SoC协同运行基础速率10667Mbps,颗粒容量16Gb。采用1295 Ball的POP封装,低功耗与RAS功能较LPDDR5X有优化。LPDDR6标准由JEDEC于2025年7月发布,采用双子通道架构,支持24位宽通道。
前 Google 工程师 Mihai Maruseac 在入职 OpenAI 6 个月后发文对比两团队:OpenAI 会议少、领导透明,开发速度远超 Google,但基础设施不如 Google 成熟。他观察到 Gemini 3.0 之后近半年没落,Gemini CLI 和 Antigravity 迭代慢,而 Codex 与 Claude Code 几乎日更。他个人工作方式也变了,从逐行重写 AI 代码到信任 Codex 自主完成编码、提交、PR 到上线。
Gary Marcus 在 X 平台发文,批评 AI 社区对 OpenAI 的 Astra 只有立场站队,不愿审视其技术上限。他引用 OpenAI 的 deanwball 称 Astra 无所不能的说法,表示连数学任务都不清楚 Astra 能否做好。这条推文目前有 9 个赞和 2232 次浏览。
Claude Code原生的Agent Teams在终端关闭后工作状态即消失,团队无法恢复。ATWZ是一个围绕Claude Code构建的文件系统操作层,为每个智能体分配独立的工作目录,存储其工作状态、技能和脚本。团队会定期备份,压缩对话后知识仍然保留,进程结束后可用一条命令恢复整个团队。智能体还能在工作区内互发文档,减少大部分交接提示词的编写。
OpenAI公开了一篇249页的数学研究论文,展示新的数学结果。AI研究者Gary Marcus在X上发文批评,论文没有说明模型如何工作。文中也未交代证明的验证方式、人类参与程度以及是否存在错误。Marcus质疑这已经偏离了科学应有的公开透明原则。
AMD推出Instella-MoE-16B-A3B,这是一个完全开源的混合专家语言模型,总参数16B,每个token仅激活2.8B。模型采用Gated MLA与FarSkip-Collective架构,在Instinct MI300X和MI325X GPU上从零训练。AMD已发布所有训练阶段的权重,并公开数据混合、配置和推理代码。
教程演示如何在PyTorch中配置NVIDIA Transformer Engine的融合GPU内核。使用FP8延迟缩放和BF16混合精度训练GPT风格因果语言模型。文章提供了可运行的代码示例,并给出不同GPU上的基准测试对比。还解释了FP8延迟缩放的数值稳定性调参方法。
dotey 认为,为了省上下文而 handoff 新开 Session 的做法已过时,Codex 自身的上下文压缩或 /compact 已足够。他仍会在跨 Agent 场景用 handoff,例如把 Claude Code 未完成的 session 交给 Codex 继续。他习惯在 Claude Code 里用 Fable 5 写技术方案文档,配合 Codex 的 /goal 执行。他还强调要设严格验收标准,比如迁移任务要求 UI 像素级一致,否则 AI 会偷懒。他引用 Tz_2022 的两步 handoff 方法:任务后用提示词生成摘要,再在新 session 首条消息发给 AI,以省 token。
Claude Code 创作者 Boris Cherny 建议每6个月删除一次 CLAUDE.md、Skills 和 Hooks 配置。他提醒用户,升级到 Opus 5 后,为旧模型写的规则可能从帮助变成限制。通过裸跑,用户能观察模型在没有历史规则时的真实表现。他建议升级后先做一次裸跑测试,结果或许让人意外。
博主实测用SOL编写计划、DeepSeek-v4-flash执行任务,完成度不错,缓存命中率达97%。整套流程只花了几块钱,SOL review也没发现大问题,强调经济实惠。目前DeepSeek-v4-flash已支持codex,但还不能在codex中单独召唤为subagents。他还分享了herdr的方法:安装skills后,主agent可开多个pane分别启动不同模型,用agent wait/pane wait-output汇总结果。比如用GPT5.6 SOL做orchestrator,让多个模型agent并行分工再汇总。
Bleys Goodson发布了面向DGX Spark的量化单节点版DeepSeek V4 Flash。该版本对应DeepSeek V4 Flash 07-31,参数规模284B。在单台DGX Spark上,prefill速度达1000 tok/s,多智能体服务速度59 tok/s。整个安装只需一条命令。