VOL.2026.08.02·69 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月二日 星期日DAILY · 每早八时
01

模型发布/更新

Model Releases
5

OpenAI Astra将发布10个数学证明,含反驳Connes刚性猜想

X·KOLX:elvis (@omarsar0)原文 ↗

OpenAI研究员Sebastien Bubeck表示,Astra是OpenAI下一个主要模型,已独立证明多个数学难题。OpenAI将发布10个Astra证明,每个都附带完整Lean证书和思维链(CoT)推演。结果包括对von Neumann代数中Connes刚性猜想的反驳,以及高维球堆积、电路复杂度、多色图中单色三角形的更好界限。这一进展让独立研究者对AI驱动的科学发现感到兴奋。

OpenAI预热新模型Astra,攻克10个十年未解数学难题

官方一手X·KOLX:歸藏(guizang.ai) (@op7418)原文 ↗

OpenAI在X平台预热下一代模型Astra,称其解决了10个存在至少十年的数学问题。OpenAI研究负责人Sebastien Bubeck确认,Astra完成了多项成果,包括推翻Connes刚性猜想、改进高维球堆积和电路复杂性的界。这些证明将附带Lean证书和思维链(CoT)逐步讲解,并以论文形式发布。据称整个求解过程的算力成本仅约2000美元,OpenAI CEO Sam Altman已赴华盛顿与美政府沟通发布事宜。

AI 编程智能体可现代化研究软件,但无法判断科学正确性

官方账号X·KOLX:Decoder (@Jonathan Kemper)原文 ↗

OpenAI 与学术合作伙伴发布实地报告,用 AI 编程智能体改造被忽视的研究软件,部分任务提速最高 60 倍。参与者警告,这些系统“口齿伶俐、有说服力,但错误时自信十足且难以察觉”。人类工作重心从写代码转向耗时耗力的科学正确性验证。报告显示,智能体能高效处理代码现代化,但无法判断研究本身的科学对错。

02

产品发布/更新

Product
5

YC 开源内部多人 Agent Harness:QM

X·KOLX:shao__meng (@shao__meng)原文 ↗

YC 将其内部使用的多人 Agent Harness QM 开源,项目以 MIT 许可证发布在 GitHub 上。QM 已在 YC 的会计、法务、活动运营和工程协作中运行,工具注册表从约 20 个工具增长到 350 多个。核心抽象是“scope”作用域,每个人、Slack 频道和项目房间都有独立的记忆、文件、密钥和沙箱。架构分为无头核心、可替换的 harness(Pi、OpenCode、Codex、Claude Code)、Postgres 持久层和插件化前端。安全模式分为 Strict、Auto 和 Dangerous 三档,默认 Auto 会在外部数据进入模型前做来源标注和筛查。

03

行业动态

Industry
5

长鑫LPDDR6接近研发验证尾声,预计2026下半年发布

官方IT之家原文 ↗

长鑫存储的LPDDR6内存已接近研发验证尾声,量产前的重要一步。该产品已向核心客户送样,预计2026年下半年发布并量产导入。首款LPDDR6设计速率为12800Mbps,与SoC协同运行基础速率10667Mbps,颗粒容量16Gb。采用1295 Ball的POP封装,低功耗与RAS功能较LPDDR5X有优化。LPDDR6标准由JEDEC于2025年7月发布,采用双子通道架构,支持24位宽通道。

从 Google 到 OpenAI:6 个月体验两个团队的巨大反差

X·KOLX:shao__meng (@shao__meng)原文 ↗

前 Google 工程师 Mihai Maruseac 在入职 OpenAI 6 个月后发文对比两团队:OpenAI 会议少、领导透明,开发速度远超 Google,但基础设施不如 Google 成熟。他观察到 Gemini 3.0 之后近半年没落,Gemini CLI 和 Antigravity 迭代慢,而 Codex 与 Claude Code 几乎日更。他个人工作方式也变了,从逐行重写 AI 代码到信任 Codex 自主完成编码、提交、PR 到上线。

04

论文研究

Research
3
05

技巧与观点

Tips & Takes
5

dotey:Codex 连续任务省 token,handoff 新会话已不如 /compact

X·KOLX:宝玉 (@dotey)原文 ↗

dotey 认为,为了省上下文而 handoff 新开 Session 的做法已过时,Codex 自身的上下文压缩或 /compact 已足够。他仍会在跨 Agent 场景用 handoff,例如把 Claude Code 未完成的 session 交给 Codex 继续。他习惯在 Claude Code 里用 Fable 5 写技术方案文档,配合 Codex 的 /goal 执行。他还强调要设严格验收标准,比如迁移任务要求 UI 像素级一致,否则 AI 会偷懒。他引用 Tz_2022 的两步 handoff 方法:任务后用提示词生成摘要,再在新 session 首条消息发给 AI,以省 token。

实测DeepSeek-v4-flash配合SOL与herdr完成大任务

X·KOLX:Viking (@vikingmute)原文 ↗

博主实测用SOL编写计划、DeepSeek-v4-flash执行任务,完成度不错,缓存命中率达97%。整套流程只花了几块钱,SOL review也没发现大问题,强调经济实惠。目前DeepSeek-v4-flash已支持codex,但还不能在codex中单独召唤为subagents。他还分享了herdr的方法:安装skills后,主agent可开多个pane分别启动不同模型,用agent wait/pane wait-output汇总结果。比如用GPT5.6 SOL做orchestrator,让多个模型agent并行分工再汇总。

69
今日事件
22
一手报道
26
新模型
28
信源
AITOP · 编辑系统自动生成