07:17官方账号Simon Willison’s Weblog(博客/媒体)精选Simon Willison 提出将文档所有历史版本打包为 JSON 数组,用 zlib 或 zstd 压缩后存进 SQLite 的 BLOB 列。他用 GPT-5.6 Sol Pro 构建原型,模拟 1,000 次修订生成 20.4MB 原始文本,经 Zstandard 压缩后仅 80.3KB。为避免每次编辑都解压重压整个数组,原型将历史拆成多行,每行最多 128 个修订或 3MB 未压缩 JSON。技巧SQLite压缩zstd推荐理由:Simon 晒了个 SQLite 存历史版本的压缩方案,用 zstd 把 1000 次修订从 20MB 压到 80KB,思路挺巧。原文稍后读已读值得跟进有用关注 SQLite
10:06官方一手arXiv: OpenAI@Carlo Iacono这篇论文审计了2025年7月18日至2026年7月17日期间40条实证记录,发现最新命名模型出现时中位年龄为281天(四分位距75-478天,范围11-939天)。其中25篇期刊文章的中位年龄为395天,14篇预印本为56天,1篇实验室报告为49天。35条记录包含已被取代的模型系列,仅7条提供了精确的日期标识符。论文将模型年龄与声明货币性区分开,提出六项报告实践,并展示了作者借助GPT-5.6 Sol Pro在两天内完成研究的反思性案例。论文GPT-5.6 Sol ProOpenAI模型评估1 个信源在谈事件专题推荐理由:这篇论文研究了AI模型评估结论过时的速度,发现模型发布后近一年结论可能已失效。如果你做AI评测或读评测报告,它能帮你判断证据是否还新鲜。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro
17:48Marc Andreessen@pmarca精选Edgar Dobriban利用GPT-5.6 Sol Pro在90分钟推理内,证明Benjamini-Hochberg(BH)过程在相关高斯双尾检验中无法普遍控制错误发现率(FDR)。通过一个高斯因子模型,在名义水平alpha=0.01时,实际FDR被证明超过0.0104。该问题自Benjamini和Hochberg(1995)提出以来已悬而未决近30年,论文引用超13万次。GPT-5.5在约20小时多智能体迭代中未能解决此问题。论文GPT-5.6 Sol ProBenjamini-Hochbergfalse discovery rate1 个信源在谈事件专题推荐理由:AI真的在推动数学进步了:GPT-5.6只用90分钟就找到了统计学里一个经典开放问题的反例,而5.5版本折腾20小时都没搞定。这篇报告值得所有关心AI科研能力的人看。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro
07:19官方账号Greg Brockman@gdb精选GPT-5.6 Sol Pro在prinzbench上取得91/99的成绩,基本饱和该基准。该基准包含两道从未被任何模型解出的问题(各值3分),排除后模型正确回答了93题中的91题。相比GPT-5.4 Pro的79/99和GPT-5.5 Pro的82/99有明显提升。prinzbench于2026年1月发布,仅5个月后被GPT-5.6 Sol Pro饱和,加速趋势显著。AI模型GPT-5.6 Sol ProprinzbenchOpenAI10 个信源在谈事件专题推荐理由:GPT-5.6 Sol Pro把prinzbench刷到91分,比前代高出一截,连从未解出的题都快能答了,基准加速饱和太明显。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro
14:04官方账号Greg Brockman@gdb73°Edgar Dobriban利用GPT-5.6 Sol Pro解决了统计学中一个开放问题:Benjamini-Hochberg(BH)程序在相关高斯数据下无法控制错误发现率(FDR)。该程序由Benjamini和Hochberg于1995年提出,被引用超13万次,但FDR控制仅对独立数据成立。尽管有多个猜想认为其对相关数据也有效,GPT-5.6 Sol Pro通过一个高斯因子模型(名义水平α=0.01,实际FDR>0.0104)证明了该猜想错误。模型经过90分钟推理一次性解决,而GPT-5.5在20小时内未能完成。论文GPT-5.6 Sol ProEdgar DobribanBenjamini-Hochberg1 个信源在谈事件专题推荐理由:AI帮你揭开了统计学25年的难题:GPT-5.6 Sol Pro用90分钟证明BH方法在相关数据下会失效,比人类20小时还准。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol Pro