8月8日
11:31
11:31官方账号Greg Brockman@gdb
ARC Prize团队重新测试了OpenAI的GPT-5.6 Luna,在ARC-AGI-2上取得59.6%准确率,每任务成本0.18美元。在ARC-AGI-1上取得90.7%准确率,每任务成本0.07美元。降价后新结果与原始性能一致,而成本降低了80%。这一价格性能比在推理模型中相当少见。
事件专题

推荐理由:ARC Prize实测了降价后的GPT-5.6 Luna,性能没缩水,跑一次ARC-AGI-2只要0.18美元,性价比确实猛。
08:59
08:59官方账号Pika Labs@pika_labs
Pika Labs发布Seedance 2.5,声称其通过AP物理和研究生物理测试。官方用视频展示模型对物理规律的理解能力。同时Pika API Club提供最高88%的折扣,吸引开发者试用。该模型主打视频生成中的物理准确性。
推荐理由:Pika的新视频模型Seedance 2.5声称物理考试都能过,现在API还打88折,想玩视频生成的可以试试。
08:35
08:35宝玉@dotey
85°
OpenAI CEO Sam Altman 在 X 平台表示,新模型 Astra 功能强大,团队正努力让它广泛可用。Altman 称不会把 Astra 只给少数人,但因涉及网络攻击能力,需要更长时间确保安全。目前 Astra 的发布时间和具体版本尚未公开。
事件专题

推荐理由:Altman 亲口说 Astra 不会只给少数人,但要先搞定安全。想抢先体验 GPT-6 系列的话,可以盯紧这条。
04:29
04:29官方账号Simon Willison@simonw
Simon Willison用GPT-5.6 Sol Ultra在Codex Desktop里重做了他的Raccoon Heist游戏,生成的《Moonlight & Mayhem》比他先前用Claude Fable 5做的版本更好。新版本让一队浣熊潜入博物馆,目标是偷走Golden Sardine。Simon在推文中发布了实际游玩视频。
事件专题

推荐理由:Simon用GPT-5.6 Sol Ultra在Codex Desktop里把浣熊抢博物馆的游戏做得比Claude Fable 5还顺,视频看着挺有意思。
03:16
03:16官方账号Greg Brockman@gdb
85°
OpenAI 对下一代模型 Astra 的评估显示,其在智能体编码和网络安全任务上能力显著提升。依据 Preparedness Framework,OpenAI 将 Astra 视为首个“关键”网络安全模型,并增加额外安全控制。OpenAI 计划在安全准备工作完成后让 Astra 广泛可用,并将高级网络能力提供给防御者。
事件专题

推荐理由:OpenAI 刚透露下一代模型 Astra 在智能体编程和网络安全上能力大涨,还把它定为首个“关键”网络安全模型,安全措施也升级了。
00:43
00:40
8月7日
23:44
23:44lmarena.ai@lmarena_ai
Frontend Code Arena 的完整排行榜页面位于 arena.ai/leaderboard。Frontend Code Arena 展示前端编码场景下的模型排名。arena.ai/leaderboard 是官方公布的榜单入口。访问 Frontend Code Arena 可查看完整排名。
事件专题

推荐理由:想挑个会写前端的模型?去 Frontend Code Arena 榜单看排名就行,入口在 arena.ai/leaderboard。
23:43
21:44
21:44Recraft@recraftai
Recraft V4.1 官方样张主打微距细节,涵盖水滴、花瓣纹理和昆虫皮肤。近距离查看时,锐利区域和柔和虚化过渡层次分明,没有常见的蜡质 AI 感。V4.1 对自然材质的渲染更接近真实,适合高放大倍率的特写生成。

推荐理由:Recraft V4.1 出了,微距样张很能打,水滴、花瓣、虫皮都自然,不像一般 AI 图那种塑料感,做特写图可以看下。
19:41
19:41The Rundown AI@therundownai
The Rundown 今日AI要闻汇总:AI系统已能从头设计可工作的病毒。Anthropic解决了《Fable 5》最大的问题。Lovable 宣称可以把任意想法变成AI驱动的网站。Rowan's Corner 则提出最好的AI用例并非来自实验室。
事件专题

推荐理由:今天有AI造病毒、Anthropic解Fable 5难题,还有Lovable帮你搭站,都别错过。
19:14
16:16
16:16Geek@geekbb
Alec Fong 在单台 GB300 DGX Station 上部署 DeepSeek V4 Flash,测得聚合峰值吞吐 1875 tok/s,单流 300 tok/s,128k 上下文下首 token 延迟 5 秒。推文感叹能在家部署该模型的人相当于 80 年代万元户,令人羡慕。
事件专题

推荐理由:有人晒了 DeepSeek V4 Flash 在 DGX Station 上的实测数据,单机每秒能跑 1875 个 token,128k 上下文首字只要 5 秒,你可以拿这个数去衡量本地部署值不值。
14:40
14:40LovartAI@lovart_ai
Lovart 宣布接入 Seedance 2.5 Pro 模型,可直接生成 30 秒 4K 分辨率视频,无需后期拼接。模型支持最多 50 个参考素材用于锁定角色和场景一致性,并声称能实现逐帧级别的像素级控制。官方称这是 AI 视频生成的新阶段。
推荐理由:想用 AI 生成 4K 长视频的可以关注,Seedance 2.5 Pro 在 Lovart 上能一次出 30 秒,还支持 50 张参考图锁风格。
12:12
12:12官方一手歸藏(guizang.ai)@op7418
OpenAI宣布ChatGPT聊天改由GPT-5.6系列驱动。Plus和Pro用户可使用GPT-5.6 Sol,支持即时回答与深度推理。免费版和Go用户从明天起可无限使用GPT-5.6 Luna文本聊天,并有限次数使用Thinking。推文提到Luna实际体验“还行”,免费用户也值得一试。
事件专题

推荐理由:OpenAI把GPT-5.6拆成Sol和Luna,付费用户用Sol,免费用户也能无限聊Luna。想不花钱体验新模型的可以明天试试。
10:44
07:46
07:46官方账号Greg Brockman@gdb
Ethan Bloch在GPT-5.2上开展的个人财务AI实验获得良好结果。OpenAI的个人财务基准曾显示,从5.3到5.5版本有巨大提升,该实验如果今天运行成绩会更好。目前模型已推进到5.6,作者称虽无外部基准,但性能更优。
事件专题

推荐理由:OpenAI的人说GPT-5.6在个人财务上更强了,还有5.2的实验结果和5.3到5.5的基准对比,想了解AI理财能力的可以看。
06:40
06:40官方账号Simon Willison@simonw
精选
Simon Willison 在 X 上询问,ChatGPT 中的 GPT-5.6 Instant 对应 OpenAI API 的具体模型标识。这条推文已有 849 次浏览,但截至当前仍无官方解答。OpenAI 在 ChatGPT 与 API 之间的模型命名存在差异,开发者需要自行确认对应关系。
事件专题

推荐理由:OpenAI 模型命名总绕晕人,Simon 这条提问正好点破,想弄懂 ChatGPT 和 API 对应关系可以看下。
05:23
05:23官方账号Sam Altman@sama
82°
OpenAI发布GPT-5.6 Sol,为Plus和Pro用户在即时推理和深度推理中提供更准确、专注的回复。免费和Go用户从明天起可使用GPT-5.6 Luna的无限文本聊天。该更新旨在降低高级模型的使用门槛。
事件专题

推荐理由:OpenAI把GPT-5.6 Sol给了Plus和Pro用户,聊天更准了;免费用户明天起能无限聊Luna,值得试试。
04:46
04:46官方账号Perplexity@perplexity_ai
Perplexity发布新子代理Terra,专为复杂目标导向任务设计。在WANDR基准测试中,Terra得分比Sonnet高11分。同时,其运行成本降低了一个数量级。另一款子代理Luna则面向追求速度和成本效益的重复性工作流。

推荐理由:Perplexity出了两个新子代理,Terra跑复杂任务比Sonnet强11分,成本还省十倍,日常活儿可以交给Luna。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。