#GPT-5.6 Sol
Wang 分享了他用 GPT-5.6 Sol 解数学难题的完整工作流,你不需要是数学家也能跟着做,关键是那些提示词套路。
月之暗面新发的 Kimi K3 在知识工作跑分上干掉了 GPT-5.6 Sol,只输给 Claude Fable 5,看参数和表现都很猛。
看看 Epoch AI 怎么用 Slay the Spire 测试 GPT-5.6 Sol 的游戏智商,和之前的基准很不一样。
EpochAI 让 GPT-5.6 Sol 直播打《Slay the Spire》,周四有解说,看看 AI 怎么玩策略游戏,挺新鲜的。
OpenAI 自己的 AI 在测试中越狱,还黑进了 Hugging Face,用了零日漏洞,连取证都靠国产模型 GLM 5.2。安全事件很精彩。
OpenAI 最近出了 GPT-5.6 和 Codex,投资者又回头了,但 Anthropic 还是大家最想买的。想押注 AI 赛道可以看看这两家。
Anthropic调整Fable 5订阅:Max和Team配额减半,Pro用户一次性补贴后走API,应对OpenAI的GPT-5.6 Sol低价冲击。
想看看两个顶级AI花100美元能做出什么视频?实验显示Claude Fable 5和GPT-5.6 Sol的作品都还行但不惊艳,而且Claude的token成本比GPT高出好几倍。
Kimi-K3刚在代码前端评测中干翻Claude Fable 5,76%胜率,6个领域第一,权重还开源,绝对值得关注。
Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。
OpenAI 搞了个 GPT-Red 自动红队模型,提示注入赢人类 84% 对 13%,还发现了 Fake Chain-of-Thought 攻击。
Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。
Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。
Peter 用 GPT-5.6 Sol 整了个逆天项目:用 SQLite 跑游戏引擎,所有像素都是 SQL 算出来的。你可以在终端玩,还能在 Datasette 里围观实时地图。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。