OpenAI 称 LLM 在 7 个千禧年难题中的 4 个上有实质进展,连 Claude Opus 都来背书,但结果还得通过验证,这条帮你理清边界。
#Claude Opus
X 上有人盘点两家实验室的模型命名梯度,把 Anthropic 的传闻新模型 Mythos 拿来和 OpenAI 的 Luna/Sol 对比,看个热闹。
Mistral 的新模型 Mistral Large 4 在 WebDev 榜单一口气从130名冲到45名,价格只有 Claude Opus 4.8 的六分之一,10月底还会开源权重,可以蹲一下。
Anthropic 把最强的 Claude 模型开放给审核过的安全团队挖漏洞,半年挖出 13 万多个,还分了三个权限层级,搞安全的可以关注怎么申请。
有人用 Opus 做了个上下五千年视频,本地 TTS 效果太差,准备换成 Gemini 3.8 TTS,想搭类似工作流的可以看看。
作者踩坑实录:DeepSeek Flash 修 bug 总是新旧交替,换 Opus 5.5 整体重构。选模型不只看跑分,工程里这种对比很实在。
OpenAI的GPT6-Astra评测曝光,编程能力与Claude Opus 5相当,但价格涨2.5倍,因效率提升实际成本反而降一半。
GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。
研究人员搞了个叫OenoBench的葡萄酒知识测试题库,用这个题库测了16个大模型,发现o3考得最好,DeepSeek R1在推理题上表现突出,还发现模型对自己出的题有偏好,挺有意思的。
智谱新出的GLM-5.2 (Max)在前端代码测评里拿了开源第一,总分第2,把Claude Opus 4.7甩开29分。写前端的可以关注下。
作者做了两个PPT skill,经验很实在。他说Claude Opus做HTML比GPT好看,还对比了不同路线的优劣势,想省成本又出效果可以看看。
Anthropic 这次把 Opus 和 Sonnet 的语音模式开了,以前只有 Haiku 能用,现在能跟更强的模型聊复杂问题,还能让它帮你整理方案、改行程,支持多国语言,挺实用的。
Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。
有人把整个Firefox编译成了WebAssembly,能在Chrome里跑另一个浏览器,用Claude辅助编程才搞定的,超级酷。
想省API预算又不想牺牲架构质量?试试这个:让Claude Opus/Fable做主设计,Sonnet/Haiku干苦力,自动分配任务,省心又省钱。
这个基于DeepSeek V4的终端agent超省钱,修7个bug才1块零7分,比Claude Opus便宜30倍,编码体验还接近Claude Code。
HTML 设计排行榜上 GLM-5.2 干掉了 Claude,现在就能用 SiliconFlow 的 API 上手,写网页贼快。
AI 写代码的安全性问题一直让人担心,这个案例证明只要加固流程到位,AI 生成的复杂系统也能通过专业审计。做 AI 安全或代码生成的团队值得看看他们的方法论。
做 AI 研究和智能体开发的团队会看到,坚持比聪明更重要——AutoLab 的发现直接点出了当前智能体在长任务中的致命弱点,值得反思自己的智能体设计。