#推理模型
Claude Opus 5 性能直逼旗舰 Fable 5,价格只要一半,多个基准全面碾压 Opus 4.8,开发者可以立刻用上。
Vercel 把 Claude Opus 5 集成进了 AI Gateway,还加了快速模式,编程和低推理成本场景下比上一代 Opus 更强。想用最新 Claude 写代码的可以试试。
Anthropic刚发Claude Opus 5,性能比4.8强不少,还在测试中赢了Fable,价格却只要一半,值得关注。
Anthropic 发了 Opus 5,性能更强但没涨价,还有快2.5倍的加速模式,适合既要速度又要质量的人。
蚂蚁新出的Ling-3.0-flash用124B参数(仅激活5.1B)就打平了1T的旗舰模型,还能支撑复杂Agent任务,现在免费试用,8月3日后开源,别错过。
用VirtualSet替代SQL,让LLM查询出错时提前报类型错误而不是给假结果,BIRD上还比SQL高4个点,很适合做安全决策。
想省token跑agentic任务?试试Ling-3.0-flash,124B参数只激活5B,OpenRouter上免费到8月3日。
AMD 亮出真家伙:MI455X 堆了 432GB HBM4 和 3200 亿晶体管,FP4 算力比上代快 4 倍,72 卡显存比英伟达 Rubin 多一半,直接对标 NVL72。
花5美元用托管RL把Nemotron 3 Nano的数学准确率从22%拉到91%,还能一键扩展到更大模型,太实用了!
Poolside的Laguna S 2.1是个118B参数的稀疏MoE模型,只激活8B参数,SWE-bench多语言拿下78.5%,还能跑在单个DGX Spark上,适合长时编程任务。
Apodex 1.0-H 让智能体团队协作处理复杂任务,还用独立验证提升准确率。每月10万算力补贴,研究机构别错过。
阿里云用真武 M890 跑通了 2.4 万亿参数的 Qwen3.8,显存 9TB,推理性能还提升了 1.5 倍,国内头一个做到的。
Anthropic 给 3.6 Flash 做了针对性更新,专攻真实世界的智能体任务,不是刷推理榜单。看它实际干活行不行。