Anthropic 把 Haiku 升到 5.5,OSWorld 分数从 15.7 涨到 72.4,价格还砍了 90%,不过新 tokenizer 会多吃 token,实际省多少得算算。
#推理模型
Anthropic 新出的 Haiku 5.5,100k 上下文,比 Haiku 4.5 便宜 10 倍,跑批量任务的成本压力小多了。
Anthropic 放出了 Claude Haiku 5.5,比 4.5 便宜七成五,还能在 Agent Arena 里跑真实任务,去试试手感。
Anthropic 的 Haiku 5.5 来了,智力比一年前的 Haiku 涨了 26 分,价格还只有上代的十分之一,跑 agent 任务可以重点看看。
Anthropic 又发新模型了,Haiku 5.5 比 4.5 便宜 75%,跑批量任务可以直接用它,重的活留给 Opus。
Anthropic 的小模型更新了,Haiku 5.5 比 4.5 便宜约 75%,跑批量任务或对延迟敏感的应用可以留意下价格变化。
Anthropic 又发小模型了,Haiku 5.5 比上一代便宜 75%,价格追平 OpenAI 的 GPT-6 Luna,基准成绩还更胜一筹,跑大批量任务的可以看看。
Anthropic 的小钢炮 Haiku 5.5 上线了,AWS、Google Cloud、Azure 都能直接调,用哪家云都方便。
X 上有人盘点两家实验室的模型命名梯度,把 Anthropic 的传闻新模型 Mythos 拿来和 OpenAI 的 Luna/Sol 对比,看个热闹。
Anthropic 的新小模型 Haiku 5.5 来了,比 Haiku 4.5 便宜七成五,跑批量任务和高并发场景可以先试试。
Haiku 5.5 来了,10 万 token 以下比 Haiku 4.5 便宜 10 倍,跑工作流或 API 调用的成本直接打一折,可以试试。
三条推文都叫 looped transformer 但完全是三种方案,选错能烧掉一周训练,这篇用 Nanbeige 4.2 实测数据帮你分清。
Anthropic 家最便宜最快的模型来了,比上一代省 75% 成本,还能调推理强度,跑智能体和电脑操作任务的可以看看。
Gary Marcus 写了篇长文,把陶哲轩和他自己对 OpenAI 数学模型能力的看法放在一起对比,两派观点一目了然。
Claude 家最便宜的小模型升级了,成本砍到原来的四分之一,性能还逼近 Sonnet 5.5,能调 effort 很实用。
Anthropic 的 Haiku 5.5 价格跟 GPT-6 Luna 打平了,10 万 token 内输入只要 $0.10,选模型时可以对比看看。
想本地跑 Qwen3-TTS 流式语音的朋友看这个,部署配置和踩坑都帮你填好了,配合 vllm-omni main 分支直接开跑。
Mistral 晒了新基准成绩:Mistral Large 4 跑 657 个办公自动化任务,赢了 Kimi K3 和 DeepSeek V4 Pro,做 agent 介绍的可以看看。
Mistral 用 3800 张 GPU 干出了别人 10 万张卡 72% 的效果,这算力效率对比挺有意思,看看各家的差距。
OpenAI 内部 pro 模型干掉了 500 道顶级难题里的 90 道,解 Navier–Stokes 一道要 3 小时,还比 GPT-6 Astra 强,看看细节。
Gary Marcus 拆解了 OpenAI 数学成绩背后的门道,说其实靠 Lean 符号验证撑着,顺带回应了关于他的各种争议说法。
法国 Mistral 放出新旗舰 Large 4,用 4000 块 Grace Blackwell GPU 训了两个月,想追欧洲阵营的可以盯一下。
Keras 之父 Chollet 抛了个有意思的问题:RLVR 只能拉高数学和代码,其他领域能不能跟着涨还不确定,这直接决定接下来模型能走多远。
Percy Liang 提了个挺新的评估思路:让带答案的 guide 模型和裸模型对话,按传输比特数记账,算出模型预测新论文的概率下界。
欧洲模型在 CyberGym 网络安全基准拿了 82%,压过 MiMo-V2.6-Pro 和 GPT-6 Luna,看来欧洲还没掉队