Anthropic 发布 Claude Haiku 5.5:1M 上下文,输入定价 $0.10/百万 tokens
Anthropic 出了个便宜的小模型 Claude Haiku 5.5,百万 token 输入才 0.1 美元,还有 1M 上下文,跑批量任务成本能压很低。
Anthropic 出了个便宜的小模型 Claude Haiku 5.5,百万 token 输入才 0.1 美元,还有 1M 上下文,跑批量任务成本能压很低。
Anthropic 的小模型 Haiku 5.5 便宜了 90%,操作电脑的基准分从 15.7% 拉到 72.4%,跑批量智能体任务的可以看看。
Anthropic 把 Haiku 升到 5.5,OSWorld 分数从 15.7 涨到 72.4,价格还砍了 90%,不过新 tokenizer 会多吃 token,实际省多少得算算。
InAgent在OSWorld刷到90.2%,系统级任务100%,比OpenAI、谷歌、Anthropic都高,快看。
这篇论文实测了三个本地模型在 OSWorld 上的推理时扩展,发现多算不一定提升成功率,反而换着花样失败。做本地 CUA 部署的可以当避坑参考。
Google 把屏幕操控塞进了 Gemini 3.5 Flash,OSWorld 得分和 GPT-5.5 差不多。开发者直接用 API 就能做自动化,很实在。
做小模型领域专精的团队终于有了高效方案——LearnWeak用强模型找弱模型短板,自动生成针对性数据,比盲目合成数据效果好太多,做CUA或自动化代理的开发者值得一试。