#推理模型
有个叫 AREX 的研究智能体,答完题会自己逐条核对再补漏,BrowseComp 拿了 82.5%,微调过的 4B 小模型还打赢了 35B。
Anthropic 把 Haiku 5.5 的短提示价格砍到 0.10 美元一百万 token,跑分类摘要这些活儿成本直接砍半以上,做子代理的可以算算账了。
Stability AI 联合创始人爆料 OpenAI 解个方程烧了一两千万美元算力,但 IMO 金牌级推理从 8 万美元降到 10 美元,价格崩得真快。
Anthropic 的小模型 Haiku 5.5 上榜了,价格和 GPT-6 Luna 一样但分数更高,比自家 Haiku 4.5 便宜九成还涨分,做 Web 开发的可以看看性价比。
GPT-6.1 Sol 出了 ultrafast 版,steering 改成即时生效了,跑偏了能马上掰回来,不浪费算力。
OpenAI 给 GPT-6.1 Sol 加了个 Ultrafast 模式,快 8 倍但贵 6 倍,赶时间的场景可以试试
OpenAI 推出 GPT-6.1 Sol Ultrafast,生成速度最高快 8 倍,价格输入 12 美元、输出 60 美元每百万 token,对要低延迟的场景很有用。
OpenAI 给 GPT-6.1 Sol 加了 Ultrafast 模式,比标准版快 8 倍,Codex 和 API 都能用,价格也公开了。
OpenAI 让新模型一口气写了 722 篇数学证明,结果 3 篇有错被撤下,14 篇在改。矩阵乘法复杂度那些问题挺有意思,可以翻翻。
Anthropic 出了新小模型 Claude Haiku 5.5,比上一代便宜 75%,跑 computer use 能拿 72.4% 分,Sonnet 5.5 也跟着降价 20%,跑批量任务的成本党可以看看。
Anthropic 新出的 Haiku 5.5 便宜了 75%,还能调 effort 控制推理深度,跑批量任务的成本可以压得很低。
Anthropic 放出 Haiku 5.5,比上一代便宜 75%,基准和速度都压过 GPT-6 Luna,小模型优先的话可以看看这条。
有人把 Haiku 5.5 和 DeepSeek、智谱的 flash 模型做了价格和 Terminal Bench 跑分对比,选便宜模型前可以看看这张对比表。
训练 LLM 做 RL 时长尾 rollout 又慢又掉点?这篇 arXiv 论文的 RollVerify 提前验证修复样本,效率效率、准确率都不丢。
Anthropic 把最便宜的小模型 Haiku 升到 5.5,成本只有 Sonnet 5.5 的零头,跑 agent 任务可以省不少钱。
Anthropic 出了个便宜的小模型 Claude Haiku 5.5,百万 token 输入才 0.1 美元,还有 1M 上下文,跑批量任务成本能压很低。
Anthropic 出了个小杯 Claude Haiku 5.5,价格比上一代还便宜,博主猜参数不到 10B,跑轻量任务可以看看。
Claude 出了 Haiku 5.5,跑分压过 GPT-6 Luna,价格一样但速度快两倍,作者说 max 档最香,还预告了测评。
LMArena测了Jev Router的实际延迟:中位数6.18秒,比DeepSeek V4.1 Flash的3.64秒慢了一截,P90差距更明显。
有人实测了 Jev Router,5 个常用模型里 4 个上了 Pareto 前沿,但直连 DeepSeek V4.1 Flash 反而更便宜更快,选路由前可以先看看这组数据。
Bindu Reddy 直接开炮,说 Haiku 5.5 不如 DeepSeek 和 Luna,Anthropic 该发的其实是 Fable 5.5。
Anthropic 把 Haiku 5.5 价格砍到和 GPT-6 Luna 一样,10 万 token 内基准分还更高,长文本就选 Luna 了。
vLLM 花三周把 DeepSeek-V4.1-Flash 跑快了 1.9 倍,AgentX 上吞吐 5.3 倍,还附交互图表拆解过程,做部署的可以看看。
Liquid AI 的 d1 3B 单卡跑 Snake,8ms 决策吃了 86 个苹果,OpenAI API 345ms 才吃 3 个,对比很直观。
Anthropic 说 Haiku 5.5 在 10 万 token 以下的任务最划算,而这占了日常请求的九成,用小模型的可以算笔账。
Claude Haiku 5.5 已经能在 OpenRouter 上用了,比上代便宜 75%,还支持推理力度,速度实测 100+ TPS,快速场景可以试试。
Anthropic 的小模型 Haiku 5.5 便宜了 90%,操作电脑的基准分从 15.7% 拉到 72.4%,跑批量智能体任务的可以看看。