OpenAI 把 722 篇论文全放出来了,就是那个 372 个数学结果的说法,平均每个只用了 ChatGPT Pro 3 小时算力,可以自己去翻原始材料。
#推理模型
OpenAI 把一个没发布的模型的数学作业晒出来了:722 篇论文、372 组结果,每题烧 3 小时 Pro 算力,看看推理模型解题水平到哪了。
爆料说 Google 内部已经测上了 Gemini 4 之后的 Carbon,目标直逼 Opus 5.5,可以说说看你怎么看
微软用 Qwen3.5-9B 做了个专门快速打分决策的模型,比 GPT-6 Sol 快 35 倍,Foundry 上就能用。
StepFun 的 Step 5 Preview 限时免费,600B 参数还能看图,得分和 GPT-6 Luna 打平,可以先去试试再决定要不要付费。
有个叫 AREX 的研究智能体,答完题会自己逐条核对再补漏,BrowseComp 拿了 82.5%,微调过的 4B 小模型还打赢了 35B。
Anthropic 把 Haiku 5.5 的短提示价格砍到 0.10 美元一百万 token,跑分类摘要这些活儿成本直接砍半以上,做子代理的可以算算账了。
Stability AI 联合创始人爆料 OpenAI 解个方程烧了一两千万美元算力,但 IMO 金牌级推理从 8 万美元降到 10 美元,价格崩得真快。
Anthropic 的小模型 Haiku 5.5 上榜了,价格和 GPT-6 Luna 一样但分数更高,比自家 Haiku 4.5 便宜九成还涨分,做 Web 开发的可以看看性价比。
GPT-6.1 Sol 出了 ultrafast 版,steering 改成即时生效了,跑偏了能马上掰回来,不浪费算力。
OpenAI 给 GPT-6.1 Sol 加了个 Ultrafast 模式,快 8 倍但贵 6 倍,赶时间的场景可以试试
OpenAI 推出 GPT-6.1 Sol Ultrafast,生成速度最高快 8 倍,价格输入 12 美元、输出 60 美元每百万 token,对要低延迟的场景很有用。
OpenAI 给 GPT-6.1 Sol 加了 Ultrafast 模式,比标准版快 8 倍,Codex 和 API 都能用,价格也公开了。
OpenAI 让新模型一口气写了 722 篇数学证明,结果 3 篇有错被撤下,14 篇在改。矩阵乘法复杂度那些问题挺有意思,可以翻翻。
Anthropic 出了新小模型 Claude Haiku 5.5,比上一代便宜 75%,跑 computer use 能拿 72.4% 分,Sonnet 5.5 也跟着降价 20%,跑批量任务的成本党可以看看。
Anthropic 新出的 Haiku 5.5 便宜了 75%,还能调 effort 控制推理深度,跑批量任务的成本可以压得很低。
Anthropic 放出 Haiku 5.5,比上一代便宜 75%,基准和速度都压过 GPT-6 Luna,小模型优先的话可以看看这条。
有人把 Haiku 5.5 和 DeepSeek、智谱的 flash 模型做了价格和 Terminal Bench 跑分对比,选便宜模型前可以看看这张对比表。
训练 LLM 做 RL 时长尾 rollout 又慢又掉点?这篇 arXiv 论文的 RollVerify 提前验证修复样本,效率效率、准确率都不丢。
Anthropic 把最便宜的小模型 Haiku 升到 5.5,成本只有 Sonnet 5.5 的零头,跑 agent 任务可以省不少钱。
Anthropic 出了个便宜的小模型 Claude Haiku 5.5,百万 token 输入才 0.1 美元,还有 1M 上下文,跑批量任务成本能压很低。
Anthropic 出了个小杯 Claude Haiku 5.5,价格比上一代还便宜,博主猜参数不到 10B,跑轻量任务可以看看。
Claude 出了 Haiku 5.5,跑分压过 GPT-6 Luna,价格一样但速度快两倍,作者说 max 档最香,还预告了测评。