#推理模型
不生成文本、只做分类决策的 Jev 三周就跑到日处理 1 万亿 token,OpenAI 和 Cloudflare 都出了同路线产品,挺值得了解的新方向。
arXiv 上的新基准 D2K-Bench,26 个任务测 LLM 写 GPU 内核,加上专家指导后 GPT-6-Astra 等模型的加速比从 1.69 倍冲到 2.49 倍,结果挺有意思。
微软 AI 负责人 Suleyman 说 10 亿美元训练跑马上来,全球就 5、6 家实验室凑得出吉瓦级算力,听听头部怎么看算力军备赛。
四个前沿模型各有所长:Astra 擅长操作电脑,Argon 强在法律金融,Sol 写代码最便宜,看完就知道该用哪个。
一条关于 Reflection AI 能不能追上 GLM 5.3 的讨论,拿 Nvidia 和 Thinky 当反面例子,看法挺克制。
Google 悄悄上线了 Gemini 4 Argon,主攻推理和安全方向,就是冲着 OpenAI 和 Anthropic 的旗舰模型去的,可以看看它到底强在哪。
一条推文把本月各家新模型全列齐了,GPT-6 Astra、Grok 4.7、Gemini 4 Argon 都在,想快速扫一遍本月发布看这条就够。
Google 放出了新旗舰 Gemini 4 Argon,一次能输出 100 万 token,主打编码和企业场景,现在只有 Fairwind 测试者能先摸到。
想给业务加自动判断能力的话看这篇,Jev 每百万 token 才 0.042 美元,还跟 GLiDE 等 5 家开源方案对比了。
Gemini 4 快来了,而且 Anthropic 博客都还在引用 GLM-5.3 的网络能力,国产模型这条线索值得关注。
有人爆料 OpenAI 下周有大动作,可能是 GPT-6.1 Astra,还说是对标 Claude Opus 5.5,真假存疑但值得盯一下。
Raschka 又出新教程了,这次手把手带你从零写 GRPO,把 DeepSeek-R1 那套推理训练方法完整实现一遍,还带 MATH-500 评测结果。
Cloudflare 用 Qwen 造了个决策模型,输出只按 schema 来,flash 版每百万 token 才 0.09 美元,比 Jev 便宜不少。
Meta 这篇论文挺反直觉的:给基座模型配个轻量脚手架,多采样几次,居然比 RL 后训练版本更能解智能体任务,做训练的人可以看看。
Google 把 Gemini 4 Argon 拿出来了,直接点名对标 GPT-6 Astra,想看两家旗舰怎么较量的可以看看。
Meta 让数学家用 Muse Spark 的普通聊天界面做开放数学题,还发了六篇论文,每篇都标注人和 AI 各写了哪部分。