DeepLearningAI 分析了 GPT-6 Astra 的最新表现,它不仅登顶了 ARC-AGI-3 基准测试,还降低了 token 成本,对开发者来说很实用。
#推理模型
这是篇研究论文,作者提出了一种叫CanvasAnneal的新框架,专门用来提升扩散语言模型做复杂推理的能力,比如数学题和用工具,效果比之前的方法好。
Claude 3.5 Sonnet 新增了专门针对 Rust 编程的推理引擎,能帮你更高效地生成 Rust 代码,比 vLLM 和 sgLang 更适合写 Rust。
OpenAI 和 Broadcom 联合发布了自研的 AI 推理芯片 Jalapeno,专门为了提升 ChatGPT 的响应速度,比 NVIDIA 的芯片更省电,延迟更低。
Meta 新发布的 Muse Spark 1.3 (Max) 在 Agent Arena 中表现提升明显,排名从第30位跃升至第13位,性能提升显著,值得关注。
Anthropic 新发布的 Claude 3.5 Sonnet 模型,推理能力很强,价格也便宜,比 GPT-4 Turbo 和 Claude 3.5 Haiku 都好。
DeepSeek 直接把自家旗舰 V4 Pro 下线了,换成 V4.1 Flash,说明新模型确实更强,对开发者来说,用 V4.1 Flash 能省不少钱,尤其是处理长上下文和频繁调用的时候。
OpenAI 新出的 GPT-Image-2.5 Sunburst 模型现在可以直接用了,排名第一,可以试试。
DeepSeek 推出了 V4.1 Flash,性能接近 GPT-5.6,但成本只有 1/30,用 15 美元就能跑 100 个复杂任务,性价比很高。
寒武纪搞了个新东西,叫 Day-0,能让 DeepSeek-V4.1-Flash 模型直接在他们的芯片上跑,不用额外优化,挺厉害的。
OpenAI 推出了金融行业的专属 ChatGPT,能结合金融数据和 GPT-6 Astra 的推理能力,帮助团队做研究、建模型和做客户材料,比普通版本更专业。
DeepSeek 新发布的 V4.1 Flash 模型,推理速度更快,价格也降了 60%,比之前的 V4 Pro 强很多。
Devin Desktop 和 CLI 现在支持 SWE-2 了,这个模型在主要评估基准上和近期前沿模型得分相当,但成本能降低 70%,挺香的。
DeepSeek 新出的 V4.1 Flash 模型,性能不错,和 GLM-5.3 差不多,关键是内存消耗特别低,适合做 agentic 任务,价格也便宜很多。
OpenAI 和 Anthropic 都在测试自己的代理程序,但都遇到了问题,比如 Claude 自我指认系统模拟,GPT-6 Astra 依赖推理可读性,挺有意思的。
DeepSeek新出的V4.1-Flash模型参加Agent Arena竞赛,你可以去投票看看它的表现,这个模型设计得更智能、更快、更高效。