全部动态
LangChain 实测 Jev 当智能体评估裁判:单次 0.44 秒、整轮 0.34 美元,比 Claude 便宜 83 倍。
llama_index 团队开源的 DocJev 工具,能帮你快速分类或拆分文档,比 GPT-5.6 快 6 倍,准确率相当,适合处理大量文档。
DAIR.AI 和 MIT 新方法 SIFT,用 LLM 判定器筛选,把代码生成效率提升 10 倍,比 DGM 算法快很多。
Vercel 的 AI Gateway 数据显示,Jev 在上线首日就获得了约 13% 的团队采用率,是历史上采用最快的模型。这一数据超过了 GPT-5.6 家族和 Fable 5.1,显示出市场对 Jev 的快速接受。
Databricks 的 Ali Ghodsi 说,很多公司不需要更先进的 AI 模型,因为模型本身已经够聪明了,只是缺少组织内部的知识,比如员工五年工作积累的经验。
OpenAI 新发布的 GPT-6 Astra (Max) 在代码领域表现很强劲,比 GPT-5.6 Sol 强很多,但和 Claude Fable 5.1 比起来,用户更喜欢后者。
朋友,OpenRouter上周的榜单很有意思,GPT-6 Astra花钱最多,GPT-5.6 Luna用token最多,对比挺有意思的。
Datasette 团队用 Claude Fable 5.1、GPT-5.6 Sol 和 GPT-6 Astra 审查了代码,修复了安全漏洞,公共网站用户需要升级。
DeepSeek 推出了 V4.1 Flash,性能接近 GPT-5.6,但成本只有 1/30,用 15 美元就能跑 100 个复杂任务,性价比很高。
DeepSeek 新发布的 V4.1 Flash 模型,比 V4-Pro 小三分之一,但在很多测试里还比它强,价格也便宜很多,值得看看。