OpenAI 新模型在 Agent Arena 用一半价格逼近 Claude Fable 5 的表现,做智能体应用的成本压力小多了
全部动态
OpenAI 的 GPT-6 Sol 上 Agent Arena 了,净改进 +7.7% 排第 6,确认成功率排第 4,API 价格还比 GPT-5.6 便宜一半。
LMArena 用不到 60 秒讲清 GPT-6 Sol 和 Claude Opus 5.5 到来这周的动态,赶时间可以直接刷这条视频。
作者用 Astra 智能体在 Blender 里摆好 UFO 场景,再丢给 fal 的 H3 Max 转成照片级视频,镜头时序都能保留,做短片的人可以试试这条工作流。
Google 一口气更新了 3.8 Flash TTS、Live Avatar 和 Notebook 语音聊天,还有个把 TPU 送上太空的卫星计划,一次看全。
Replit Agent 一次上了 GPT-6 两款和 Claude Opus 5.5 三个模型,还能做 VR 应用了,搞开发的朋友可以试试哪个顺手。
Picsart 接入了 Recraft V4.1 Flash,1 秒多就能出一张图,做 Logo 和人像图可以一口气多试几版再挑。
Vapi 这个语音智能体平台一年要接 10 亿次电话,客户有 Amazon 和 Uber,两个创始人聊了他们换过十几个方向才走到今天的故事。
想面 AI 工程师的同学可以收藏这个开源题库,35 家公司的真题都整理好了,还能看出各公司考察风格的差异。
OpenAI 在 Hugging Face 事件后公开交代智能体越界行为审查进展,说清了哪些算问题、怎么通知第三方,做智能体开发的都该看看。
Qdrant 开源了 Supernova 工具和一个 10B 的 FineWeb 数据集,做向量搜索调优和评测的人可以直接拿来用。
Stripe 为啥买下 OpenRouter?两位创始人亲述,日路由 10T+ tokens 的生意和智能体欺诈隐患都讲透了。
用 Fireworks 和 HUD 这套流程,你不用自己搭 RL 训练基础设施,定义一次任务就能边训边评,自己微调模型的可以看看。
OpenRouter 把 Kev 的底细公开了:就是 Qwen3.5-4B-Base 上加了个 LoRA 和 pointer head,权重在 Hugging Face 上,想研究小型模型微调的可以拆开看看。
OpenRouter 新出的 Jev Router 在 423 个任务里解决了 237 个,比他们原来的 Auto Router 多 82%,做 Agent 的可以看看路由效果差在哪。
有人让 Claude Opus 5.5 一口气画 100 张 matplotlib 图,想看它批量写代码稳不稳的可以看看这个实测。
Cline 免费开放了匿名模型 Pixel Canary,跑分和 GPT-6 Astra 打平、超过 Kimi K3,写 Next.js 的可以试试。
Claude Code 要集成进 Claude Desktop 了,还带新的模型选择器和用量查看,常用 Claude 写代码的可以先关注下
美团中秋半夜甩出 LongCat 2.5 预览版,16T 参数只激活 48,还有 1M 上下文和原生多模态,参数配置看着很猛,可以蹲一下实测成绩。
Apollo 首席经济学家的数据,前 10% 客户占走 99.5% 推理支出,头部是平均值的 1791 倍,讲清了 AI 和传统软件商业模式的差别。
CodeRabbit 写了篇干货,讲它怎么用 Cloud Run 和 Gemini 把代码审查工具升级成智能体变更管理,做工程工具的可以看看架构思路。
OpenAI 把网络安全模型做成了独立产品,GPT-6 Cyber 已在少数客户手里试用,做安全的可以关注下这条产品线。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档