一篇教你怎么标注 on-policy 对齐数据的论文,思路是在 token 层面做修正,LLM 和 Agent 都适用,做对齐训练的可以看看。
全部动态
OpenAI 把 GPT-6 Astra 的能力塞进了更便宜更快的 Sol 和 Luna,缓存读取打 1 折,API 价格比 GPT-5.6 还低一半。
Alex Albert 贴了一段 Claude 提示词,能让它用 Blender Python 纯代码重建 1906 年的旧金山街景,每栋楼都标注史料来源,提示词写法很值得抄。
OpenAI 出了个便宜档的 GPT-6 Luna,跑分追平 Claude Opus 5,但只要零头的价格,看重成本的可以去 OpenRouter 试试。
OpenAI 新出的 GPT-6 Sol 和 Luna 上 OpenRouter 了,价格砍半,Sol 输入 2 美元、Luna 只要 0.1 美元每百万 token,跑分还比上一代强。
OpenAI 把 GPT-6 Astra 的能力塞进了 Sol 和 Luna 两个更便宜的型号,API 价格比 GPT-5.6 还砍了一半,跑批量任务的可以看看。
做网页应用的朋友看下:Lovable 已经换上 GPT-6 Sol,官方测下来比 GPT-5.6 Sol 高 6-12%,指令遵循提升最明显。
Anthropic 把 Opus 升到了 5.5,写代码跑智能体任务的朋友可以留意,官方说这三块能力都是最强的。
想在正式发布前试试 Opus 5.5 的可以去 arena.ai,既能盲测对比,还能开 Agent Mode 跑任务。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜版本,API 直接砍半价,跑批量任务的成本党可以看看。
Fish Audio 出了 MCP 接入文档,跟着 docs.fish.audio/overview/mcp 走一遍,你的智能体就能开口说话了。
Cognition 跑了 GPT-6 两个型号的编程实测:Sol 省了 17% 上下文还少留烂尾测试,Luna 会写真回归测试了,写代码的可以看看。
Devin 接入了 GPT-6 Sol 和 Luna,Luna 每个任务不到 0.1 美元,比 GPT-5.6 便宜一大截,分数还更高。
Claude Opus 5.5 上线 GitHub Copilot 了,跟 Opus 5 效果差不多但省不少 token,写代码跑长任务可以试试,CLI 和 VS Code 里就能用。
做 AI 产品必看,Hamel 和 Shreya 把踩坑经验做成免费技能包,让编码智能体帮你搭 evals,Ramp 和 Cursor 都靠这招降本增效。
Cursor 里现在能用 Claude Opus 5.5 了,CursorBench 榜首,还比 Opus 5 便宜 40%,写码的可以试试。
Fish Audio 的 MCP 现在能直接在 Cursor 或 Claude 里生成图片再转视频做广告,还能提前看到花费,做内容的朋友可以试试。
OpenAI 今天一口气发了 GPT-6 Sol 和 Luna 两个模型,付费用户直接在 ChatGPT 和 Codex 里就能用,免费用户也能在桌面端试 Luna。
Claude Opus 5.5 进 Agent Arena 了,你的 toughest prompt 能直接给模型出难题投票,还能看到它在 WebDev、Vision 等赛道的对战成绩。
Anthropic 的新 Opus 5.5 又快又便宜,修 20 万行代码库从 20 小时缩到 3 小时,Agent 用户可以直接换上试试。
Alex Albert 演示 Claude Opus 5.5 在 claude.ai 上一条提示词就能操控 Blender 做黏土动画,不用自己写脚本,喜欢折腾工具的可以试试。
Lovable 发文讲他们怎么挑模型:每周实测新模型再决定路由,现已用上 GPT-6 Sol 和 Fable 5.1,想知道你的 AI 编程工具背后怎么选模型可以看看。
Anthropic 把 Claude 的聊天和 Cowork 合成一个入口了,交个任务它自己跑完,Pro 和 Max 未来几周都能用上。
OpenAI 一次发了两个 GPT-6 模型,价格还砍半,做应用的可以看看 Sol 和 Luna 怎么选
OpenAI 把 GPT-6 Sol 和 Luna 发出来了,说是接了 Astra 的对齐成果,对齐评估比 GPT-5.6 那两版要好,可以先看看。
OpenAI 一口气发了 GPT-6 Sol 和 Luna 两个模型,API 已经能调,Plus 以上订阅用户在 Codex 和 ChatGPT Work 里也能用到。
用 Vercel AI SDK 的朋友注意,现在能直接接 Claude 的 API 了,文档在 ai-sdk.dev 上,换模型不用大改代码。
Anthropic 发了 Opus 5.5,能力跟 Fable 5.1 差不多但便宜四成,用 AI SDK 的可以直接接上试。
OpenAI 把 GPT-6 Astra 的能力做成了 Sol 和 Luna 两个便宜版,API 价格直接砍半,跑批量任务的可以看看。
Cognition 把 Claude Opus 5.5 接入了 Devin,在 FrontierCode 1.1 上超过 Fable 5 拿了第一,成本还更低,写代码的可以去试试。
Bolt 官方列了几个大家老跳过的功能:Enhance prompt、plan mode、清上下文、小改用轻量模型,全是省 token 又少返工的实用招。
OpenAI 放出了 GPT-6 的 Sol 和 Luna 两个版本,对齐能力比 GPT-5.6 更强,想追最新模型动态的可以看看这条。
JacksAISites 在讨论省 Token 的工作流:让 Fable 只做验收不做编排,配合 Opus 5.5 执行,效果差距不大但成本省不少。
Perplexity 把 Anthropic 的新模型 Claude Opus 5.5 接进了 Computer,Pro 和 Max 用户都能用上,据说效果比 Fable 5.1 好还便宜不少。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档