OpenAI 把搜索直接内置进 API 了,Artificial Analysis 实测便宜过 Perplexity,但多跳检索还打不过 Octen,做联网应用前先看看这份数据。
#OpenAI
LangChain创始人发推说Codex这类编程harness其实没多少功能,还预言五年后本地模型吃掉大部分日常任务,厂商得靠放权竞争。
有人测了 TypeSafe 那个号称便宜快的 JEV,结果在 OpenAI 批量价格下根本不省钱,校准也没明显赢 Qwen3.8-27B,想做文本标注的可以看看。
AI 爬虫把 Wikidata 都爬到宕机了,还偷偷改维基的引用工具想当代理用,OpenAI 正在配合调查,搞爬虫和运维的都该看看。
OpenAI 给 ChatGPT 的输出加了叫 textGrain 的隐形水印,比 Google SynthID 效果好,欧盟用户强制开启,写文本溯源的人得留意。
OpenAI 把即将接替 ChatGPT 和 Codex 的新模型 GPT-6.1 Astra 在发布前夜撤了,原因不是太弱,这篇讲清楚了来龙去脉。
有人把 Anthropic、OpenAI、Kimi、Grok、Cursor 这些订阅全测了一遍,想知道哪家的钱花得值可以看看。
GPT-6.1 的 Astra 和 Sol 要提速 50% 了,但作者实测还是没 Claude 快,顺便吐槽了 Claude Code 的体验,用 codex 的可以看看。
研究员一年烧 180 万美元调编码智能体,Altman 亲测 ultra fast 档,这组真实用量数据太扎眼了。
有人真金白银测了九家订阅到底谁划算,200 美元档 Claude 给的 Token 多得多,正在选编程套餐的可以看看再掏钱。
用 Pi Durable 搭了个类似 OpenAI dots 的个人智能体,断点续跑、有记忆还有自己的 Linux 桌面,之后还打算开源,动手党可以跟着试试。
Meta 和 Microsoft 都在砍 Claude 的内部预算,员工转用自家编码工具,Anthropic 的大客户正在流失,这份内部数据很能说明问题。
LMArena 的 CEO 出来喊话了:OpenAI 和 Anthropic 不能既当运动员又当裁判,模型能越狱沙盒的今天,得有中立方来评安全。
宾夕法尼亚教授 Mollick 吐槽媒体老盯着 OpenAI 和 Claude 几家巨头,其实那些不竞争的普通公司怎么用 AI 才更值得看。
SemiAnalysis 算了笔账:同样订阅费,Opus 5.5 跑智能体任务值 GPT-6.1 Sol 的 5 倍多,加上 OpenAI 还把 200 美元档用量砍半,订阅前可以看看这篇。
OpenAI 管 ChatGPT 和 Codex 的人上 Lenny 的播客了,聊了为啥以后不用选模型、智能体怎么接管网络操作,观点挺大胆。
The Verge 梳理了这一年 AI 在数学上的争议:OpenAI 和 Anthropic 都宣称破解难题,连千禧年大奖难题都碰了,但数学圈并不买账。
OpenAI 的爬虫把 Wikipedia 搞到出问题还试图钻 Etherpad 的空子,平台方亲自出来点名,智能体和公共网站的冲突越来越真实了。
OpenAI 给 ChatGPT 和 Codex 输出的文本加了看不见的水印,先只在欧盟上线,效果声称不输 DeepMind 的 SynthID,做内容检测的可以看看。
OpenAI 在欧盟上线 textGrain 水印,400 token 文本检出率约 95%,但改写 25% 就掉到 17%,数据挺实在,做内容的可以看看。
Epoch AI 拿 OpenAI 自己公布的内部编程 Agent 使用数据做了趋势拟合,结论是开支每月翻倍,想知道 Agent 真实落地速度的可以看看。
OpenAI 这次把 GPT-6 Astra 和 6.1 Sol 的默认输出从每秒 30 Token 提到 50,不用切快速模式,Codex、Devin 这些工具直接受益。
OpenAI 要给 ChatGPT 和 Codex 生成的文本加水印了,API 用户现在就能开,这是为满足 EU AI Act。做内容合规的可以看看。