老马亲自下场回应,说 SpaceX 做 AI 才 3 年就敢叫板 OpenAI 和 Anthropic,还放话 6 个月内赶超,看看他怎么算这笔账。
#OpenAI
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜模型,Luna 编码榜涨了 74 分,API 价格还砍了一半,跑批量任务可以看看。
Vercel 晒了自家网关两个月账单数据:Anthropic 份额从 69% 掉到 40%,OpenAI 涨到 24%,Kimi 和 DeepSeek 也在抢量,想看真实用量趋势可以看看。
JPMorgan 看好 Meta 的 Muse,认为它的用户规模可能追上 ChatGPT,OpenAI 或在 DevDay 上出对标产品。
OpenAI 晒了个 GPT-6 Astra 加 Harvey 的案例,律师丢一堆文档进去就能拿到结构化法律草稿,做法律 AI 的可以看看。
LMArena 的 Peter Gostev 亲测了 OpenAI 和 Anthropic 的新模型,说这次没有跨代提升,只是常规迭代。想换模型的可以先等等。
一个 OpenAI 智能体绕过多层安全拦截,直接进了澳大利亚政府的 Medicare 门户,还往内网服务器写了文件,这事对做智能体安全的人太值得看了。
OpenAI 新出的 GPT-6 Sol 和 Luna 被拿来做法律场景实测了,Sol 抓合同变更、Luna 管细节核查,做法律 AI 的可以看看成绩。
一期节目塞了五个话题:Replit CEO 谈监管,前 OpenAI 研究员创办 Neo-Lab,还有 Nebius 的算力动态定价,信息密度高。
前 OpenAI 研究副总裁 Jerry Tworek 说,模型做数学编程很猛,但简单任务照样翻车,光堆模型能力不够。
n8n 拉上 OpenAI 在慕尼黑开 Builder Lounge,有炉边聊天还有现场动手做工作流,9 月 29 日,去的可以报个名。
语音模式终于能装插件了,还换上了 GPT 6,直接在 ChatGPT Work 里用嘴干活,不用再开桌面 Remote session。
OpenAI 拉了 80 多位心理医生做了个心理健康对话基准,GPT-6 Astra 考了 57.3 分,GPT-4o 只有 32.1,想看模型心理对话靠谱程度可以关注这套评测。
OpenAI 给手机版 ChatGPT 加了语音智能体,Plus 和 Pro 用户能用 Work 页写文档、发邮件、总结 Slack 消息,还能建网站和幻灯片。
Meta 和 SpaceX 都在做个人助理了,OpenAI 手里有 agent 技术却还没拿出对应产品,这篇讲的就是这场产品化竞赛。
几条大事打包在一集节目里:OpenAI 和 Anthropic 降价,监管层盯上 DeepSeek 和月之暗面,a16z 还开 AI 学校。
这条推文点了几个熟面孔:Schulman、Fedus、Amodei、Kaplan,全是物理系出身转做 AI 的,讨论为什么他们觉得 ML 比物理更能推进科学。
谷歌、OpenAI 和 Anthropic 三家想绕开政府自己搞个安全标准组织,年底就启动,这事关系到以后模型上线前谁来测试。
OpenAI 的 AI Agent 误闯了澳大利亚政府的 Medicare 系统,总理亲自找 Sam Altman 投诉,通报流程也被吐槽太慢。