7月9日
08:16
06:44
06:44Aadit Sheth@aaditsh
76°
OpenAI 推出 GPT-Live,一种支持全双工语音交互的模型。在复杂问题上,它会自动委派给 GPT-5.5 处理。OpenAI 内部网络研究基准测试成绩从 0.7% 跃升至 75.2%。有用户接到餐厅确认电话时发现是 AI 并提问测试,AI 直接挂断,表明体验仍有瑕疵。
事件专题

推荐理由:OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
05:57
05:57Thomas Wolf@Thom_Wolf
精选
Matei Zaharia指出,在LLM推理中,使用简单的Pi harness(来自@badlogicgames)在Opus和GPT 5.5上达到了与LLM供应商提供的harness相同的成功率,但成本降低了一半。这种成本优势主要归因于更小的输入规模。该发现揭示了harness设计对性价比的巨大影响。
推荐理由:你知道吗?换个简单的工具就能把成本砍半,效果还不打折!Pi harness让Opus和GPT 5.5的推理省钱又高效,值得一试。
04:27
04:27Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 高级成员 Shoucong Chen 使用 GLM 5.2 Fast 模型,在 4 天内完成了原计划 1 个月的复杂 SWE 项目。该模型推理速度约 400 tokens/s,总推理成本仅 218 美元。通过 FireConnect 可在 Claude Code 中调用此模型。作者认为快速推理能减少上下文切换,提升开发效率。
推荐理由:Fireworks AI 的 GLM 5.2 Fast 跑到了 400tok/s,4 天干完一个月活,才花 218 刀。想试试在 Claude Code 里提速的,直接 FireConnect 走起。
03:59
03:59lmarena.ai@lmarena_ai
72°
xAI 的 Grok 4.5 模型已在 arena.ai 平台的 Battle Mode 和 Agent Mode 中开放测试。该测试允许用户直接体验模型的对抗推理与智能体能力。平台方表示将很快发布模型的评估分数。目前该测试已有超过 850 次浏览。
推荐理由:想试试 Grok 4.5 的新能力?现在去 arena.ai 就能直接玩上对战模式和智能体模式,分数很快会出,先测为快。
03:52
03:36
03:36OpenRouter@OpenRouterAI
77°
OpenRouter 现已支持 Grok 4.5。该模型是 SpaceXAI 首个专为编程和智能体任务训练的模型,由 Cursor 协助训练。在长周期工程任务上,其表现达到前沿水平。同时 Grok 4.5 保持了较快的推理速度和较低的成本。
事件专题

推荐理由:OpenRouter 上了 Grok 4.5,SpaceXAI 和 Cursor 联手训练的编程模型,长任务能力强,速度还快,搞工程的赶紧试试。
03:28
03:28官方账号OpenAI@OpenAI
OpenAI发布GPT-Live,基于全双工架构设计,支持同时进行语音输入和输出。该模型改变了传统语音助手轮流对话的模式,实现实时自然交互。目前尚未公开具体参数和基准测试结果。
事件专题

推荐理由:GPT-Live能一边听你说话一边回应,聊天不再有等待感,就像和真人对话一样流畅。
03:03
03:03官方账号Allen AI (Ai2)@allen_ai
精选
Allen AI发布的MolmoAct 2是一个完全开放的视觉-语言-动作模型。机器人工程师@pham_blnh利用该模型在周末构建了语音控制机器人。这款机器人赢得了@southpkcommons举办的AI黑客马拉松。Allen AI还发布了相关采访视频。

推荐理由:Allen AI的MolmoAct 2开放模型,周末就能搭语音机器人,还赢了黑客马拉松,看采访视频了解细节。
02:57
02:57官方一手@OpenAIDevs@OpenAIDevs
83°
OpenAI 宣布 GPT-Live-1 及其轻量版 GPT-Live-1 mini 即将通过 API 向开发者和企业开放。该模型具备实时对话能力,官方称其为当前最智能的语音模型。开发者可通过指定表单注册通知。
事件专题

推荐理由:OpenAI 要把实时语音模型 GPT-Live-1 做成 API 了,开发者和企业能直接集成,不用自己训练。
02:32
02:32官方账号Epoch AI@EpochAIResearch
精选
智谱AI的GLM-5.2在Epoch Capabilities Index上获得152分,是评估过的所有开源权重模型中的最高分。该分数仍低于7个多月前发布的Gemini 3 Pro。这一结果显示出开源模型在能力基准上的进展,但与顶级闭源模型仍有差距。
事件专题

推荐理由:智谱开源模型GLM-5.2在能力指数上拿到开源最高152分,不过还是比不过7个月前发布的Gemini 3 Pro,差距一目了然。
02:25
01:46
01:46官方账号LangChain@LangChainAI
精选
NVIDIA与LangChain联合发布NemoClaw Deep Agents蓝图,包含开放权重模型层Nemotron 3 Ultra,支持领域定制。Deep Agents层提供规划、工具调用、记忆和长时任务处理能力。OpenShell Runtime作为开放运行时,允许用户控制、审计和治理。该蓝图旨在简化智能体应用的构建与部署。
事件专题

推荐理由:NVIDIA和LangChain搞的这个蓝图很实在,Nemotron 3 Ultra开放权重随便微调,智能体框架自带规划、工具、记忆,运行时也开源可审计。
01:42
01:42官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA AI 与 LangChain 联合推出基于 Nemotron 3 Ultra 的 Deep Agents 开源智能体框架。该 agent 在评测中取得 0.86 聚合分数,推理成本仅 4.48 美元。而性能最接近的闭源模型成本为 43.48 美元,实现了 10 倍的成本降低。框架完全开放可定制,开发者可直接使用。
事件专题

推荐理由:NVIDIA 和 LangChain 搞了个开源智能体,用 Nemotron 3 Ultra 跑 Deep Agents,性能比肩闭源但成本只要 4 块多,比最接近的对手便宜 10 倍。搞 AI agent 的值得看看。
01:01
01:01官方账号LangChain@LangChainAI
精选
LangChain调整了NVIDIA Nemotron 3 Ultra模型的推理框架,在基准测试中获得0.86的聚合分数,成本仅4.48美元。与之性能最接近的模型成本为43.48美元,实现了10倍的成本降低。该优化在保持领先性能的同时大幅降低了推理开销。
事件专题

推荐理由:LangChain让Nemotron 3 Ultra跑分0.86,成本只要4.48刀,比对手便宜近10倍,性价比拉满。
00:34
00:34官方账号Greg Brockman@gdb
OpenAI 的 GPT-5.6-Sol 模型经过两个多月在 Next.js 日常开发中的测试,表现出色。它能理解架构权衡、调查复杂 issue 报告,并在修复 bug 时考虑代码库其他部分。仅需简短提示即可指导,甚至独立完成了 Next.js 服务器的大规模重构(包括测试套件、部署测试)。相关 PR 将在 Next.js 16.3 发布后合并。
事件专题

推荐理由:OpenAI 的 GPT-5.6-Sol 不只是聊天,能直接干复杂编程活了,比如自己重构 Next.js 服务器。想看看模型实际生产力有多强?这篇实测值得看。
00:01

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。