7月9日
08:16
08:02
08:02官方一手marktechpost@Michal Sutter
SpaceXAI推出Grok 4.5,该模型使用Cursor进行训练,专为编程、智能体任务和知识工作设计。推理速度达80 TPS,成本为每百万输入token $2、输出token $6。在Harvey法律智能体基准测试中排名第一。
事件专题

推荐理由:Grok 4.5用Cursor训练,编程和智能体任务表现强,法律基准第一,性价比不错。
06:44
06:44Aadit Sheth@aaditsh
76°
OpenAI 推出 GPT-Live,一种支持全双工语音交互的模型。在复杂问题上,它会自动委派给 GPT-5.5 处理。OpenAI 内部网络研究基准测试成绩从 0.7% 跃升至 75.2%。有用户接到餐厅确认电话时发现是 AI 并提问测试,AI 直接挂断,表明体验仍有瑕疵。
事件专题

推荐理由:OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
05:57
05:57Thomas Wolf@Thom_Wolf
精选
Matei Zaharia指出,在LLM推理中,使用简单的Pi harness(来自@badlogicgames)在Opus和GPT 5.5上达到了与LLM供应商提供的harness相同的成功率,但成本降低了一半。这种成本优势主要归因于更小的输入规模。该发现揭示了harness设计对性价比的巨大影响。
推荐理由:你知道吗?换个简单的工具就能把成本砍半,效果还不打折!Pi harness让Opus和GPT 5.5的推理省钱又高效,值得一试。
04:27
04:27Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 高级成员 Shoucong Chen 使用 GLM 5.2 Fast 模型,在 4 天内完成了原计划 1 个月的复杂 SWE 项目。该模型推理速度约 400 tokens/s,总推理成本仅 218 美元。通过 FireConnect 可在 Claude Code 中调用此模型。作者认为快速推理能减少上下文切换,提升开发效率。
推荐理由:Fireworks AI 的 GLM 5.2 Fast 跑到了 400tok/s,4 天干完一个月活,才花 218 刀。想试试在 Claude Code 里提速的,直接 FireConnect 走起。
03:59
03:59lmarena.ai@lmarena_ai
72°
xAI 的 Grok 4.5 模型已在 arena.ai 平台的 Battle Mode 和 Agent Mode 中开放测试。该测试允许用户直接体验模型的对抗推理与智能体能力。平台方表示将很快发布模型的评估分数。目前该测试已有超过 850 次浏览。
推荐理由:想试试 Grok 4.5 的新能力?现在去 arena.ai 就能直接玩上对战模式和智能体模式,分数很快会出,先测为快。
03:52
03:39
03:36
03:36OpenRouter@OpenRouterAI
77°
OpenRouter 现已支持 Grok 4.5。该模型是 SpaceXAI 首个专为编程和智能体任务训练的模型,由 Cursor 协助训练。在长周期工程任务上,其表现达到前沿水平。同时 Grok 4.5 保持了较快的推理速度和较低的成本。
事件专题

推荐理由:OpenRouter 上了 Grok 4.5,SpaceXAI 和 Cursor 联手训练的编程模型,长任务能力强,速度还快,搞工程的赶紧试试。
03:28
03:28官方账号OpenAI@OpenAI
OpenAI发布GPT-Live,基于全双工架构设计,支持同时进行语音输入和输出。该模型改变了传统语音助手轮流对话的模式,实现实时自然交互。目前尚未公开具体参数和基准测试结果。
事件专题

推荐理由:GPT-Live能一边听你说话一边回应,聊天不再有等待感,就像和真人对话一样流畅。
03:19
03:19官方一手NVIDIA AI Blog@Adel El Hallak
精选
NVIDIA Nemotron 3 Ultra 在 LangChain 的 Deep Agents 框架上取得开放模型最高准确率。它完成更多任务且吞吐量更高,运行速度提升10倍。其成本低于顶级闭源模型。这使得 Nemotron 3 Ultra 成为构建 AI 智能体的高性价比选择。
事件专题

推荐理由:NVIDIA 的 Nemotron 3 Ultra 和 LangChain 合作,以更低成本跑出比闭源模型快10倍的成绩,做智能体首选。
03:16
03:16官方账号Decoder@Matthias Bastian
精选
xAI发布Grok 4.5,模型基于数万块Nvidia GB300 GPU训练。在编码基准上,Grok 4.5落后于Fable 5和GPT-5.5,但相比Opus 4.8,token消耗减少4.2倍。Grok 4.5定价每百万输入token仅2美元,远低于竞品。欧盟市场预计7月中旬可用。
事件专题

推荐理由:Grok 4.5每百万token才2美元,编码虽不如Fable 5但便宜到可以忽略差距,性价比碾压。
03:03
03:03官方账号Allen AI (Ai2)@allen_ai
精选
Allen AI发布的MolmoAct 2是一个完全开放的视觉-语言-动作模型。机器人工程师@pham_blnh利用该模型在周末构建了语音控制机器人。这款机器人赢得了@southpkcommons举办的AI黑客马拉松。Allen AI还发布了相关采访视频。

推荐理由:Allen AI的MolmoAct 2开放模型,周末就能搭语音机器人,还赢了黑客马拉松,看采访视频了解细节。
02:57
02:57官方一手@OpenAIDevs@OpenAIDevs
83°
OpenAI 宣布 GPT-Live-1 及其轻量版 GPT-Live-1 mini 即将通过 API 向开发者和企业开放。该模型具备实时对话能力,官方称其为当前最智能的语音模型。开发者可通过指定表单注册通知。
事件专题

推荐理由:OpenAI 要把实时语音模型 GPT-Live-1 做成 API 了,开发者和企业能直接集成,不用自己训练。
02:32
02:32官方账号Epoch AI@EpochAIResearch
精选
智谱AI的GLM-5.2在Epoch Capabilities Index上获得152分,是评估过的所有开源权重模型中的最高分。该分数仍低于7个多月前发布的Gemini 3 Pro。这一结果显示出开源模型在能力基准上的进展,但与顶级闭源模型仍有差距。
事件专题

推荐理由:智谱开源模型GLM-5.2在能力指数上拿到开源最高152分,不过还是比不过7个月前发布的Gemini 3 Pro,差距一目了然。
02:25
02:18
02:18官方账号OpenAI@OpenAI (@OpenAI)
73°
OpenAI 推出 GPT-Live 语音模型,专为提升人机交互自然度而设计。该模型即日起在 ChatGPT 中逐步上线,支持更流畅的对话体验。官方演示视频展示了其逼真的语音响应和情感表达能力。推文获得超 5200 次点赞和 34 万次观看。
事件专题

推荐理由:OpenAI 出了个新语音模型 GPT-Live,今天就能在 ChatGPT 里用,说话更自然更像真人,快去试试吧
02:16
02:16官方一手marktechpost@Michal Sutter
73°
OpenAI 推出新一代语音模型 GPT-Live 和 GPT-Live-1 mini,用于 ChatGPT Voice。GPT-Live 采用全双工架构,能够同时听和说。该模型将搜索与推理任务委托给 GPT-5.5 处理。GPT-Live-1 mini 是轻量版本。
事件专题

推荐理由:OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。