7月14日
03:24
03:24elvis@omarsar0
actAVAai推出Cura,一个1T参数的医疗智能体模型,采用递归自我改进(RSI)训练。该模型专为长临床和健康管理流程设计,推理成本比前沿模型低20-100倍,性能相当。企业可定制并拥有模型。试用可获得20美元信用额度。
推荐理由:1T参数的医疗模型,推理成本比前沿模型低20-100倍,性能却差不多,企业还能自己定制,医疗AI这波挺实在。
03:15
02:35
02:35官方账号Fei-Fei Li@drfeifei
斯坦福大学启动第二届 BEHAVIOR 机器人挑战赛,聚焦日常生活中的长周期复杂任务。去年获胜方案在真实场景中完整任务成功率仅12.4%。本届新增更多任务类型,改进评估方法并降低使用门槛。提交截止日期为2026年10月16日,奖金池总额11000美元。
推荐理由:斯坦福的机器人挑战赛又来了,去年最佳方案成功率才12%,说明这事真难。今年任务更多、评测更靠谱,想测测你家机器人的真实水平就参加。
02:33
02:33lmarena.ai@lmarena_ai
精选
SpaceXAI 发布 Grok-4.5,它是专为编程和智能体训练的首个模型。在 Agent Arena 排行榜上,Grok-4.5 从 Grok 4.3 的第29名升至第13名,基于9.8K个实时智能体会话评估。它在 Bash Recovery 任务上大幅提升,接近 Anthropic 和 OpenAI 模型,确认任务成功率显著提高。
事件专题

推荐理由:Grok-4.5 是 SpaceXAI 的首个编程+智能体专用模型,在 Agent Arena 上从29名跳到13名,Bash Recovery 追平了Claude和GPT,实测任务成功率很高。
02:30
02:30lmarena.ai@lmarena_ai
Grok-4.5在Agent Arena基准测试中总体排名第13,较此前提升5.0%。其幻觉指标排名第4,提升1.3%;确认任务成功排名第6,提升6.9%。Bash恢复排名第9,提升9.7%;表扬与投诉比例排名第12,提升6.1%。可操控性排名第15,提升0.9%。

推荐理由:xAI的Grok-4.5在Agent Arena进步明显,幻觉控制做到第4,任务成功提升近7%,适合关注智能体性能的朋友。
02:17
02:17官方账号vLLM@vllm_project
精选
Novita Labs 训练并开源了 DSpark 投机解码器,用于 Kimi-K2.6 和 Kimi-K2.7-Code 模型。DSpark 是 DeepSeek 提出的投机解码方法,能一次性生成整个 token 块。vLLM 从 v0.25.0 版本起原生支持 DSpark。使用该解码器可加快 Kimi 系列的推理速度。
推荐理由:DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。
7月13日
23:18
23:18官方账号快手可灵 Kling@Kling_AI
Kling AI被用于制作葡萄牙世界杯宣传片,播放量接近1亿次。该片由78 Films采用Kling AI进行混合制作,在保持人类创意和情感的同时实现电影级画质。导演João Seiça表示AI用于拓展而非替代创造力。
推荐理由:Kling AI做的世界杯宣传片,播放快1亿了,画面跟电影一样,看看AI怎么帮人拍大片。
14:41
14:41官方账号vLLM@vllm_project
精选
PrimeIntellect推出Verifiers v1,使用vLLM进行训练rollouts,确保精确的token IDs和logprobs。该方法消除了tokenization漂移,使rollouts与训练保持同步。vLLM还支持开源RL基础设施如prime-rl。这一发布提升了强化学习训练的稳定性和效率。
推荐理由:PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。
12:22
12:22Hunyuan@TXhunyuan
腾讯混元发布Hy3模型,以295B参数MoE架构在OpenRouter LLM排行榜上获得第一。该模型在同参数规模中表现最优,性能可媲美万亿参数级旗舰模型。Hy3采用Apache 2.0开源协议,适合商业使用,并提供为期两周的免费API体验。

推荐理由:腾讯混元的Hy3,295B MoE模型,登顶OpenRouter第一,性能比肩万亿参数大模型,还免费试用两周,赶紧去试试。
11:17
11:17官方账号Together AI@togethercompute
精选
GLM 5.2 模型在 Together AI 平台部署后,在 Artificial Analysis 评测中输出速度和延迟均获得第一名。该评测覆盖多个主流模型,GLM 5.2 在吞吐量和响应时间指标上表现领先。Together AI 通过优化推理栈使模型达到接近实时的生成速度。

推荐理由:GLM 5.2 在 Together AI 上跑出了最快速度和最低延迟,想用低成本跑推理的话可以去试试这个组合。
11:00
11:00官方账号Together AI@togethercompute
NVIDIA的开放模型Nemotron 3 Ultra在Together AI上线后迅速获得社区青睐。该模型在OpenRouter平台上的处理量在几天内达到每天350亿token。这反映了社区对快速、高效且可定制开放模型的积极支持。Nemotron 3 Ultra是一款完全可定制的开放模型,由NVIDIA开发。
事件专题

推荐理由:NVIDIA刚推的Nemotron 3 Ultra在Together AI上火了,几天就在OpenRouter冲到每天350亿token用量,社区超爱这种又快又省又好改的开放模型。
09:49
09:49官方账号阿里云 Alibaba Cloud@alibaba_cloud
在第9届摩纳哥AI电影节黑客马拉松中,作品《Between》获得第9名。该片由Davit Jijavadze创作,采用水彩动画风格,讲述一朵野花破开办公室地板唤醒主角的故事。短片使用了阿里云Model Studio和Happy Horse 1.0生成。这一成绩展示了AI视频生成工具在艺术创作中的潜力。

推荐理由:阿里云和Happy Horse 1.0合作做了一个水彩动画短片,在摩纳哥AI电影节黑客马拉松拿第9。故事很走心,技术也酷,值得看看。
09:05
09:05官方账号Greg Brockman@gdb
87°
OpenAI的GPT-5.6 Sol在Design Arena中以Elo 1353排名第一,超过Anthropic的Claude Fable 5。它和智谱的GLM 5.2处于同一性能区间(前端设计)。相比GPT-5.5,GPT-5.6 Sol提升了18个名次和60分Elo。该模型还建立了偏好与速度的新帕累托前沿,比同性能级别模型更快。
事件专题

推荐理由:OpenAI新模型GPT-5.6 Sol在网页设计评测中拿了第一,比上一代强很多,还比Claude Fable 5更快。想看看AI设计的新天花板吗?
7月12日
07:00
07:00AI Will@FinanceYF5
73°
ArenaAI 数据显示,OpenAI 的 GPT-5.6 Sol 在 Code Arena: Frontend 基准上与 Anthropic 的 Claude Fable 5 并列第一。这是 OpenAI 模型首次登上 Code Arena 榜首。该基准主要评估 Agentic Coding、前端开发和 Web App 构建能力。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 在代码前端基准上追平了 Claude Fable 5,前端能力进步很明显,做网页的可以留意。
04:52
7月11日
23:01
22:58
22:58elvis@omarsar0
LingBot VA-V2是Robbyant(蚂蚁集团旗下)开发的视频动作基础模型,原生用于机器人控制。该模型接收视频输入即可生成机器人动作指令,无需额外传感器。项目页面和完整论文已在GitHub公开,提供技术细节与基准评测。
事件专题

推荐理由:Robbyant这个视频动作模型直接用视频训练机器人,别家还没见过类似的。论文和代码全公开,搞机器人和具身智能的可以看看。
22:00
21:22
21:20

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。