7月15日
05:21
04:01
04:01官方账号Perplexity@perplexity_ai
精选
Perplexity AI 宣布开源其内部基准测试 WANDR,该基准用于评估计算机在深度与广度研究能力上的表现。WANDR 最初是为构建 Perplexity Computer 而开发的。开源后,开发者可利用此基准测试自己的模型或系统。目前该基准已发布在 research.perplexity.ai 上。
推荐理由:Perplexity AI 把他们自己用来测试 AI 研究深度的工具 WANDR 开源了,想测测自家模型的研究能力可以用它。
03:56
03:56官方账号Perplexity@perplexity_ai
WANDR不再使用预定义的黄金解决方案来评分,而是动态重新抓取每个引用的页面。它逐条核对每个声明与引证证据的一致性。这种方法适用于需要处理随时间变化事实的任务。

推荐理由:Perplexity AI 搞了个新评估方式 WANDR,不用固定答案打分,而是实时对证据,适合处理时效性事实。
03:55
03:55官方账号Perplexity@perplexity_ai
精选
Perplexity AI 引入了软分数(soft scores)和硬分数(hard scores)两种评估机制,软分数允许部分正确给分,硬分数要求成员完全正确。相关基准任务和评估工具已开源至 GitHub。这套方法为细粒度评估提供了新思路。
推荐理由:Perplexity AI 搞了个新评估方法,软硬分数区别很清晰,基准和工具都开源了,做评测的可以看看。
03:33
03:04
02:16
01:27
01:27官方账号NVIDIA AI@NVIDIAAI
精选
零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。
事件专题

推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。
00:55
00:35
00:35官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 展示一个编码智能体,利用 NeMo RL 和 NeMo Gym 框架,在有限时间内自主构建训练环境并指导 Qwen3-VL-2B 视觉模型学习数彩色星星。模型准确率从 25% 跃升至 96.9%。智能体还能主动提出下一项实验方案,研究员全程仅进行方向性指导。
事件专题

推荐理由:NVIDIA 让智能体自己搭环境教模型,Qwen3-VL-2B 准确率从 25% 飙到 96.9%,还能自动想下一步实验,挺有意思。
7月14日
23:42
23:42Fireworks AI@FireworksAI_HQ
精选76°
LangChain 与 NVIDIA 合作推出 Deep Agents,基于 Nemotron 3 Ultra 开放模型。该智能体成本仅为封闭模型的十分之一。用户可在 Fireworks 上运行,并进行后训练定制化。最终得到专属的专用智能体。
事件专题

推荐理由:LangChain 和 NVIDIA 搞了个开放智能体,成本是封闭模型的1/10,还能自己后训练定制,挺实用的。
18:12
18:07
17:28
17:28小互@imxiaohu
推文比较了三个 Claude 模型的人格特征。Sonnet 4.6 偏顺从、温暖、简洁。Opus 4.6 偏严格、顺从、简洁。Opus 4.7 偏谨慎、深度,更常挑战错误假设并主动指出风险。详细报告来自 best.xiaohu.ai。
事件专题

推荐理由:想了解Claude不同版本的个性差异?这篇文直接对比了Sonnet 4.6、Opus 4.6和Opus 4.7的回复风格,帮你选更合适的模型。
13:55
13:55官方账号vLLM@vllm_project
精选
NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。
事件专题

推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。
12:39
12:39官方账号Greg Brockman@gdb
OpenAI 的 GPT-5.6 系列模型(Sol、Terra、Luna)正式在 Amazon Bedrock 上全面可用。该系列提供三个智能层级,从旗舰推理(Sol)到快速推理(Luna)。基于 Bedrock 的下一代推理引擎,支持高性能、安全、规模和可靠性。开发者可直接在 AWS 上调用这三种模型。
事件专题

推荐理由:OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。
11:41
10:59
10:59岚叔@lufzzliz
Google 计划于本周17日发布新模型 Gemini 3.5。据称在内部测试中,Gemini 3.5 性能超越 GPT-5.6 和 Fable 5。相比上一代 Gemini 3.1 Pro,新模型有显著提升。具体基准成绩未公开。
事件专题

推荐理由:Google 的新模型 Gemini 3.5 本周就要来了,内部测试居然超过了 GPT-5.6 和 Fable 5,比前代 Pro 版强不少。
10:27
10:27ollama@ollama
Nvidia新开源模型Nemotron Ultra在Ollama平台上快速增长。该模型专为开发者设计,可处理复杂且长时间运行的任务。Ollama的集成使得开发者能更便捷地使用这一模型。目前Nemotron Ultra在社区中热度持续上升。
事件专题

推荐理由:Nvidia新出的Nemotron Ultra开源模型在Ollama上很火,能搞定复杂长流程任务,适合做深度开发。
09:49
07:24
06:24
06:21
06:21官方账号Greg Brockman@gdb
OpenAI推出GPT-Live语音模型,在Kevin Lee的测试中,它能在毫秒内响应,从不打断用户,提供比之前版本更流畅的对话体验。Lee在进行执行教练会话时认为效果惊人。该模型适用于语音交互场景。
事件专题

推荐理由:OpenAI的GPT-Live语音模型体验超棒,反应快且不打断,适合语音交互场景。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。