英伟达新出的说话人日志模型,100M 能本地跑,专门负责“谁在何时说话”,配 ASR 就能做分角色转写,比 Qwen 那个更专精。
#NVIDIA
NVIDIA 开源了个说话人追踪模型,1秒语音就能分清谁在说话,还能让 Reachy Mini 机器人认人记名字,商用许可也友好。
NVIDIA 的说话人分离模型拿了 Diarization-Bench 第一,错误率 14.72%,比第二名低了近四分之一,做语音相关应用的可以关注下。
NVIDIA 出了个 100M 参数的小模型,专门搞定多人说话分不清谁是谁的问题,8 人以内、说话重叠都能识别,已经上了 Hugging Face。
NVIDIA 放出了一个教程,教你用 Nemotron 3 做说话人分离,会议转写能分清谁说了哪句,想做语音应用可以照着搭一遍。
在搞生产级 agent 部署的朋友可以看看,讲的是 EKS 加 NVIDIA 加 LangChain 这套组合怎么落地,能注册去现场听。
Sluicebox 拿 Nemotron 3 Ultra 做了个叫 Lucy 的供应商数据智能体,算碳足迹的成本降了 51–80%,做企业 Agent 的可以看看怎么落地。
NVIDIA 的 Nemotron Labs 搞了场专家直播,专门讲怎么评估 Agent 技能,做智能体开发的话可以看看他们的评估思路。
朋友发了新模型,叫 Nemotron-SEA-LION-v4.8,是 AI Singapore 和 NVIDIA 联合做的,专门针对东南亚的语言,比之前版本更好。
NVIDIA 新的 World Model Atlas 能用 32 张照片生成 3D 场景,让你像在真实世界一样飞进去逛,比普通 3D 模型更智能。
英伟达新出的 DSX MaxLPS 技术,能让 AI 工厂在相同电力下多处理 40% 的 token,对数据中心很实用。
NVIDIA 和 Cohere 联手,在 Model Vault 中加入了 Confidential Computing 功能,能更好地保护模型数据隐私,对需要处理敏感数据的用户来说是个新选择。
NVIDIA 工程师分享的 Nemotron 3 Ultra 在 4×B200 硬件上通过 NIM 微服务优化,系统吞吐提升 180%,服务用户数翻倍,值得看看具体是怎么做的。
英伟达出了个新专业显卡,叫 RTX PRO 5500 Blackwell,有 84GB 大显存,适合做 AI 和模拟这类计算量大的工作。
NVIDIA 官方出了一套 LLM 推理指标体系,把 prefill 和 decode 阶段的延迟、吞吐等概念讲得特别清楚,对选型或容量规划很有帮助。
NVIDIA 新发布的 Nemotron 3 Embed 8B 模型在网页检索任务上表现很棒,比之前的一些模型更好。
NVIDIA 新发布的 Nemotron 3 Embed 8B 模型在网页搜索相关任务上表现很好,值得看看。
NVIDIA 的 Cosmos 3 Nano 模型在 AI City Challenge 中拿了奖,是交通视频预测方面的好工具。
英伟达和澳洲的几个公司一起建AI工厂,到2027年能到2GW规模,用NVIDIA DSX架构,能支持NVIDIA的运算技术,还方便澳洲人用NVIDIA Nemotron模型。