8月13日
18:04
18:02
17:55
17:55官方账号NVIDIA AI@NVIDIAAI
Uniphore实测NVIDIA Nemotron 3.5 Lightning在企业级智能体工作负载中的表现。与参数规模相近的Gemma 4 31B IT相比,Nemotron 3.5 Lightning吞吐量提升5倍,准确率也有明显增长。Uniphore已将其纳入Business AI Cloud高流量路径的评估范围。
事件专题

推荐理由:NVIDIA新模型在企业任务上直接碾压Gemma 4,吞吐量翻5倍,跑真实负载的数据很硬核。
17:55
17:54
17:54AI Will@FinanceYF5
75°
Grok 4.6正式发布,延续4.5的定价策略。新版本在Agent能力和编程任务上有所提升,并能更长时间处理复杂任务。在AA Intelligence Index基准上,Grok 4.6得分追平GPT-5.6 Sol。API价格为每百万输入Token 2美元,输出Token 6美元。
推荐理由:Grok 4.6发布,价格不变,Agent和编程更强,AA Intelligence Index追平GPT-5.6 Sol,API输入2美元/百万Token。
17:53
17:53官方账号Decoder@Matthias Bastian
xAI 发布 Grok 4.6,在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 持平,仅次于 Claude Opus 5。在智能体任务中,Grok 4.6 完成复杂工作流平均约 53 步,而 Claude Opus 5 需要约 103 步。Grok 4.6 的 API 价格比 OpenAI 最强模型低 60% 以上。
事件专题

推荐理由:xAI 的 Grok 4.6 跑分追平 GPT-5.6,智能体任务比 Claude 更省步数,价格还便宜一大截,想换 API 的可以看看。
17:49
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
精选
研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。
推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。
17:46
17:46IT之家博客/媒体
DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。
事件专题

推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。
17:44
17:44IT之家博客/媒体
荣耀CEO李健在Robot Phone发布会后表示,内存涨价和行业竞争构成当前压力。荣耀通过战略调整,AI、影像、设计能力均在提升。YOYO用户接近3亿,全球IoT设备超3000万台。李健认为荣耀已具AI生态终端公司雏形,逆势破局需要经历磨难。
事件专题

推荐理由:荣耀CEO亲自聊内存涨价压力,还透露YOYO用户近3亿、IoT设备超3000万,想看他怎么逆势破局可以读这篇。
17:42
17:42官方账号NVIDIA AI@NVIDIAAI
72°
CrowdStrike 定制 NVIDIA Nemotron 3.5 Lightning,用于网络安全 agent 工作流。该模型达到分析师级准确率,训练速度更快、计算需求更低。它能自动关闭最高 88% 的良性检测,让安全团队专注真实威胁。
事件专题

推荐理由:CrowdStrike 用 Nemotron 3.5 Lightning 做了安全智能体,自动关掉 88% 误报,训练快又省算力。
17:42
17:41
01:55
8月12日
22:39
22:39官方账号LangChain@LangChainAI
精选
LinkedIn的Tanvi Motwani将参加LangChain在纽约举办的Interrupt NYC活动,分享Agentic Eval Playbook。该手册涵盖将智能体追踪转化为黄金数据集、训练LLM-as-a-Judge系统,以及为生产环境智能体构建离线与在线监控。活动定于9月24日举行。

推荐理由:做智能体评估的可以看看,LinkedIn分享怎么把追踪数据变成黄金数据集,还教你怎么训LLM当裁判。