8月13日
17:50
17:50官方一手AWS Machine Learning Blog@Abhi Shivaditya
精选
本文演示如何使用Amazon Athena和CUDOS仪表板分析Amazon Bedrock成本。通过配置CUR 2.0并关联IAM principal数据,可以按principal、项目、团队维度拆分Bedrock支出。文章提供了具体SQL查询示例和仪表板构建步骤,用于在组织内追踪AI成本。
事件专题

推荐理由:AWS官方教程,教你用Athena和CUDOS把Bedrock花费按用户和团队分清楚,适合做云成本管理的人。
17:49
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
精选
研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。
推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。
17:49
17:49
17:48
17:48官方账号NVIDIA AI@NVIDIAAI
CodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。
事件专题

推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
17:48
17:48官方账号arXiv cs.AI@Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang
SCOUT 提出结构化思维链框架,显式建模 3D 环境感知以增强空间理解。其强化学习算法引入多目标过程奖励和定制的优势估计方法,实现推理轨迹的细粒度信用分配。研究者构建了 SCOUT-24k 结构化空间推理数据集。SCOUT-3B 在通用空间基准上提升 16.85%,在复杂空间推理任务上提升 6.3%。SCOUT-7B 超出 GPT-4o 4.28%,且能泛化到多图像和视频场景。
推荐理由:空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。
17:48
17:47
17:47shao__meng@shao__meng
76°
马斯克在 X 上表示,Grok 4.7 将超过当前所有模型。他称 SpaceX 的训练语料独特,若存在真实工程能力更强的模型会感到惊讶。马斯克预计 Grok 4.7 将在一个月内发布。他还提到 Anthropic 是家很棒的公司,可能会很快发布更好的模型。
事件专题

推荐理由:马斯克给 Grok 4.7 背书,说工程能力无敌,还夸了 Anthropic,一个月内就发布,到时候看有没有被打脸。
17:47
17:46
17:46IT之家博客/媒体
DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。
事件专题

推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。
17:46
17:46GitHub@github
71°
GitHub Copilot app将AI辅助开发的工作流整合到单一界面,帮助用户把想法直接转化为代码。GitHub同时推出GitHub Copilot Dev Days活动,邀请开发者参与或组织本地活动。活动报名和主办入口已通过gh.io/dev-days-2026开放。

推荐理由:GitHub 把 Copilot 做成了独立 app,开发流程集中在一个地方;还开了 Dev Days 线下活动,想玩 AI 编程的可以去报名或自己办一场。
17:46
17:46向阳乔木@vista8
博主@vista8 用与DeepSeek V4 Pro相同的提示词测试Grok 4.6。在一个打砖块游戏中,Grok 4.6设计出带熔炉故事场景的情节,音效表现也可圈可点。该模型还一次生成了60种Bento样式风格,其中部分样式的视觉效果优于DeepSeek V4 Pro。
事件专题

推荐理由:有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。
17:45
17:45OpenRouter@OpenRouterAI
OpenRouter 在推特上为旗下模型评估工具 Ori Eval 征求开发者反馈,可私信 @jjacky。该工具的目标是帮开发者从 openrouter.ai/ori/eval 页面找到当前最合适的模型。目前这条推文已有 294 次查看,但暂无评论和转发。
推荐理由:OpenRouter 想继续打磨 Ori Eval,所以跑来问开发者要啥。你要是为选模型发愁,可以去他们的评估页试试。
17:45
17:45量子位@量子位的朋友们
《知识就是力量》杂志社与360科技集团联合推出“知力·纳米”科普科幻AI大片创作平台。360纳米大片流水线参与了该平台的发布。360与《知识就是力量》在发布活动中进行了AI创作交流。
推荐理由:360和《知识就是力量》一起搞了个AI拍大片平台,专门做科普科幻内容,以后自己也能上手玩AI创作了。
17:45
17:45官方一手GitHub Blog@Kayla Cinnamon
GitHub官方博客发布教程,教你在Copilot app中编写第一条提示词。教程讲解了如何选择合适的上下文环境和模型,以及如何启动首个任务。内容面向初学者,包含在移动端和桌面端使用Copilot的具体操作步骤。
推荐理由:GitHub官方手把手教你用Copilot app写提示词,怎么选上下文和模型都讲清楚了,适合刚上手的朋友。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。