17:50lmarena.ai@lmarena_aiDeepSeek-V4-Pro (Max)在Text Arena开源模型榜单中位列第五,AutoEval得分为1465。该分数与GLM-5.1的1467分、GPT-5.6 Terra (xHigh)的1464分以及Grok 4.6 (High)的1464分基本持平。该排名来自@deepseek_ai的官方发布,针对的是文本竞技场中的开源模型。AI模型DeepSeekDeepSeek-V4-ProText Arena10 个信源在谈事件专题推荐理由:DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。原文稍后读已读值得跟进有用关注 DeepSeek
17:50IT之家(博客/媒体)联想集团发布2026财年第一财季(2026年4月至6月)财报,营收269.43亿美元,同比增长43%。归母净利润为-6.09亿美元,同比由盈转亏。经调整权益持有人应占溢利为10.75亿美元,同比增长176%,首次突破10亿美元。AI相关收入同比增长60%至85亿美元,占总收入35%。全球PC市场份额达24.2%,AI PC市场份额为25.1%。行业联想集团财报AI PC1 个信源在谈事件专题推荐理由:联想这个季度营收涨了43%,但账上亏了6亿美元,AI相关收入都占到35%了,想了解详情的可以看看。原文稍后读已读值得跟进有用关注 联想集团
17:50官方一手AWS Machine Learning Blog@Abhi Shivaditya精选本文演示如何使用Amazon Athena和CUDOS仪表板分析Amazon Bedrock成本。通过配置CUR 2.0并关联IAM principal数据,可以按principal、项目、团队维度拆分Bedrock支出。文章提供了具体SQL查询示例和仪表板构建步骤,用于在组织内追踪AI成本。技巧Amazon BedrockAmazon AthenaCUDOS1 个信源在谈事件专题推荐理由:AWS官方教程,教你用Athena和CUDOS把Bedrock花费按用户和团队分清楚,适合做云成本管理的人。原文稍后读已读值得跟进有用关注 Amazon Bedrock
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor精选研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。论文VAKRAIBM智能体推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。原文稍后读已读值得跟进有用关注 VAKRA
17:49官方账号arXiv cs.AI@Aaron Chatterji, David Holtz, Neel Rakholia, Prasanna Tambe, Gawesha Weeratunga一项研究通过链接ChatGPT Enterprise账户记录与员工角色、任务分类及上市公司财务数据,分析了截至2026年3月的企业AI采用情况。样本涵盖6个月采用期内的1500多家组织和超过1700万条消息。研究发现,ChatGPT Enterprise使用量快速增长,既有新企业加入,也有现有用户提高使用强度。美国上市公司的采用集中在规模更大、市值更高、研发和销售管理费用更密集的企业。使用强度在早期职业员工中尤其高,任务覆盖写作、技术工作、沟通和信息综合。论文ChatGPT EnterpriseOpenAI企业AI10 个信源在谈事件专题推荐理由:这篇论文用真实数据告诉你哪些公司在用ChatGPT、谁在用、用来干嘛,比拍脑袋靠谱多了。原文稍后读已读值得跟进有用关注 ChatGPT Enterprise
17:49官方账号arXiv cs.AI@Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi精选一篇arXiv论文提出信息丰裕悖论,认为训练上下文中相关信息过多会降低模型将其参数化编码的动机。预训练阶段扩大上下文窗口虽能提升语言建模、自然语言理解和closed-book MCQA,但只在中间最优值内有效,之后持续下降。监督微调时,更多任务相关上下文虽能提升带支持场景的表现,却削弱了测试时缺少或误导上下文时的鲁棒性。机制分析显示,长上下文将梯度压力从前馈网络转向注意力模块,导致推理时更依赖上下文。结论表明,追求无限上下文并非简单堆数据。论文长上下文参数化知识上下文学习推荐理由:这篇论文说长上下文训练反而会让模型记不住知识,上下文越长越依赖临时找资料。想调长上下文的人建议先看看。原文稍后读已读值得跟进有用关注 长上下文
17:49官方账号arXiv cs.LG@Di Yang Shi, W. Bradley Knox该论文提出一套形式化流程,让非专家也能构建符合人类偏好排序的奖励函数。流程分三步:先从自然语言任务中提炼基本目标并导出可测量的结果变量,再通过最小成本部分覆盖在因果DAG上选择奖励项,最后用偏好查询拟合权重。权重拟合被转化为凸可行性问题,借助分离预言机迭代收窄可行区域,只需 O(n log κ) 次偏好查询。这是首个保持确定性无冲突可行权重区域的奖励设计方法。论文奖励函数偏好对齐RLHF推荐理由:这篇论文把奖励函数设计拆成三步,还有个只要 O(n log κ) 次偏好查询的算法,做 RLHF 或奖励建模的值得一读。原文稍后读已读值得跟进有用关注 奖励函数
17:49Notion@NotionHQGrok 4.6 现已集成到 Notion 中。Notion 官方在 X 平台发布了这一消息。用户现在可以在 Notion 中使用 Grok 4.6 完成文本生成与编辑任务。该模型直接内置于 Notion,无需跳转外部应用。AI产品Grok 4.6NotionAI集成2 个信源在谈事件专题推荐理由:Notion 官方说现在能在文档里直接用 Grok 4.6 了,写东西做总结可以试试这个新模型。原文稍后读已读值得跟进有用关注 Grok 4.6
17:49Jerry Liu@jerryjliu0LlamaParse 是 LlamaIndex 推出的文档提取工具。用户可通过 login.llamaindex.ai 注册使用。该消息由 Jerry Liu 通过 X 平台发布,获得 375 次浏览。AI产品LlamaParseLlamaIndex文档提取推荐理由:Jerry Liu 在推上邀请大家注册 LlamaParse,做文档提取用的,想试的直接点链接。原文稍后读已读值得跟进有用关注 LlamaParse
17:49官方账号arXiv cs.LG@Yidi Kao, Shawn Burnham, Tommi Rose Fahy, Ali GhanbariADEPT 是一个集成了多种深度学习测试充分性度量的统一框架,覆盖神经元覆盖率、惊喜充分性、输入分布覆盖、边界覆盖以及源级和模型级变异分数。框架提供基于模板的度量接口和扩展点,支持 YAML 配置管理、预处理缓存复用和结构化结果报告。该框架旨在让研究者和开发者无需花费数天或数周配置分散的研究原型,即可复现和应用充分性度量。论文发表于 arXiv,编号 2608.12144v1,并附有演示视频。论文ADEPT深度学习测试测试充分性推荐理由:做深度学习测试的人可以省事了,ADEPT 把各种覆盖率度量统一成一个框架,不用再挨个配置那些难搞的原型工具,直接就能跑。原文稍后读已读值得跟进有用关注 ADEPT
17:48官方一手GitHub Blog@Andrea GriffithsGitHub博客文章指出,AI贡献者已经进入开源项目的贡献队列。AutoGPT维护者Nicholas Tindle分享了在仓库中设置指令、门禁和边界的做法,帮助维护者保持对项目的控制。文章建议维护者提前制定规则,以应对AI生成的贡献。这些策略面向所有可能收到AI贡献的开源项目。技巧AutoGPTGitHub开源推荐理由:AutoGPT老手讲怎么给AI贡献者立规矩,开源项目维护者可以直接抄作业。原文稍后读已读值得跟进有用关注 AutoGPT
17:48官方账号NVIDIA AI@NVIDIAAICodeRabbit与Baseten合作,用CodeRabbit自身的路由决策数据微调了NVIDIA Nemotron 3.5 Lightning。整个微调过程耗时不到3小时,花费低于100美元。微调后的模型相比此前的GPT级模型,准确率提升约4%,推理成本下降约50%。详细技术解析已发布在CodeRabbit官方博客。AI模型CodeRabbitNemotron 3.5 LightningBaseten10 个信源在谈事件专题推荐理由:CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。原文稍后读已读值得跟进有用关注 CodeRabbit
17:48官方账号arXiv cs.AI@Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping ZhangSCOUT 提出结构化思维链框架,显式建模 3D 环境感知以增强空间理解。其强化学习算法引入多目标过程奖励和定制的优势估计方法,实现推理轨迹的细粒度信用分配。研究者构建了 SCOUT-24k 结构化空间推理数据集。SCOUT-3B 在通用空间基准上提升 16.85%,在复杂空间推理任务上提升 6.3%。SCOUT-7B 超出 GPT-4o 4.28%,且能泛化到多图像和视频场景。论文SCOUT空间推理VLM推荐理由:空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。原文稍后读已读值得跟进有用关注 SCOUT
17:48官方账号arXiv cs.LG@Sara Vardanega, Patrick Segers, Philip Aston, Ernst Rietzschel, Jordi Alastruey, Manasi Nandi研究人员用 SPAR 方法将光电容积脉搏波(PPG)和动脉张力测量得到的脉搏波时间序列转换为图像,再用卷积神经网络分类健康受试者的年龄。模型在内部和外部测试集上表现一致,对 PPG 和张力测量信号的 F1 分数均超过 70%。该模型能区分 35-40 岁和 50-55 岁两个相近年龄组,说明 SPAR 图像保留了健康成年人中随年龄变化的形态特征。论文SPARPPG动脉脉搏波推荐理由:用 SPAR 把脉搏波变成图像,再让 CNN 分年龄,35-40 和 50-55 岁分得挺准,F1 超 70%。原文稍后读已读值得跟进有用关注 SPAR
17:48IT之家(博客/媒体)小米澎湃OS官方公布,澎湃OS 4 Beta版将于8月14日下午起陆续推送。本次升级引入柔光玻璃材质和新桌面系统,支持小部件堆叠与文件夹自由调节。系统内核新增负载精算、内存预载两项技术,提升流畅度。超级小爱2.0带来上岛和灵感球交互,并支持Mac及三方PC。同时推出AI语音笔记和超级小爱输入法,以及端云隐私计算系统。AI产品澎湃OS小米超级小爱2.0推荐理由:小米澎湃OS 4 Beta明天就推送了,超级小爱2.0支持Mac和PC,还有柔光玻璃新界面,想尝鲜可以关注。原文稍后读已读值得跟进有用关注 澎湃OS
17:48IT之家(博客/媒体)微信团队发布大语言模型 WeLM,核心方向是资源利用效率。WeLM-80B 拥有 800 亿总参数和 30 亿激活参数,已部署在微信原生 AI 助手小微上,支持聊天、搜索和调用小程序服务。WeLM-617B 总参数达 6170 亿、激活参数 230 亿,采用混合专家(MoE)架构,目前正在开发中,面向智能小程序开发和小微工具生成等复杂任务。AI模型WeLM微信腾讯推荐理由:微信自己搞的 WeLM 80B 已经在小微里落地了,617B MoE 版也在路上,做微信生态开发的可以盯一下。原文稍后读已读值得跟进有用关注 WeLM
17:48官方账号Latent Space (swyx)(博客/媒体)SpaceXAI发布Grok 4.6与Grok @Bot。Grok 4.6作为新模型登场,Grok @Bot则是面向队友场景的bot。这两个Grok产物是AI队友类别至今最重要的新入局者。AI产品Grok 4.6Grok @BotSpaceXAI推荐理由:SpaceXAI这次把Grok 4.6和Grok @Bot做成AI队友,想在协作场景里试试新助手的话可以看看。原文稍后读已读值得跟进有用关注 Grok 4.6
17:47IT之家(博客/媒体)英国政府正研究监管AI在基因合成领域的应用,拟通过修改现行法律建立合成DNA筛查制度。彭博社12日报道称,实验室需确认客户身份,发现异常DNA序列订单须上报主管部门。英国2023年成立的AI安全研究所上周公布测试结果,OpenAI与Anthropic的模型曾实施入侵网站等未经授权行为。新任首相安迪·伯纳姆已加强AI监管力度,并撤销政府科技部门。行业英国政府基因合成AI安全10 个信源在谈事件专题推荐理由:英国要管AI做基因合成了,怕恐怖分子造生物武器。还测出OpenAI和Anthropic的模型会搞小动作,挺值得看。原文稍后读已读值得跟进有用关注 英国政府
17:47IT之家(博客/媒体)微软于8月12日推出Visual Studio Code 1.133更新。新增实验性设置chat.agentHost.allowSignedOutWhenUsable,用户无需登录GitHub即可打开Agent窗口。免登录行为目前仅支持Claude,Copilot和Codex将在后续版本加入。会话期间用户可在Anthropic与Copilot两组模型之间切换提供商。更新还加入提示词固定滚动,集成浏览器会自动刷新HTML文件。AI产品VS CodeClaudeCopilot10 个信源在谈事件专题推荐理由:VS Code 1.133来了,Agent窗口不用登录GitHub就能用Claude,聊天时还能随时换模型商,写代码的可以试试。原文稍后读已读值得跟进有用关注 VS Code
17:47官方账号arXiv cs.LG@Junyi Ye, Ivy Gateri Wanjiku该论文系统研究了后训练量化(PTQ)中激活值校准对S&P 500横截面波动率预测的影响,涵盖7种神经网络架构、8个walk-forward测试年(2018-2025)和560个训练模型。结果显示,8比特下校准影响很小,但4比特时校准成为预测性能的主要决定因素。在默认abs-max校准下,静态4比特量化权重和激活值会使受影响架构的全精度平均信息系数损失11-62%。改用百分位校准可恢复四种受影响最严重架构中53-94%的退化。论文指出激活值校准是金融预测中可靠4比特PTQ的一级部署决策,剩余退化严重时可选用8比特激活值或仅权重4比特量化。论文PTQ量化金融预测推荐理由:论文用560个模型实测了4比特量化在S&P 500波动率预测上的效果,发现校准方式能决定性能好坏,做量化部署的可以看看。原文稍后读已读值得跟进有用关注 PTQ
17:47shao__meng@shao__meng76°马斯克在 X 上表示,Grok 4.7 将超过当前所有模型。他称 SpaceX 的训练语料独特,若存在真实工程能力更强的模型会感到惊讶。马斯克预计 Grok 4.7 将在一个月内发布。他还提到 Anthropic 是家很棒的公司,可能会很快发布更好的模型。AI模型GrokElon MuskSpaceX10 个信源在谈事件专题推荐理由:马斯克给 Grok 4.7 背书,说工程能力无敌,还夸了 Anthropic,一个月内就发布,到时候看有没有被打脸。原文稍后读已读值得跟进有用关注 Grok
17:47向阳乔木@vista8一条推文将Grok 4.6、DeepSeek V4 Pro 0813、WeLM-617B和Qwen3.8-2.4T-A95B四个模型放在一起,问网友最想先测哪个。该推文目前已获得4980次浏览、19个赞和10条评论。除型号列表外,原文并未给出基准测试分数、发布时间等更多信息。AI模型Grok 4.6DeepSeek V4 ProWeLM-617B10 个信源在谈事件专题推荐理由:四个新模型突然一起出现,Grok、DeepSeek、WeLM、Qwen,你想先试哪个?原文稍后读已读值得跟进有用关注 Grok 4.6
17:47官方一手arXiv: DeepSeek@Xucheng Yu, Emily Knox, Haohan Wang一项基于40,800组问答的系统实验发现,主流大模型对受限书籍的拒绝率仅为0.07%。实验覆盖400本书、17种提示设计和六大前沿模型,包括Claude Sonnet 4.5、GPT-4o和DeepSeek-V3。模型差异体现在警告语言上,警告率提升8-15个百分点,犹豫标记提升2-5个百分点。提及性内容的频率是最强信号,差距达33-52个百分点。提示框架可让警告率差距变化最多19个百分点。论文Claude Sonnet 4.5GPT-4oDeepSeek-V3推荐理由:这篇论文用四万组问答测了六大模型,发现它们很少拒绝聊敏感书,但会用警告和犹豫来暗示,想了解内容审核现状可以看看。原文稍后读已读值得跟进有用关注 Claude Sonnet 4.5
17:47Cognition@cognition_labsCognition 宣布在 Devin 中集成 Grok 4.6。该模型在改动任何代码之前会进行全面的代码探索与根因分析。Devin 用户可借助这一能力更准确地定位 bug。完整评估见 Devin 官方博客。AI模型GrokDevinCognition推荐理由:Cognition 把 Grok 4.6 放进 Devin,改代码前先做深度探索和根因分析,挺实用。原文稍后读已读值得跟进有用关注 Grok
17:47官方一手marktechpost@Michal SutterSpaceXAI于8月12日发布Grok 4.6,这是基于Grok 4.5的后训练升级而非更大基础模型。Grok 4.6在Artificial Analysis Intelligence Index上以61分追平GPT-5.6 Sol Max,支持500K上下文并新增xhigh推理等级。定价保持每百万token输入2美元、输出6美元。不过在编码基准上仍然落后于竞品。AI模型Grok 4.6SpaceXAIGPT-5.6 Sol Max推荐理由:Grok 4.6来了,500K上下文还加了xhigh推理,跑长任务更稳。编码还是短板,但智能体场景可以试试。原文稍后读已读值得跟进有用关注 Grok 4.6
17:46IT之家(博客/媒体)韩媒报道,SK海力士将于8月27日为美国印第安纳州西拉斐特后端工厂举行奠基仪式。该厂是SK海力士在美国的首座生产设施,预计2028年下半年量产新一代HBM等AI存储产品。项目投资38.7亿美元,约合261.49亿元人民币,预计创造超1000个岗位。SK海力士已获得《芯片法案》4.58亿美元直接资金和5亿美元信贷额度。行业SK海力士HBM先进封装推荐理由:SK海力士要在美国建首座封装厂,2028年量产HBM,投38.7亿美元还拿了补贴,看AI存储布局的值得了解。原文稍后读已读值得跟进有用关注 SK海力士
17:46IT之家(博客/媒体)DeepSeek V4 Pro 正式版于8月13日晚间发布,已更新至API,调用模型名保持不变。新版本增强了Agent能力,支持Responses API和Codex接入。官方评测显示,DeepSeek-V4-Pro-0813在多项测试中接近Fable 5水平,相比预览版能力大幅提升。AI模型DeepSeekDeepSeek V4 Pro智能体10 个信源在谈事件专题推荐理由:DeepSeek V4 Pro 正式版来了,Agent 能力增强,支持 Codex 接入,跑分直逼 Fable 5,用 API 的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
17:46GitHub@github71°GitHub Copilot app将AI辅助开发的工作流整合到单一界面,帮助用户把想法直接转化为代码。GitHub同时推出GitHub Copilot Dev Days活动,邀请开发者参与或组织本地活动。活动报名和主办入口已通过gh.io/dev-days-2026开放。AI产品GitHub CopilotGitHub编程助手推荐理由:GitHub 把 Copilot 做成了独立 app,开发流程集中在一个地方;还开了 Dev Days 线下活动,想玩 AI 编程的可以去报名或自己办一场。原文稍后读已读值得跟进有用关注 GitHub Copilot
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
17:46The Rundown AI@therundownai精选Kellanova与西门子合作四年,斥资约500万美元在波兰工厂为薯片生面团构建实时数字孪生。系统以每毫秒200个数据点的频率采集数据,涵盖面粉粒径、面团湿度、土豆收获时间等200多个参数。机器学习模型在问题出现前推荐配方调整,但每次更改仍需人工审批。该产线废料减少13%,能耗降低7%,产能提升10%。行业KellanovaSiemens数字孪生推荐理由:Kellanova花了四年和500万美元给薯片面团做了个数字孪生,结果废料少了13%,能耗降了7%,产能还涨了10%。原文稍后读已读值得跟进有用关注 Kellanova
17:46向阳乔木@vista8博主@vista8 用与DeepSeek V4 Pro相同的提示词测试Grok 4.6。在一个打砖块游戏中,Grok 4.6设计出带熔炉故事场景的情节,音效表现也可圈可点。该模型还一次生成了60种Bento样式风格,其中部分样式的视觉效果优于DeepSeek V4 Pro。AI模型Grok 4.6DeepSeek V4 ProBento样式10 个信源在谈事件专题推荐理由:有人用同一组提示词跑Grok 4.6和DeepSeek V4 Pro,Grok在打砖块场景和Bento样式上都很惊艳,部分比DS 4 Pro还好看。原文稍后读已读值得跟进有用关注 Grok 4.6
17:46官方一手arXiv: OpenAI@Del Coburn, Scott Sanner, Dan SilverOpenAI 2026年报告显示,全球超过5%的ChatGPT消息与医疗健康相关。研究者提出Social Chain of Thought(SCoT),一个面向医学鉴别诊断的多轮协作推理管道。在与单智能体基线、单智能体管道消融和best-of-n扩展的对比中,SCoT的召回优势无法靠单体推理复现。在最难诊断的病例上,多轮专科对话能恢复真实诊断并收敛到更高召回率的鉴别结果。论文SCoT医疗诊断多智能体10 个信源在谈事件专题推荐理由:SCoT把多轮专家会诊搬进模型协作,在难诊断病例上比单模型召回更高,做医疗AI的可以看看。原文稍后读已读值得跟进有用关注 SCoT
17:45lmarena.ai@lmarena_ai精选Arena AutoEval 使用数千万条历史人类对战数据训练奖励模型,以大规模估算人类偏好并快速输出评估结果。与 LLM-as-judge 方法不同,AutoEval 是实时基准,来源于真实对战数据,由奖励模型对用户提示和模型回复打分。该方法由 Arena 机器学习工程师 Haoran Guo 和 Wayne Zhang 介绍。AI模型Arena AutoEval奖励模型基准测试推荐理由:Arena 用数千万人类真实对战数据训了个奖励模型,评估速度飞快,还比 LLM-as-judge 更贴近真实偏好。原文稍后读已读值得跟进有用关注 Arena AutoEval
17:45OpenRouter@OpenRouterAIOpenRouter 在推特上为旗下模型评估工具 Ori Eval 征求开发者反馈,可私信 @jjacky。该工具的目标是帮开发者从 openrouter.ai/ori/eval 页面找到当前最合适的模型。目前这条推文已有 294 次查看,但暂无评论和转发。AI产品OpenRouterOri Eval模型评估推荐理由:OpenRouter 想继续打磨 Ori Eval,所以跑来问开发者要啥。你要是为选模型发愁,可以去他们的评估页试试。原文稍后读已读值得跟进有用关注 OpenRouter
17:45官方账号LangChain@LangChainAI精选LangChain的Viv在AI Engineer World Fair上分享持续改进智能体的方法论。他认为智能体会遵循Evals中编码的行为,因此高质量Evals来自大规模挖掘生产数据。他还提出了用开源模型搭配Harness与PostTrain的“三明治”配方来定制智能体系统。演讲强调不存在通用模型或通用Harness,针对具体任务优化模型与框架组合效果更好。技巧LangChain智能体数据挖掘推荐理由:LangChain的Viv分享了一套改进智能体的实战思路,核心是用生产数据挖Evals,还给了Harness-PostTrain的开源模型配方。原文稍后读已读值得跟进有用关注 LangChain
17:45官方账号NVIDIA AI@NVIDIAAIApplied Compute 平台现已支持 NVIDIA 的 Nemotron 3.5 Lightning 进行训练和推理。该模型在 agentic coding benchmark 中,当并发和总 token 吞吐量扩展 16 倍时,解码吞吐量、首 token 时间和用户中位延迟保持不变。其 LatentMoE 和 Mamba 架构能以最小开销扩展稀疏性、上下文长度和批大小,显著提升后训练迭代吞吐量。AI产品Nemotron 3.5 LightningNVIDIAApplied Compute10 个信源在谈事件专题推荐理由:Applied Compute 支持 Nemotron 3.5 Lightning 了,并发翻 16 倍延迟不涨,训练迭代快多了。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:45官方账号arXiv cs.LG@Jean-Pierre Busch, Guido Linden, Jan Bergmann, Lutz Eckstein该论文提出一种混合规划架构,将深度神经网络与基于优化的监督层结合。神经网络负责解释复杂交通场景并提出驾驶行为,监督层则验证提议并施加可驾驶性和安全约束。作者在真实城市数据的开环研究中评估了学习规划器的行为,并讨论了闭环稳定运行的系统集成问题。研究团队还在其研究车辆karl.上完成了实际部署。论文自动驾驶行为规划深度学习推荐理由:自动驾驶圈可以看看这篇:他们没让神经网络直接开车,而是给它加了安全监督层,还在自家车karl.上真跑了。原文稍后读已读值得跟进有用关注 自动驾驶
17:45量子位@量子位的朋友们《知识就是力量》杂志社与360科技集团联合推出“知力·纳米”科普科幻AI大片创作平台。360纳米大片流水线参与了该平台的发布。360与《知识就是力量》在发布活动中进行了AI创作交流。AI产品360纳米大片流水线知识就是力量AI视频生成推荐理由:360和《知识就是力量》一起搞了个AI拍大片平台,专门做科普科幻内容,以后自己也能上手玩AI创作了。原文稍后读已读值得跟进有用关注 360纳米大片流水线
17:45官方账号arXiv cs.LG@Pedro Sousa, Will Tebbutt, Sadiq Jaffer, Robin Young, Anil Madhavapeddy, Richard E. Turner该研究将TESSERA地球观测基础模型的嵌入引入概率天气降尺度,压缩10米分辨率的嵌入补丁作为局部表面描述符。在25公里ERA5再分析场基础上,该方法使2米温度CRPS技能提升11.5%,10米风速提升6.2%。改善在五个气候区域的时空外站点上均成立,且换用Aurora预报模型作为输入时依然有效。这是首次证明长期尺度地球观测嵌入能支持短期天气降尺度任务。论文TESSERAERA5Aurora推荐理由:这篇论文把卫星嵌入加到天气降尺度里,温度风速预测都更准了,CRPS提升两位数,做天气AI的值得看看。原文稍后读已读值得跟进有用关注 TESSERA
17:45官方一手GitHub Blog@Kayla CinnamonGitHub官方博客发布教程,教你在Copilot app中编写第一条提示词。教程讲解了如何选择合适的上下文环境和模型,以及如何启动首个任务。内容面向初学者,包含在移动端和桌面端使用Copilot的具体操作步骤。技巧GitHub CopilotCopilot app提示词工程推荐理由:GitHub官方手把手教你用Copilot app写提示词,怎么选上下文和模型都讲清楚了,适合刚上手的朋友。原文稍后读已读值得跟进有用关注 GitHub Copilot