01:35Qdrant@qdrant_engine72°高通的Alan Zhu在Vector Space Day SF展示了设备端AI的延迟优势。NPU在agentic search任务中瞬时响应,而GPU耗时12秒,CPU耗时30秒后因发热降频。NPU在整个会话中保持90 tokens/秒,温度仅37°C。CPU速度持续下降。NPU的预填充速度足以在数秒内处理数千本地文件并返回引用答案,无需网络。AI模型QualcommNPUGPU推荐理由:高通用NPU跑agentic搜索,GPU要12秒CPU要30秒,NPU瞬间搞定还不发烫,这才是真有用的本地AI。原文稍后读已读值得跟进有用关注 Qualcomm
16:17IT之家(博客/媒体)SK海力士通过其美国圣何塞子公司发布招聘,招募DRAM-逻辑3D堆叠技术人才。该技术面向设备内AI市场,旨在通过垂直堆叠DRAM Die与逻辑Die建立更多短距离I/O连接。相比标准LPDDR,3D堆叠可提升带宽、降低延迟、改进能效,以解决端侧AI大模型推理的位宽瓶颈。招聘要求人才能够与美国客户紧密合作,领导3D堆叠DRAM逻辑芯片联合设计。行业SK海力士DRAM3D堆叠推荐理由:SK海力士在美招人搞3D堆叠内存,专为设备端AI提升带宽和能效,跟标准LPDDR拉开差距。原文稍后读已读值得跟进有用关注 SK海力士
03:06Qdrant@qdrant_engineQdrant Edge是一个面向边缘设备的向量数据库。该广播演示了如何在设备端通过Qdrant Edge实现检索增强生成(RAG)。设备端RAG能提升AI应用的实时性和隐私保护,降低对云端的依赖。具体实现细节未在推文中展开。技巧Qdrant EdgeRAG设备端AI推荐理由:Qdrant展示了如何在手机上跑RAG,用他们的Edge产品。如果你在意隐私和离线AI,看看这个。原文稍后读已读值得跟进有用关注 Qdrant Edge
11:42官方账号arXiv cs.LG@Liang Su论文提出execution-state capsules,一种图绑定的检查点与恢复机制,能保存KV缓存、循环状态、卷积状态等完整执行状态。基于此实现的FlashRT运行时在RTX 5090上,恢复操作亚毫秒级,TTFT相比冷预填充在2k tokens时加速3.9倍,16k tokens时加速27倍。在Jetson AGX Thor和DGX Spark上保持相同正确性和结构特性。该方法不取代高吞吐KV缓存服务,而是为显式执行状态复用提供互补的低延迟方案。论文Execution-State CapsulesFlashRT设备端AI推荐理由:FlashRT用执行状态胶囊实现了亚毫秒级恢复,比传统KV缓存多保存循环状态,对交互式AI和机器人很关键。原文稍后读已读值得跟进有用关注 Execution-State Capsules
07:58官方账号Microsoft Research@MSFTResearch微软研究院在MSBuild上展示了MagenticLite,一种可在本地设备上运行的小型模型,用于驱动智能体体验。该方案强调在设备端运行,无需依赖云端,从而提升隐私和响应速度。MagenticLite旨在让智能体功能更轻量、更普及,适合资源受限的设备。这标志着微软在边缘AI和智能体技术上的新进展。AI产品智能体小模型设备端AI推荐理由:微软把智能体体验压缩到设备端小模型上,做边缘AI或隐私敏感应用的开发者值得关注,可以直接在本地跑智能体。原文稍后读已读值得跟进有用关注 智能体