11:26官方账号arXiv cs.AI@Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin WangSelectInfer是一个神经元级优化框架,通过离线分析识别任务特定和通用神经元,实现选择性加载和动态计算。在多个数据集上评估,内存占用减少40%-60%,计算量降低30%-50%,同时保持任务性能。该方法无需重新训练或微调,适用于资源受限的边缘设备。论文SelectInferLLM边缘设备推荐理由:这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。原文稍后读已读值得跟进有用关注 SelectInfer
06:56AI Engineer@aiDotEngineer72°TLMs 项目展示了如何在边缘设备上运行小型语言模型和智能体。其中 Function Gemma 模型仅有 2.7 亿参数,在 Pixel 7 上预填充速度接近每秒 2000 token,开箱即用对固定应用意图的准确率达 46%。通过合成数据集微调后,在十个函数中的八个上准确率超过 90%。Cormac 介绍了两种设备端 AI 路径:基于 Gemma 4 的技能框架(含全设备端运行的餐厅轮盘演示)和 Eloquent 转录应用(通过串联两个子十亿参数模型构建)。AI模型Tiny LLM边缘设备Function Gemma推荐理由:边缘设备上跑 LLM 和智能体终于有了可落地的方案——2.7 亿参数的 Function Gemma 在手机上就能达到 90%+ 准确率,做移动端 AI 应用的开发者可以直接参考其微调路径和架构设计。原文稍后读已读值得跟进有用关注 Tiny LLM