17:50Geek@geekbb开发者成功在售价 8 美元的 ESP32-S3 芯片上运行了接近 2900 万参数的 LLM。核心技巧是将大部分模型参数存储在 Flash 而非 RAM 中,借鉴了 Google Gemma 的 Per-Layer Embeddings 思路。该方法大幅降低了内存占用,使低成本边缘设备也能运行较大模型。项目已开源在 GitHub 上。技巧ESP32-S3LLMGemma推荐理由:别人用 8 美元的芯片跑大模型,靠的是 Gemma 的分层嵌入技巧。想低成本部署边缘 AI?这个开源项目就是参考答案。原文稍后读已读值得跟进有用关注 ESP32-S3