在 8 美元 ESP32-S3 上运行近 2900 万参数 LLM,利用 Gemma Per-Layer Embeddings 将参数存于 Flash

让 8 美元的 ESP32-S3 芯片跑起近 2900 万参数的 LLM。诀窍是把大部分参数放在 Flash 里而不是 RAM 里,靠的是 Google Gemma 的 Per-Layer Embed...

精选理由

别人用 8 美元的芯片跑大模型,靠的是 Gemma 的分层嵌入技巧。想低成本部署边缘 AI?这个开源项目就是参考答案。

AI 摘要

开发者成功在售价 8 美元的 ESP32-S3 芯片上运行了接近 2900 万参数的 LLM。核心技巧是将大部分模型参数存储在 Flash 而非 RAM 中,借鉴了 Google Gemma 的 Per-Layer Embeddings 思路。该方法大幅降低了内存占用,使低成本边缘设备也能运行较大模型。项目已开源在 GitHub 上。

原文 · Geek

让 8 美元的 ESP32-S3 芯片跑起近 2900 万参数的 LLM。诀窍是把大部分参数放在 Flash 里而不是 RAM 里,靠的是 Google Gemma 的 Per-Layer Embed...

让 8 美元的 ESP32-S3 芯片跑起近 2900 万参数的 LLM。诀窍是把大部分参数放在 Flash 里而不是 RAM 里,靠的是 Google Gemma 的 Per-Layer Embeddings 思路。 github.com/slvDev/esp32-ai 💬 1 🔄 1 ❤️ 3 👀 1257 📊 2 ⚡