LLM ขนาดเล็กทำงานบน ESP32‑S3 เพียง $10 ให้ความเร็ว 9.88 token ต่อวินาที

ที่มาภาพ: TechRadar

AI10 สิงหาคม 2569 เวลา 02:30อ่าน 6 นาทีTechRadar

LLM ขนาดเล็กทำงานบน ESP32‑S3 เพียง $10 ให้ความเร็ว 9.88 token ต่อวินาที

⚡ สรุป 30 วิ

slvDev พัฒนาโมเดล LLM 28.9 ล้านพารามิเตอร์ ทำงานอิสระบน ESP32‑S3 ราคา $10 ด้วยเทคนิค quantization 4‑bit เร็ว 9.88 token/วินาที ไม่ต้องเชื่อมอินเทอร์เน็ต

การพัฒนาโมเดลภาษาแบบขนาดเล็กที่ทำงานได้โดยอิสระบนไมโครคอนโทรลเลอร์ราคาเพียง $10 นำเสนอแนวทางใหม่สำหรับการใช้งาน LLM ในอุปกรณ์ฝังตัวอย่าง ESP32‑S3 โดย slvDev สร้างโมเดล 28.9 ล้านพารามิเตอร์ สามารถผลิตข้อความสไตล์ TinyStories ได้ที่อัตรา 9.88 token ต่อวินาที ทั้งหมดดำเนินการภายในชิปโดยไม่ต้องเชื่อมต่ออินเทอร์เน็ต

Overview

โครงการชื่อ esp32‑ai ถูกเปิดเผยบน GitHub เมื่อปลายเดือนกรกฎาคม 2026 ภายใต้สัญญาอนุญาต MIT license โครงการได้รับความสนใจจากชุมชนโอเพ่นซอร์สโดยรวบรวมดาว *Stars* มากกว่า 3,600 ดาวและมีการ Fork เกิน 470 ครั้ง การแสดงผลบนช่อง YouTube ของ Better Stack ยืนยันว่าโมเดลทำงานได้อย่างเต็มที่แม้ในขีดจำกัดของฮาร์ดแวร์

นักพัฒนาชี้ให้เห็นว่าการฝึกโมเดลใช้ชุดข้อมูล TinyStories จาก Microsoft Research ซึ่งเน้นการสร้างเรื่องสั้น ๆ ที่มีความยาวและโครงสร้างง่าย โมเดลนี้ถูกปรับขนาดจากเวอร์ชันเต็มเพื่อให้เข้ากับหน่วยความจำของ ESP32‑S3 ซึ่งมี 512 KB SRAM, 8 MB PSRAM และ 16 MB flash

Technical Approach

การลดขนาดโมเดลทำได้โดยใช้เทคนิค quantization ไปยังความแม่นยำระดับสี่บิต ซึ่งช่วยลดปริมาณหน่วยความจำที่ต้องใช้จากประมาณ 60 MB (สำหรับ 16‑bit) เหลือเพียง ≈ 14.9 MB การจัดเก็บส่วนใหญ่ของพารามิเตอร์ใน flash storage ทำให้สามารถเก็บ ≈ 25 ล้านพารามิเตอร์** (ประมาณ 12 MB ที่สี่บิต) ได้โดยไม่ทำให้แบนด์วิธของ flash กลายเป็นคอขวด

  • พารามิเตอร์ฝังตัว (embedding tables) ถูกย้ายไปยัง flash
  • หน่วยความจำทำงานระดับหลายชั้น: flash สำหรับพารามิเตอร์ที่อ่านน้อย, PSRAM เก็บ core โมเดลและ output head, SRAM ใช้เก็บ activation และ norm weights

โครงสร้างการเข้าถึงแบบนี้เรียกว่า **Per‑Layer Embeddings (PLE) ซึ่งอ่านค่าจาก flash เพียงประมาณ 450 ไบต์ต่อ token ทำให้กระบวนการคำนวณยังคงอยู่ในระดับที่สามารถทำได้เร็วพอบน ESP32‑S3

Performance & Benchmarks

ผลลัพธ์ของโครงการคือ 9.88 token ต่อวินาที ซึ่งเทียบกับความเร็วในการอ่านปกติของมนุษย์ การแสดงผลนี้ถือว่าพอเพียงสำหรับการสร้างเรื่องสั้น ๆ ในบริบทที่ไม่ต้องการตอบสนองแบบเรียลไทม์ โมเดลยังคงทำงานได้อย่างสมบูรณ์โดยไม่มีข้อมูลออกจากชิป ทำให้เหมาะกับการใช้งานในระบบที่ต้องการความเป็นส่วนตัวสูง

แม้ว่าการย้ายพารามิเตอร์ไปเก็บใน flash จะลดความหน่วงของการเข้าถึง แต่ยังคงมีข้อจำกัดด้านแบนด์วิธเมื่ออ่านบรรทัดต่อบรรทัดอย่างต่อเนื่อง อย่างไรก็ตาม การออกแบบ PLE ช่วยให้การอ่านจาก flash เกิดขึ้นเพียงครั้งเดียวต่อ token ทำให้ไม่เป็นอุปสรรคสำคัญต่ออัตราการประมวลผล

Limitations

โมเดลนี้มีขอบเขตการทำงานที่จำกัดอย่างชัดเจน ไม่สามารถตอบคำถามเชิงข้อมูล, ปฏิบัติตามคำสั่ง, เขียนโค้ด หรือให้ข้อมูลความจริงได้ ความจำกัดส่วนใหญ่เกิดจาก ≈ 4 ล้านพารามิเตอร์** ที่รับผิดชอบด้านการให้เหตุผล ซึ่งยังคงอยู่ใน SRAM/PSRAM ทำให้ความสามารถของโมเดลไม่เปลี่ยนแปลงแม้จะใช้เทคนิค PLE

ในที่เดียวกัน นักพัฒนายังปล่อย Barista, โมเดลย่อยที่ออกแบบมาเพื่อให้ข้อมูลเกี่ยวกับกาแฟเอสเปรสโซ่เท่านั้น ซึ่งเป็นการเน้นความเชี่ยวชาญเฉพาะด้าน แม้ว่าวิธีนี้จะไม่ได้ทำให้โมเดลขนาดเล็กมี “สมอง” ที่ฉลาดขึ้น แต่แสดงให้เห็นว่าการจัดสรรหน่วยความจำอย่างเหมาะสมสามารถเปิดโอกาสให้โมเดลที่เคยเป็นไปไม่ได้บนฮาร์ดแวร์ระดับต่ำทำงานได้

Implications

การสำเร็จของ esp32‑ai แสดงให้เห็นว่า LLM สามารถถูกรวมเข้าไปในอุปกรณ์ฝังตัวที่มีต้นทุนต่ำและใช้พลังงานจำกัด ทำให้เกิดโอกาสใหม่ ๆ ในการประยุกต์เช่นระบบเซนเซอร์อัจฉริยะ, ปลั๊กไฟอัจฉริยะ หรือผลิตภัณฑ์ IoT ที่ต้องการประมวลผลข้อความแบบออฟไลน์ อย่างไรก็ตาม การใช้โมเดลที่มีขนาดเล็กและความสามารถจำกัดหมายความว่าการนำไปใช้งานจริงยังคงต้องพิจารณาเรื่องคุณภาพของผลลัพธ์และความเหมาะสมกับงาน

การทดลองนี้อาจกระตุ้นให้ผู้ผลิตชิปพัฒนาหน่วยความจำที่เร็วกว่า flash หรือเพิ่มขนาด SRAM/PSRAM เพื่อสนับสนุนโมเดล LLM ขนาดใหญ่ขึ้นโดยไม่ต้องเสียค่าใช้จ่ายสูง นอกจากนี้ การเผยแพร่โค้ดแบบเปิดยังเป็นแรงผลักดันให้ชุมชนทำการต่อยอดและปรับปรุงเทคนิค PLE ให้มีประสิทธิภาพมากยิ่งขึ้น

Summary

slvDev แสดงว่าโมเดลภาษา 28.9 ล้านพารามิเตอร์ สามารถทำงานได้บน ESP32‑S3 ราคาเพียง $10 ด้วยอัตรา 9.88 token ต่อวินาที ผ่านเทคนิคการจัดเก็บพารามิเตอร์ใน flash และ quantization แม้ว่าจะมีข้อจำกัดด้านความสามารถ การทดลองนี้เปิดมิติใหม่ให้กับการนำ LLM ไปใช้บนอุปกรณ์ฝังตัวระดับต้นทุนต่ำ.

แชร์บทความนี้:

ชอบบทความแบบนี้?

สมัคร AI Automate Weekly Newsletter — รับเคล็ดลับ AI + how-to ใหม่
ทุกสัปดาห์ตรงถึง inbox ฟรี ไม่มีสแปม

แหล่งข่าวต้นฉบับ

ชื่อต้นฉบับ
The next age of LLMs? Dev gets a small LLM running at 10 tokens a second locally on a $10 microcontroller
ผู้เขียน
Rahim Amir
แหล่ง
TechRadar
วันที่เผยแพร่
8 สิงหาคม 2569 เวลา 02:35

Related

บทความที่เกี่ยวข้อง

ทำลายตำนาน AI เขียนโค้ด 3 อย่างที่นักพัฒนามืออาชีพยังเชื่อAI
16 สิงหาคม 2569 เวลา 04:00

ทำลายตำนาน AI เขียนโค้ด 3 อย่างที่นักพัฒนามืออาชีพยังเชื่อ

บทความนี้เปิดเผยสามตำนานที่นักพัฒนามืออาชีพยังเชื่อเกี่ยวกับการเขียนโค้ดด้วย AI ซึ่งทำให้เกิดการวางแผนโครงการผิดพลาด ข้อมูลจาก XDA‑Developers…

XDA Developers7 นาที
Gemma 4 E2B ทำงานบน Raspberry Pi แสดงว่า LLM ขนาดเล็กไม่ต้องแย่AI
5 สิงหาคม 2569 เวลา 01:00

Gemma 4 E2B ทำงานบน Raspberry Pi แสดงว่า LLM ขนาดเล็กไม่ต้องแย่

โมเดล Gemma 4 E2B รันได้บน Raspberry Pi 4 ด้วยการบีบอัด 2‑bit ใช้ RAM ไม่เกิน 2 GB และตอบสนองภายใน 1‑2 วินาที การทดลองแสดงว่า LLM…

XDA Developers6 นาที
โมเดล AI ขนาดเล็กที่สุดชนะการทดสอบเขียนโค้ดบนเครื่องAI
28 กรกฎาคม 2569 เวลา 05:00

โมเดล AI ขนาดเล็กที่สุดชนะการทดสอบเขียนโค้ดบนเครื่อง

การทดสอบสามโมเดล AI ภายในเครื่องพบว่าโมเดลไฟล์เล็กสุดให้ผลลัพธ์เร็วและแม่นยำสูง จึงกลายเป็นตัวเลือกถาวรสำหรับงานเขียนโค้ดประจำวัน

XDA Developers5 นาที
เปรียบเทียบเครื่องมือรัน LLM สี่ตัว พบว่า Ollama ทำงานเต็มศักยภาพAI
22 มิถุนายน 2569 เวลา 02:00

เปรียบเทียบเครื่องมือรัน LLM สี่ตัว พบว่า Ollama ทำงานเต็มศักยภาพ

ผู้เขียนทดสอบ LM Studio, Ollama, Text Generation WebUI และ llama.cpp บนคอมพิวเตอร์ระดับกลาง ผลการทดสอบพบว่า Ollama สามารถดึงศักยภาพของโมเดลได้เต็มที่ ทั้งด้าน…

XDA Developers7 นาที
คัดลอกลิงก์แล้ว!