26 posts tagged with "dgx-spark"
View All TagsLiteLLM journey: vLLM integration — drop_params + reasoning + DGX Spark pitfalls
earlyoom regex silent failure — DGX Spark vLLM freeze ที่ป้องกันไม่อยู่
บันทึก 17 กันยายน 2569 — เคส OOM debug ที่ทำให้รู้ว่า regex เงียบๆ fail ได้
วันนี้ผม debug เคส vLLM hard-freeze บน DGX Spark (GB10, 119 GiB unified memory) — เครื่องค้าง ต้องถอดปลั๊ก 3 ครั้ง ทั้งๆ ที่ติด earlyoom ไว้แล้ว pattern ก็ดูถูก ผ่านไปหลายชั่วโมงจนเจอว่า ทั้ง --prefer และ --avoid ไม่เคย match process จริงเลย regex silent failure ที่ไม่มี error, ไม่มี warning, ไม่มี log อะไรทั้งสิ้น
เพิ่มประสิทธิภาพ Qwen3.8-Flash-Next บน DGX Spark: จาก 5 วินาที สู่ 1.4 วินาที TTFT
บันทึก 13 กันยายน 2569 — โปรเจกต์ optimize single Spark
วันนี้ผม optimize Qwen3.8-Flash-Next (180B MoE, 6B active) บน single DGX Spark (GB10, ARM64, 119 GiB unified memory) จนได้ TTFT warm ลดลงจาก 5 วินาที เหลือ 1.4 วินาที ทั้งหมดนี้ใช้แค่ 2 patches + 1 config tweak ผมขอเล่าเรื่องนี้เพราะว่ามันเป็น pattern ที่ generalize ได้ — ถ้าใคร serve hybrid MoE (Linear Attention + State-Space) บน single box น่าจะเจอปัญหาคล้ายกัน
Qwen3.8-Flash-Next เปิดตัวแล้ว — 125B MoE + 51B n-gram, 6B active แต่ชนะ Claude Opus 4.6 หลาย agentic benchmark
บันทึก — 26 สิงหาคม 2569 — Qwen ปล่อย Qwen3.8-Flash-Next จริงตามที่ teaser ไว้เมื่อวาน — เป็น Qwen4 architecture preview แรกที่มี n-gram embedding (PLE) เป็น native component
Qwen ปล่อย Qwen3.8-Flash-Next บน Hugging Face เมื่อเช้าตามเวลาไทย — บทความนี้คือการรวบ spec, benchmark, quant ที่ออกแล้ว, และ feasibility บน DGX Spark (GB10) ที่ผมมีอยู่ 1 node
ตัวเลขที่ทำให้หยุดอ่าน: 6B active params แต่ agentic coding (DeepSWE 1.1) ทำได้ 58.7 — Qwen3.8-27B ทำได้ 42.2, Qwen3.7-Plus ทำได้แค่ 16.5, และ DeepSeek-V4-Flash ทำได้ 54.4
มีงบ $10,000 สำหรับ local AI — ซื้อ 2× DGX Spark เลย หรือรอ?
บันทึก — 25 สิงหาคม 2569 — เช้ามืด เจอกระทู้น่าสนใจ
มีคนโพสต์ใน r/LocalLLM ถามคำถามที่ผมเห็นแล้วต้องหยุดอ่าน: "I have about $10,000 for local AI hardware. would you buy two DGX Sparks or something else?" — เป็นคำถามที่ดีมาก เพราะมันไม่ได้ถามแค่ "ซื้ออะไรดี" แต่ถามเชิง timing: "ซื้อตอนนี้ หรือรอ"
ผมเลยลองนั่งอ่านคอมเมนต์ทั้งหมด + เทียบกับบล็อก deep-dive ที่คนเขียนไว้จริงๆ ทั้ง Orhan Yildirim (256GB cluster บนโต๊ะ) และ Conselara Labs (Ray cluster + NCCL) — แล้วสรุปเป็น 3 มุมมองที่ขัดแย้งกัน
ซื้อ DGX Spark เครื่องเดียว เพื่อเรียนรู้ + Hermes agent คุ้มไหม — เมื่อตลาดบอกว่ามันอยู่ใน awkward spot
บันทึก — 25 สิงหาคม 2569 — เช้ามืด ต่อจาก Part 1
ต่อจาก Part 1 ที่พูดถึง $10K + 2× Spark — มีโพสต์ใน r/LocalLLM อีกอันที่ถามคำถามที่ต่างออกไป: "ซื้อ DGX Spark เครื่องเดียว เพื่อเรียนรู้ AI engineering + ตั้ง Hermes agent ทำ security research คุ้มไหม?"
คำถามนี้น่าสนใจกว่าที่คิด เพราะคำตอบไม่ใช่ "คุ้ม" หรือ "ไม่คุ้ม" — มันขึ้นอยู่กับว่าจะเอาไปทำอะไร และคอมเมนต์ในโพสต์นี้มีคนที่ใช้จริงบอกตรงๆ ว่า Spark 1 เครื่อง "อยู่ใน awkward spot" ถ้าใช้ผิด use case
DGX Spark GB10 + Qwen3.8-27B + DFlash2 lookup — 39 tok/s chat, 117 tok/s context replay ด้วย reproducible Spark CLI bundle
บันทึก — 25 สิงหาคม 2569 — เช้ามืด เจอกระทู้ reproducible benchmark ที่น่าสนใจ
คนใน r/LocalLLM โพสต์ benchmark ละเอียดมาก — Qwen3.8-27B-NVFP4 บน DGX Spark / ASUS Ascent GX10 เครื่องเดียว ใช้ DFlash2 (W4A16) + lookup speculation ได้:
- ~39 tok/s ใน chat ทั่วไป (consolidated profile)
- ~42.49 tok/s เมื่อ optimize สำหรับ chat ล้วง (k9 profile)
- ~117 tok/s สำหรับ context replay (RAG, code edits, document conversion)
- Cold TTFT @ 50k ลดจาก 29.94 → 23.46s ด้วย chunk 4,096 + O2 interactivity
ที่สำคัญที่สุด: reproducible ผ่าน spark run qwen38-dflash2-lookup — ไม่ใช่แค่บอก "ผมได้ X tok/s" แต่ bundle config ทั้งหมด (model, drafter, patched vLLM image, revisions ที่ pin, runtime arguments) ใน 1 command
DGX Spark เครื่องดับตอนรัน model — แก้ด้วย clock cap 2200 MHz
บันทึก — 23 สิงหาคม 2569 — บ่ายโน่น แก้ปัญหาเสร็จพอดี
เรื่องมันเริ่มจากผมเพิ่งเอา DGX Spark ขึ้นมาตั้งบนโต๊ะเมื่อเช้า ยังไม่ทันได้รัน model อะไรเลย — แค่ SSH เข้าไปเช็ค nvidia-smi ก็เห็น GPU GB10 ตรงตามสเปก, driver 580.173.02, CUDA 13.0 พร้อมใช้
แล้วก็เปิด NVIDIA Developer Forums ดู ด้วยความอยากรู้ว่า "คนอื่นใช้กันยังไง"
Benchmark vLLM บน DGX Spark: Qwen3.6-35B-A3B-NVFP4 ที่ 1-12 Concurrent Requests
บันทึก 27 มิถุนายน 2569 — อยากรู้ว่า DGX Spark รัน vLLM กับโมเดล 35B NVFP4 แล้วรับโหลดหลาย concurrent request ได้แค่ไหน ก็เลยเขียน script วัดง่าย ๆ ด้วย Python แล้วรันผ่าน SSH
ผมมี vLLM server รันอยู่บน DGX Spark ตั้งแต่เมื่อวาน แต่ไม่เคยได้วัดจริง ๆ ว่ามันรับโหลดได้แค่ไหน ส่วนใหญ่ก็แค่เรียกใช้ทีละ request ก็จบ วันนี้เลยเขียน benchmark script ง่าย ๆ ด้วย Python concurrent.futures + requests แล้วยิงที่ 1, 2, 4, 6, 12 concurrent requests เพื่อดู throughput และ latency
