LiteLLM journey: Self-host economics — 776M tokens/week, $0 vs $128/เดือน
สารบัญ
- TL;DR
- 1. ตัวเลขจริงจาก SpendLogs (1 สัปดาห์)
- 2. Self-host cost — DGX Spark
- 3. Cloud cost — 4 options
- Option A: Standard Plan + Credit Pack
- Option B: Pro Plan + Credit Pack
- Option C: Pay-as-you-go Flash
- Option D: Hybrid (DGX + Qwen)
- 4. Break-even DGX
- 5. Real example — 2-min burst
- 6. When to switch — Decision matrix
- สรุป
- อ้างอิง
"ผมรู้สึกว่า DGX คุ้ม — verify ด้วยตัวเลขจาก LiteLLM SpendLogs"
Part 1 — drop_params ทำไมต้อง recreate Part 2 — 3 flags ที่ช่วยเพิ่มประสิทธิภาพ Part 3 — DB mode + 3-way sync Part 4 — vLLM integration + pitfalls Part 5 — ตัวเลขจริงจาก SpendLogs — self-host vs cloud
TL;DR
ผมใช้ qwen3.8-flash-next ผ่าน DGX Spark self-host มาสักพัก เฉลี่ย 776M tokens/สัปดาห์ (= 3.1B/เดือน)
| Option | ฿/เดือน | Capacity |
|---|---|---|
| DGX Spark self-host | ~$15 (ไฟ) | ไม่จำกัด |
| Qwen Cloud Standard + Pack | ~$138 | 50M-250M tokens/wk |
| Qwen Cloud Pro + Pack | ~$128 | 200M-1B tokens/wk |
| Pay-as-you-go Qwen Flash | ~$313 | ไม่จำกัด |
คำตอบตรงๆ: ถ้าใช้ workload แบบผม (long-context heavy, 350:1 read-write ratio) → DGX คุ้มมากช่วงนี้
Break-even DGX: ~2 ปี
1. ตัวเลขจริงจาก SpendLogs (1 สัปดาห์)
ผม query Postgres ใน LiteLLM DB (LiteLLM_SpendLogs):
total_reqs: 6,272
avg_prompt_tokens: 124,373
max_prompt_tokens: 372,375 ← overflow 256K!
input_tokens: 776,044,670
output_tokens: 2,228,400
unique_users: 1
total_spend: $0
| Metric | Value | Insight |
|---|---|---|
| Requests | 6,272 | ~895/วัน |
| Avg prompt | 124K tokens | 50% ของ 256K limit |
| p99 prompt | 222K tokens | 87% ของ limit |
| Max prompt | 372K | overflow — น่าจะ truncate |
| Input : Output | 350:1 | heavy reading workload |
| Spend | $0 | self-host |
สิ่งที่ผมพบ: workload ของผม = long-context heavy reading ไม่ใช่ chat
2. Self-host cost — DGX Spark
| Component | รายละเอียด | ฿/เดือน |
|---|---|---|
| Hardware | DGX Spark (GB10, 128GB unified) | amortize ~$100 |
| ไฟฟ้า | ~100W × 24 × 30 = 72 kWh | ~288 บาท |
| Network | Cloudflare Tunnel | $0 |
| Maintenance | rebuild vLLM, fix bugs | ~$10 |
| Total | ~$15 + $100 amortize |
ถ้า amortize 3 ปี: $58/เดือน รวม hardware ถ้า amortize 5 ปี: $38/เดือน
3. Cloud cost — 4 options
จาก Qwen Cloud Token Plan docs:
Option A: Standard Plan + Credit Pack
- Standard: $18/เดือน (limited-time)
- Pack: $15/pack/month = 20,000 credits/pack
- ต้องการ ~155,000 credits/week (776M tokens fresh)
- ต้อง 8 packs = $120
- Total: $138/เดือน
Option B: Pro Plan + Credit Pack
- Pro: $68/เดือน (limited-time)
- ต้อง 4 packs (80,000 credits) = $60
- Total: $128/เดือน
Option C: Pay-as-you-go Flash
- Qwen3.5 Flash: $0.10/$0.40 per 1M tokens
- 776M input/wk × 4 wk × $0.10/1M = $310/เดือน input
- 2.2M output/wk × 4 wk × $0.40/1M = $3.5/เดือน output
- Total: ~$313/เดือน (100% cache miss — verified: cache_hit = 0.16% ใน SpendLogs)
ถ้า optimize cache 60% hit → ~$125/เดือน (estimate ยังไม่ได้วัด)
Option D: Hybrid (DGX + Qwen)
- เก็บ DGX + ซื้อ Standard Plan (~$18)
- ใช้ Standard สำหรับ burst workload
- Total: $33/เดือน (แพงกว่า pure self-host แต่ได้ flexibility)
4. Break-even DGX
| Scenario | ประหยัด/ปี (vs Qwen Cloud) | Break-even |
|---|---|---|
| DGX vs Standard + 8 Pack | $1,476/ปี ($123/เดือน × 12) | 2.4 ปี |
| DGX vs Pro + 4 Pack | $1,356/ปี ($113/เดือน × 12) | 2.6 ปี |
| DGX vs Pay-as-you-go (100% miss) | $3,576/ปี ($298/เดือน × 12) | 1.0 ปี |
ผมใช้ DGX มา ~1 ปี → ยังไม่ถึง break-even ปีที่ 2 = เริ่ม net positive (ประหยัด)
5. Real example — 2-min burst
จาก SpendLogs 2026-09-13 13:01-13:03:
| Time | Tokens |
|---|---|
| 13:01:27 | 369,189 |
| 13:01:44 | 369,648 |
| 13:02:38 | 371,415 |
| 13:03:14 | 372,220 |
| 13:03:24 | 372,375 |
5 requests, 1.85M tokens, ใน 2 นาที
บน Qwen Cloud Standard (10,000 credits/week):
- 1.85M tokens × ~5,000 fresh input/credit = 370 credits ใน 2 นาที
- ใช้ quota 3.7% ในครั้งเดียว
→ workload ของผม burst หนักมาก — Standard Plan ไม่พอ
6. When to switch — Decision matrix
| ถ้าคุณ... | Recommendation |
|---|---|
| ใช้ long-context heavy (256K tokens/req) | Self-host (DGX คุ้มมาก) |
| ใช้ chat workload (1K-4K tokens/req) | Cloud (Standard Plan พอ) |
| ต้องการ flexibility (model หลายตัว) | Cloud (Pro Plan) |
| Burst workload สั้นๆ (1 วัน) | Cloud (Standard + Pack) |
| Burst workload ยาว (เดือน+) | Self-host (คุ้มกว่า) |
| Privacy concern | Self-host (local) |
สรุป
ผมรู้สึกว่า DGX คุ้ม — ตัวเลขจริงยืนยัน
ช่วงนี้ที่ใช้:
- 776M tokens/สัปดาห์
- $0 cloud cost
- ~$15/เดือน ไฟ
- ประหยัด ~$128-$313/เดือน = ~5,000-12,000 บาท/เดือน
2 lessons ที่ได้:
- ตัวเลขดีกว่าความรู้สึก — query SpendLogs ก่อนตัดสินใจ
- ลักษณะการใช้งานสำคัญ — long-context heavy เหมาะ self-host, chat workload เหมาะ cloud
จบที่นี่ — 5 posts รวม (ตอนนี้เปลี่ยนไปใช้ Qwen Cloud แทน DGX)
อ้างอิง
- Qwen Cloud Token Plan — Standard/Pro/Pack pricing
- Qwen API Pricing — pay-as-you-go rates
- My Claude Code quota died (HK AI Podcast) — credits formula, real-world usage
- LiteLLM SpendLogs schema — full DB schema
- Part 1 — drop_params recreate — prerequisite
เนื้อหานี้มีประโยชน์ไหม? ช่วยสนับสนุนค่ากาแฟให้ผู้เขียนสักแก้ว
Buy Me a Coffee