Skip to main content

7 posts tagged with "ai"

View All Tags

TypeSafe Jev — System One Model ที่ไม่ generate text แต่ลด token ของ agent ได้จริง

· 10 min read

"Jev ไม่ใช่ LLM — มันไม่ generate text, ไม่ parse string, และ schema-lock output จน type error เป็นไปไม่ได้. คำถามคือ: เอามันไปทำอะไรใน pipeline ของเราได้บ้าง?"

LiteLLM guardrail blog — Jev + LiteLLM compaction DataCamp explainer — System One Model + benchmarks tamaratran/fast-jev-compaction — Claude Code plugin ที่ hook /compact (4.2k stars)

ผมเพิ่งเห็น post ใน Facebook ของ Geek Consult บอกว่า TypeSafe ปล่อย skill ให้ใช้ Jev ผ่าน Codex/Claude ได้แล้ว + คนเริ่มเอาไปใช้แล้ว "ลด token ได้จริง"

ทีแรกผมคิดว่าเป็น hype แบบเดิม — แต่พออ่าน docs + benchmark + community projects แล้วพบว่า มันเป็นแนวคิดที่ต่างจาก LLM จริงๆ และ token reduction ในบาง use case ไม่ใช่ marketing

เพิ่มประสิทธิภาพ Qwen3.8-Flash-Next บน DGX Spark: จาก 5 วินาที สู่ 1.4 วินาที TTFT

· 7 min read

บันทึก 13 กันยายน 2569 — โปรเจกต์ optimize single Spark

วันนี้ผม optimize Qwen3.8-Flash-Next (180B MoE, 6B active) บน single DGX Spark (GB10, ARM64, 119 GiB unified memory) จนได้ TTFT warm ลดลงจาก 5 วินาที เหลือ 1.4 วินาที ทั้งหมดนี้ใช้แค่ 2 patches + 1 config tweak ผมขอเล่าเรื่องนี้เพราะว่ามันเป็น pattern ที่ generalize ได้ — ถ้าใคร serve hybrid MoE (Linear Attention + State-Space) บน single box น่าจะเจอปัญหาคล้ายกัน

ทดสอบโมเดล LLM ด้วย prompt 'Generate an SVG of [A] [doing] [B]'

· 4 min read

เรื่องมันเริ่มจากคำถามง่ายๆ คำเดียว: "โมเดล AI ตัวไหนเก่งเรื่องการสร้างภาพ SVG กันแน่?" ถ้าพี่เคยลองให้โมเดลวาดรูปดู จะพบว่าแต่ละตัวตอบต่างกันมาก บางตัววาดได้สวย บางตัวออกมาเพี้ยนจนขำ

มีคนคนหนึ่งที่ทำ benchmark แบบนี้จนเป็นที่รู้จัก คือ Simon Willison — เขาใช้ prompt เดียวกันทดสอบโมเดลหลายตัวซ้ำๆ แล้วรวบรวมผลไว้ ทำให้มันกลายเป็น "ไม้บรรทัด" วัดความสามารถโมเดลที่ไม่เป็นทางการแต่ได้ผลจริง

LiteLLM Proxy: วาง Gateway ครอบ LLM ให้ทีมใช้งานแบบมีระบบ

· 13 min read

intro​

ผมรัน LLM เองบน homelab มาสักพัก

เริ่มจาก llama.cpp บนเครื่องสเปกต่ำ ถามอะไรก็ตอบได้

แล้วขยับมา vLLM ที่ throughput สูงกว่า รับ request พร้อมกันได้มากกว่า

ทุกอย่างดูดี จนกระทั่งวันหนึ่งเพื่อนร่วมงานถามว่า

"ขอใช้ด้วยได้ไหม?"

ผมก็เลยเปิด port ให้เพื่อนยิง request ตรงเข้ามา

ผ่านไปสักพัก ก็เริ่มเจอปัญหา

ไม่รู้ว่าใครใช้ไปเท่าไหร่ — ไม่มี log ไม่มี metric รู้แค่ GPU ทำงานหนักขึ้น

ไม่มี API key แยกคน — ทุกคนใช้ key เดียวกัน ถ้า key หลุดก็จบเลย

ไม่มี rate limit — มีคนส่ง request ต่อเนื่อง ทำให้คนอื่นรอคิวนาน

ไม่มี cache — คำถามซ้ำๆ ถูกส่งไป LLM ทุกครั้ง เสียทรัพยากรโดยไม่จำเป็น

backend ล่มที ทุกอย่างก็หยุดทำงาน — ไม่มี fallback ไม่มี retry

ถ้าจะเขียนระบบจัดการเองก็ทำได้ แต่ต้องมานั่งทำ auth, logging, rate limit, cache, dashboard...

ไม่ใช่งานที่ผมอยากทำ

แค่อยากให้ทีมใช้ LLM ได้สะดวก โดยที่ยังคุมทุกอย่างได้

Honcho - ระบบความจำที่ทำให้ AI เข้าใจเราจริงๆ

· 14 min read

เรื่องมันเริ่มจากความรำคาญเล็กๆ

ทุกครั้งที่เปิด session ใหม่กับ AI ผมต้องเล่าเรื่องเดิมซ้ำๆ - ใช้ Arch Linux นะ, ชอบ self-hosted tools, บล็อกอยู่ที่ blog.2my.xyz, เขียนเรื่อง Linux กับ homelab เป็นหลัก ทุกครั้ง AI ก็จะทักเหมือนเพิ่งเจอผมครั้งแรก

มันเหมือนมีเพื่อนคุยด้วยทุกวัน แต่เพื่อนคนนั้นความจำสั้นมาก

Hermes + Honcho หลายเครื่อง สมองเดียว - ออกแบบ Architecture สำหรับ Homelab

· 7 min read

ผมมี ThinkPad T14 เป็นเครื่องหลัก รัน Hermes Agent คุยผ่าน Telegram ทุกวัน จน Honcho memory เริ่มมีข้อมูลเยอะขึ้นเรื่อย ๆ — AI จำผมได้จริง ๆ ไม่ใช่แค่จำ facts แต่เข้าใจ context

แล้ววันหนึ่งก็คิดขึ้นได้: ผมมี X13 อีกเครื่อง มี server Proxmox ใน homelab อีกตัว ทำไมไม่ให้ทุกเครื่องมี AI assistant ของตัวเองบ้าง?

กลับมาเขียนอีกครั้ง ในยุคที่ AI ทำได้แทบทุกอย่าง

· 4 min read

Intro​

ช่วงหลังผมเริ่มกลับมาเขียน Blog อีกครั้ง

ทั้งที่ก่อนหน้านี้แทบหยุดเขียนไปเลย

ไม่ใช่เพราะหมดเรื่องเขียน แต่เพราะเริ่มรู้สึกว่าโลกเปลี่ยนเร็วมาก

AI เขียนได้ดีขึ้น สรุปเก่งขึ้น เรียบเรียงดีกว่าเดิมมาก

จนบางช่วงก็เริ่มคิดว่า

"เรายังจำเป็นต้องเขียนอยู่ไหม ?"

แต่หลังจากหายไปพักใหญ่ สุดท้ายก็เริ่มกลับมานั่งเขียนอีกครั้ง

และรอบนี้ ความรู้สึกมันไม่เหมือนเดิมแล้ว