Skip to main content

5 posts tagged with "hermes-agent"

View All Tags

ลด Cost ใน Hermes — คุม background_review fork ให้ไม่กิน token ฟรี

· 8 min read

T14 ของผมรัน Hermes มา 3 เดือน วันหนึ่งเปิดดู queue ใน ~/.hermes/pending/memory/ แล้วเจอ 48 ไฟล์ที่ค้างมาเป็นเดือน — บทความนี้คือการเดินย้อนจากอาการ "queue เต็ม" หาสาเหตุที่แท้จริง แล้วค่อย tune config ทีละขั้น

Benchmark agent harness ยังไงให้เชื่อถือได้ — เรื่องราวจาก r/LocalLLM: OpenClaw, Hermes, nanobot และคำถามที่ community ถามจริงๆ

· 12 min read

บันทึก — 25 สิงหาคม 2569 — เช้ามืด เจอกระทู้ที่ตั้งคำถามถูก

ผมเจอคำถามใน r/LocalLLM ที่ผมว่าสำคัญมาก: "agent ของฉันเปรียบเทียบกับ OpenClaw/Hermes ยังไง" — ไม่ได้ถามแบบ feel-based แต่ใช้ harness-bench วัดผลจริง โดยแยก agent เป็นตัวแปรควบคุม + LLM เป็นตัวแปรอิสระ

OP (donotfire) สร้าง agent ชื่อ "Second Brain" ติดอันดับ 2 ใน leaderboard (จาก heatmap ในโพสต์)

บล็อกนี้ต่างจากบล็อกอื่นในซีรีส์ — แทนที่จะเน้น tool หรือ hardware ผมจะเน้น methodology ของการวัด agent เพราะเป็นปัญหาที่ community ทั้งหมดต้องเจอ

ซื้อ DGX Spark เครื่องเดียว เพื่อเรียนรู้ + Hermes agent คุ้มไหม — เมื่อตลาดบอกว่ามันอยู่ใน awkward spot

· 10 min read

บันทึก — 25 สิงหาคม 2569 — เช้ามืด ต่อจาก Part 1

ต่อจาก Part 1 ที่พูดถึง $10K + 2× Spark — มีโพสต์ใน r/LocalLLM อีกอันที่ถามคำถามที่ต่างออกไป: "ซื้อ DGX Spark เครื่องเดียว เพื่อเรียนรู้ AI engineering + ตั้ง Hermes agent ทำ security research คุ้มไหม?"

คำถามนี้น่าสนใจกว่าที่คิด เพราะคำตอบไม่ใช่ "คุ้ม" หรือ "ไม่คุ้ม" — มันขึ้นอยู่กับว่าจะเอาไปทำอะไร และคอมเมนต์ในโพสต์นี้มีคนที่ใช้จริงบอกตรงๆ ว่า Spark 1 เครื่อง "อยู่ใน awkward spot" ถ้าใช้ผิด use case

Virtual Models บน LiteLLM Proxy: Ornith-1.0-35B 10 profiles ใช้ reasoning_effort คุมพฤติกรรม

· 13 min read

หลังจาก deploy Ornith-1.0-35B-NVFP4 บน DGX Spark สำเร็จแล้ว (ดูรายละเอียดใน บทความก่อนหน้า) ขั้นตอนต่อไปคือสร้าง Virtual Models ผ่าน LiteLLM Proxy เหมือนที่เคยทำกับ Qwen3.6

ความต่างสำคัญ: Ornith มี reasoning_effort 7 levels (none/minimal/low/medium/high/xhigh/max) แทนที่แค่ enable_thinking: true|false แบบ Qwen ทำให้คุมความลึกของ reasoning ได้ละเอียดกว่า และมี thinking_token_budget สำหรับจำกัดจำนวน thinking tokens ต่อ request

Virtual Models บน LiteLLM Proxy: 1 โมเดล 10 profiles ใช้ให้เหมาะกับงาน

· 7 min read

ผมใช้ Qwen3.6-35B-A3B-NVFP4 เป็น backend model ตัวเดียว แล้วสร้าง Virtual Models ผ่าน LiteLLM Proxy เป็น 10 profiles ตามลักษณะงาน

ทุก profile ชี้ไปที่โมเดลเดียวกัน แต่ override sampling parameters ต่างกัน — ทำให้โมเดลเดียวกันตอบออกมา "คนละคน" ตาม use case