ทดสอบโมเดล LLM ด้วย prompt 'Generate an SVG of [A] [doing] [B]'
สารบัญ
เรื่องมันเริ่มจากคำถามง่ายๆ คำเดียว: "โมเดล AI ตัวไหนเก่งเรื่องการสร้างภาพ SVG กันแน่?" ถ้าพี่เคยลองให้โมเดลวาดรูปดู จะพบว่าแต่ละตัวตอบต่างกันมาก บางตัววาดได้สวย บางตัวออกมาเพี้ยนจนขำ
มีคนคนหนึ่งที่ทำ benchmark แบบนี้จนเป็นที่รู้จัก คือ Simon Willison — เขาใช้ prompt เดียวกันทดสอบโมเดลหลายตัวซ้ำๆ แล้วรวบรวมผลไว้ ทำให้มันกลายเป็น "ไม้บรรทัด" วัดความสามารถโมเดลที่ไม่เป็นทางการแต่ได้ผลจริง
Benchmark "นกกระทุงขี่จักรยาน"
Simon Willison ใช้ prompt ว่า:
Generate an SVG of a pelican riding a bicycle
เขารัน prompt นี้กับโมเดลหลายตัว แล้วเก็บผลเป็นไฟล์ SVG ไว้ใน repo simonw/pelican-bicycle — มีโมเดลตั้งแต่ Cerebras Llama, Claude, Gemini, GPT, Amazon Nova ค่ะ
ทำไม prompt นี้ถึงดี? เพราะมันไม่ซับซ้อน แต่ต้องใช้ทักษะหลายอย่างพร้อมกัน:
- การวางรูป — นกกระทุงต้องอยู่บนจักรยาน ไม่ใช่ลอยอยู่ข้างๆ
- สัดส่วน — ขาเหยียบบันได ลำตัวใหญ่ ปากถุงยาว
- ความเข้าใจการกระทำ — "ขี่" หมายถึงต้องอยู่บนจักรยานจริงๆ
- SVG ที่ถูก syntax — render ได้จริง ไม่ใช่แค่ข้อความ
โมเดลที่ทำได้ครบทั้ง 4 อย่าง = เก่งเรื่องภาพ; โมเดลที่วาดเพี้ยน = เห็นจุดอ่อนชัดเจน
ขยายเป็นชุด prompt
Simon Willison ไม่หยุดแค่นกกระทุง — เขาให้ Claude ช่วยสร้าง prompt เพิ่ม ในรูปแบบเดียวกัน:
Generate an SVG of [A] [doing] [B]
แล้วรัน 30 prompt กับ 9 โมเดล frontier ตัวอย่างที่รู้จัก:
| Prompt | ความหมาย |
|---|---|
| an octopus operating a pipe organ | ปลาหมึกเล่นออร์แกนท่อ |
| a starfish driving a bulldozer | ดาวทะเลขับรถ bulldozer |
| a butterfly inspecting a steam engine | ผีเสื้อตรวจเครื่องจักรไอน้ำ |
| a sloth steering an excavator | สลอธบังคับรถขุด |
| a pelican riding a bicycle | นกกระทุงขี่จักรยาน (ตัวต้นแบบ) |
ผลที่ได้น่าสนใจ
Tom Gally นำแนวคิดนี้ไปทำ collection เต็ม (gally.net/temp/20251107pelican-alternatives/) แล้วเปรียบเทียบ 9 โมเดล เช่น:
- "butterfly inspecting a steam engine" — Gemini 3.0 Pro วาดเครื่องจักรไอน้ำได้ดีที่สุด มีผีเสื้อบินใกล้ปล่อง; DeepSeek V3.2 วาดเป็นเม็ดยาลอยๆ มีปล่องนิดเดียว
- "sloth steering an excavator" — Claude Sonnet 4.5 วาดรถขุดดีที่สุด; Grok Code Fast 1 วาดเป็นเอเลี่ยนเขียวบนบล็อกสีเทา
ผลแบบนี้บอกได้ว่าโมเดลไหน "เข้าใจภาพ" จริง vs แค่ "สร้าง SVG ตามชื่อ" — และเป็นข้อมูลที่มีประโยชน์เวลาตัดสินใจเลือกโมเดล
เอามาใช้ทดสอบโมเดลตัวเอง
แนวคิดนี้เอาไปใช้กับโมเดลที่เรารันเองได้ง่ายๆ:
- เลือก prompt ในรูปแบบ
Generate an SVG of [A] [doing] [B] - รันกับโมเดลที่ต้องการทดสอบ (เช่น DeepSeek-V4-Flash-0731)
- เปิดผล SVG ดูว่า render ได้ไหม + วางรูปถูกไหม
- เทียบกับโมเดลอื่นเพื่อดูจุดแข็ง/จุดอ่อน
Note: ข้อควรระวัง — อย่าใช้แค่ "ดูว่ามี SVG tag ไหม" เป็นเกณฑ์ตัดสิน เพราะโมเดล text-only บางตัวก็ generate SVG ได้จาก text โดยไม่ได้ "เห็นภาพ" จริง ต้องดูผล render ประกอบด้วย
สรุป
Benchmark "นกกระทุงขี่จักรยาน" ของ Simon Willison เป็นตัวอย่างที่ดีว่า prompt ง่ายๆ ตัวเดียว ก็วัดความสามารถโมเดลได้จริง — และถ้าขยายเป็นชุด prompt แบบ [A] [doing] [B] ก็ยิ่งเห็นภาพชัดขึ้นว่าโมเดลไหนเก่งเรื่องการสร้างภาพ
ถ้าจะทดสอบโมเดลเอง ลองเริ่มจาก prompt ง่ายๆ แบบนี้ก่อน แล้วค่อยเพิ่มความซับซ้อน — ได้ผลเร็วและเห็นจุดอ่อนชัดเจน
อ้างอิง
- LLM SVG Generation Benchmark — Simon Willison — บทความต้นเรื่อง benchmark 30 prompt กับ 9 โมเดล
- simonw/pelican-bicycle — GitHub — repo รวบรวมผล SVG ของโมเดลต่างๆ
- Pelican alternatives collection — Tom Gally — collection เต็มของ 30 prompt กับ 9 โมเดล
- pelican-riding-a-bicycle tag — Simon Willison — รวมบทความทั้งหมดที่เกี่ยวข้อง
เนื้อหานี้มีประโยชน์ไหม? ช่วยสนับสนุนค่ากาแฟให้ผู้เขียนสักแก้ว
Buy Me a Coffee