Skip to main content

ทดสอบโมเดล LLM ด้วย prompt 'Generate an SVG of [A] [doing] [B]'

· 4 min read

เรื่องมันเริ่มจากคำถามง่ายๆ คำเดียว: "โมเดล AI ตัวไหนเก่งเรื่องการสร้างภาพ SVG กันแน่?" ถ้าพี่เคยลองให้โมเดลวาดรูปดู จะพบว่าแต่ละตัวตอบต่างกันมาก บางตัววาดได้สวย บางตัวออกมาเพี้ยนจนขำ

มีคนคนหนึ่งที่ทำ benchmark แบบนี้จนเป็นที่รู้จัก คือ Simon Willison — เขาใช้ prompt เดียวกันทดสอบโมเดลหลายตัวซ้ำๆ แล้วรวบรวมผลไว้ ทำให้มันกลายเป็น "ไม้บรรทัด" วัดความสามารถโมเดลที่ไม่เป็นทางการแต่ได้ผลจริง

Benchmark "นกกระทุงขี่จักรยาน"​

Simon Willison ใช้ prompt ว่า:

Generate an SVG of a pelican riding a bicycle

เขารัน prompt นี้กับโมเดลหลายตัว แล้วเก็บผลเป็นไฟล์ SVG ไว้ใน repo simonw/pelican-bicycle — มีโมเดลตั้งแต่ Cerebras Llama, Claude, Gemini, GPT, Amazon Nova ค่ะ

ทำไม prompt นี้ถึงดี? เพราะมันไม่ซับซ้อน แต่ต้องใช้ทักษะหลายอย่างพร้อมกัน:

  • การวางรูป — นกกระทุงต้องอยู่บนจักรยาน ไม่ใช่ลอยอยู่ข้างๆ
  • สัดส่วน — ขาเหยียบบันได ลำตัวใหญ่ ปากถุงยาว
  • ความเข้าใจการกระทำ — "ขี่" หมายถึงต้องอยู่บนจักรยานจริงๆ
  • SVG ที่ถูก syntax — render ได้จริง ไม่ใช่แค่ข้อความ

โมเดลที่ทำได้ครบทั้ง 4 อย่าง = เก่งเรื่องภาพ; โมเดลที่วาดเพี้ยน = เห็นจุดอ่อนชัดเจน

ขยายเป็นชุด prompt​

Simon Willison ไม่หยุดแค่นกกระทุง — เขาให้ Claude ช่วยสร้าง prompt เพิ่ม ในรูปแบบเดียวกัน:

Generate an SVG of [A] [doing] [B]

แล้วรัน 30 prompt กับ 9 โมเดล frontier ตัวอย่างที่รู้จัก:

Promptความหมาย
an octopus operating a pipe organปลาหมึกเล่นออร์แกนท่อ
a starfish driving a bulldozerดาวทะเลขับรถ bulldozer
a butterfly inspecting a steam engineผีเสื้อตรวจเครื่องจักรไอน้ำ
a sloth steering an excavatorสลอธบังคับรถขุด
a pelican riding a bicycleนกกระทุงขี่จักรยาน (ตัวต้นแบบ)

ผลที่ได้น่าสนใจ​

Tom Gally นำแนวคิดนี้ไปทำ collection เต็ม (gally.net/temp/20251107pelican-alternatives/) แล้วเปรียบเทียบ 9 โมเดล เช่น:

  • "butterfly inspecting a steam engine" — Gemini 3.0 Pro วาดเครื่องจักรไอน้ำได้ดีที่สุด มีผีเสื้อบินใกล้ปล่อง; DeepSeek V3.2 วาดเป็นเม็ดยาลอยๆ มีปล่องนิดเดียว
  • "sloth steering an excavator" — Claude Sonnet 4.5 วาดรถขุดดีที่สุด; Grok Code Fast 1 วาดเป็นเอเลี่ยนเขียวบนบล็อกสีเทา

ผลแบบนี้บอกได้ว่าโมเดลไหน "เข้าใจภาพ" จริง vs แค่ "สร้าง SVG ตามชื่อ" — และเป็นข้อมูลที่มีประโยชน์เวลาตัดสินใจเลือกโมเดล

เอามาใช้ทดสอบโมเดลตัวเอง​

แนวคิดนี้เอาไปใช้กับโมเดลที่เรารันเองได้ง่ายๆ:

  1. เลือก prompt ในรูปแบบ Generate an SVG of [A] [doing] [B]
  2. รันกับโมเดลที่ต้องการทดสอบ (เช่น DeepSeek-V4-Flash-0731)
  3. เปิดผล SVG ดูว่า render ได้ไหม + วางรูปถูกไหม
  4. เทียบกับโมเดลอื่นเพื่อดูจุดแข็ง/จุดอ่อน

Note: ข้อควรระวัง — อย่าใช้แค่ "ดูว่ามี SVG tag ไหม" เป็นเกณฑ์ตัดสิน เพราะโมเดล text-only บางตัวก็ generate SVG ได้จาก text โดยไม่ได้ "เห็นภาพ" จริง ต้องดูผล render ประกอบด้วย

สรุป​

Benchmark "นกกระทุงขี่จักรยาน" ของ Simon Willison เป็นตัวอย่างที่ดีว่า prompt ง่ายๆ ตัวเดียว ก็วัดความสามารถโมเดลได้จริง — และถ้าขยายเป็นชุด prompt แบบ [A] [doing] [B] ก็ยิ่งเห็นภาพชัดขึ้นว่าโมเดลไหนเก่งเรื่องการสร้างภาพ

ถ้าจะทดสอบโมเดลเอง ลองเริ่มจาก prompt ง่ายๆ แบบนี้ก่อน แล้วค่อยเพิ่มความซับซ้อน — ได้ผลเร็วและเห็นจุดอ่อนชัดเจน

อ้างอิง​

แชร์บทความ
☕

เนื้อหานี้มีประโยชน์ไหม? ช่วยสนับสนุนค่ากาแฟให้ผู้เขียนสักแก้ว

Buy Me a Coffee
Loading...