EXL3 Quantization กับ λ=2.8 — ทำไม 3-bit ถึงให้คุณภาพระดับ Q5 และ ablation ที่ 2.8 ถึงเป็น sweet spot
EXL3 3.0 bpw ให้คุณภาพระดับ Q5 GGUF ในขนาดครึ่งเดียว — และค่า λ=2.8 สำหรับ runtime ablation เป็นจุดสมดุลระหว่าง bypass strength กับ reasoning stability
TL;DR
- EXL3/Trellis 3.0 bpw เป็น quantization format แบบ non-uniform bit allocation ที่ให้คุณภาพระดับ GGUF Q4–Q5 ในขนาดที่เล็กกว่ามาก (~60% ของ Q5 size)
- Runtime ablation ด้วย projection ที่ wo_b output space เป็นทางเลือกที่ดีกว่าการแก้ quantized weights ในทุกกรณี (LoRA-style weight edits ไม่ทำงานกับ MoE ที่มี mHC residual pathway)
- λ=2.8 อยู่กลางระหว่าง loveseko preset (λ=2.5, conservative) กับ drowzeys default (λ=3.5, validated) — ให้ bypass strength ที่พอใช้โดยไม่ทำให้ long-CoT reasoning loop
