Nový model TielCoder 35B-A3B se v reálných coding úlohách vyrovná Opus 4.6 medium, přitom se vejde do 22 GB kvantizace a běží rychle i na omezeném hardware. Jde o finetune Qwen 35B postavený na Ornith s kódově zaměřenou kvantizací a optimalizovaným chat šablonem.
Co se stalo
Autor benchmarkoval řadu modelů 35B-A3B na reálných codebase problémech a označil TielCoder za nejsilnější a nejkonzistentnější z nich — jak na správnost, tak na rychlost. 22GB 4-bit kvantizace se podle něj vyrovná Opus 4.6 medium, a předčí modely KAT-Coder a Nail.
Motivace je jasná: Qwen 3.8 27B je vynikající, ale pomalý. Silný 35B-A3B MoE coder, který zvládne reálné problémy rychle, je cenným doplňkem.
Co dělá TielCoder jinak
Autor popsal tři vrstvy změn:
- Finetune z Ornith — základ z rodiny Qwen 35B
- Kódově zaměřená dynamická imatrix kvantizace — zásadní hlavně u Q4
- Optimalizovaný chat template (Qwen-Sharp) — model stráví méně tokenů na cestě k závěru, což zrychluje agentic coding
Výsledek: model je výrazně lepší než stock Qwen 35B v kódování a zároveň rychlejší.
Srovnání s Qwen 3.8 27B
Na dotaz, proč Qwen 3.8 27B chybí v benchmarcích, autor doplnil srovnání:
„Dostáváte 6× zrychlení oproti Qwen 3.8 27B na medium effort, ale ztratíte část vyřešených úloh." — peculiar-ragdoll
Jiný komentář to zasazuje do kontextu:
„Qwen 3.8 je poráží všechny, ale to je fér — tohle jsou A3B MoE modely, které běží mnohem rychleji a potřebují míň hardwaru." — Anaeijon
Benchmark, který nelze natrénovat
Autor zdůraznil, že používá benchmark SWE Live:
„SWE Live je agentic benchmark pro softwarové inženýrství, který nejde natrénovat, protože pravidelně přidávají nové úlohy. Je to podle mě jediný důvěryhodný coding benchmark." — peculiar-ragdoll
Dostupnost
Modely jsou na Hugging Face:
- GGUFs: peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF
- MTP GGUFs: peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF-MTP
- MLX (oQ4e): peculiar-ragdoll/Tiel-Coder-35B-A3B-MLX-oQ4e
Co si z toho odnést
- Pro reálné codebase problémy na omezeném hardware je 35B-A3B MoE jako TielCoder výborná volba — rychlost a správnost
- 22GB kvantizace znamená provoz na běžných GPU s 24 GB VRAM
- Kvantizace a chat template dělají velký rozdíl — nejen finetune
- Komunita stále čeká na nativní MoE variantu od Qwen (Qwen3-Coder-Next)
Inspirace: TielCoder's 22 GB 4-bit quant matches Opus4.6 medium on recent real life coding issues
This article was originally published by DEV Community and written by Petr Baloun.
Read original article on DEV Community