Generative AI

I-Unsloth vs Axolotl vs TRL vs LLaMA-Factory: A Fine-Tuning Framework Comparison on Speed, VRAM, and Multi-GPU

“>

I-Unsloth: izinzuzo zezinga le-kernel ku-GPU eyodwa

Amabhentshimakhi ashicilelwe we-Unsloth abonisa isivinini sokuqeqeshwa esingu-2x se-Llama 3.1 8B kanye ne-Llama 3.3 70B. Ukusetha kusebenzise idathasethi ye-Alpaca, usayizi weqoqwana 2, kanye nokunqwabelana kwegradient 4. I-QLoRA yayisezingeni elingu-32 kuzo zonke izendlalelo zomugqa.

Imiphumela ye-MoE mikhulu. I-unsloth ishuniwe kahle unsloth/gpt-oss-20b-BF16 ku-NVIDIA B200. Ibika u-712.33 ms ngesinyathelo ngasinye kumongo we-8K, uma iqhathaniswa no-5,226.86 ms we-Transformers v5. Leso yigebe elingu-7.3x. Ku-4K igebe ngu-4.82x, futhi ku-1K ingu-1.37x kuphela.

Isiqondiso sethrendi sincike kumodeli, futhi amadokhumenti e-Unsloth afinyelela lesi simangalo ku-gpt-oss. Lapho, i-speedup ikhula ngobude bokulandelana, okubizwa ngokuthi i-Flex Attention kanye nezinhlamvu ze-MoE.

I-Qwen3-30B-A3B ku-B200 isebenza ngenye indlela. Isivinini sayo esibikiwe sisuka ku-1.7x ku-1K siye ku-1.1x ku-16K. Ukonga inkumbulo kuhambisa ngakolunye uhlangothi, kukhuphuka kusuka cishe ku-2% kuya ku-15%.

I-Qwen3-30B-A3B ku-H100 ifinyelela ku-1.77x. I-GLM-4.7-Flash ku-RTX PRO 6000 ifinyelela ku-2.1x. Ukusebenzisana ne-AMD kukalwe i-Llama-3.1-8B LoRA SFT ngo-2.07 s/step. I-TRL kanye ne-FlashAttention-2 ithathe 2.87 s/step, igebe elingu-1.39x elinamajika okulahlekelwa afanayo.

I-Axolotl: izinhlamvu ezibolekiwe, ukufana komdabu

I-Axolotl yengeze izikhwebu ze-Triton ngokwezifiso nemisebenzi ye-autograd ye-LoRA ngoFebruwari 2025, icaphuna ngokucacile i-Unsloth njengogqozi. Bakhetha ukungena lora_mlp_kernel, lora_qkv_kernelfuthi lora_o_kernel.

Amanothi okukhishwa kwakamuva engeza ukwesekwa kwe-SonicMoE LoRA. Iletha isivinini esingafika ku-1.45x kanye nokunciphisa inkumbulo okungama-30% ngaphezu kwe-a grouped_mm isisekelo. Leso sibalo ese-Qwen3.5-35B-A3B 8-bit LoRA ku-H100 SXM eyodwa.

I-Axolotl iphinde ithumele i-FlashAttention 2/3/4, xFormers, Flex Attention, SageAttention, Liger Kernel, Cut Cross Entropy, kanye ne-ScatterMoE.

I-TRL: isisekelo wonke umuntu esikala ngaso

I-TRL ivamise ukuba indawo eyireferensi esikhundleni sokuba owinile ku- throughput ye-single-GPU eluhlaza. Inxephezela ngobubanzi benkumbulo namalever esivinini abhalwe kokuthi Ukunciphisa Ukusetshenziswa Kwenkumbulo kanye Nokuqeqeshwa Okusheshisa.

Lawo ma-levers afaka ukupakisha, i-padding-free batching, i-truncation, i-Liger Kernel, kanye nemodi yokulala ye-vLLM ye-GRPO. I-TRL futhi inokuhlanganiswa kwe-Unsloth yenkampani yokuqala, ngakho kokubili akuhlukani.

I-LLaMA-Factory: isivinini ngokuthumela

I-LLaMA-Factory ayizibhali izimbewu zayo. Idalula umsebenzi wabanye abantu ngamafulegi we-config.

Ukusetha use_unsloth: true yenza kusebenze ipheshi ye-Unsloth. I-changelog yephrojekthi ibika isivinini esihlobene esingu-170% ukusuka kuleyo ndlela. Ukuqeqeshwa kokulandelana okude kwe-Unsloth kubhalwe ngesivinini esingu-117% kanye nenkumbulo engu-50%. Iphinde isekele enable_liger_kernel: true kanye ne-FlashAttention-2 nge flash_attn: fa2.

Izitezi zememori ezibikiwe

I-Unsloth ishicilela ithebula lezimfuneko ze-VRAM elihlelwa ngokubalwa kwepharamitha. Ibala u-6 GB wemodeli engu-8B ku-4-bit QLoRA kanye no-41 GB we-70B. I-LoRA ku-16-bit ibiza u-22 GB no-164 GB kumamodeli afanayo.

Ithebula lehadiwe le-LLaMA-Factory le-README lihlanganisa isimiso esifanayo se-4-bit QLoRA. Ifaka ku-6 GB ku-7B, 24 GB ku-30B, kanye no-48 GB ku-70B. Ukucushwa okuphelele kwe-bf16 kwe-70B kufakwe kuhlu ku-600 GB.

Womabili amathebula achaza ubuncane. Usayizi weqoqo, ubude bokulandelana, kanye nokukhetha kwe-optimizer hambisa inombolo yangempela.

Ubude bomongo buyisihlukanisi esibukhali

I-VRAM ephezulu emongweni engaguquki ayithakazelisi kangako kunomongo omkhulu ovunyelwe isabelomali se-VRAM esinikeziwe. Amabhentshimakhi obude bomongo we-Unsloth we-Llama 3.1 8B QLoRA ezingeni 32 kanye nosayizi weqoqo 1 aqinile.

I-GPU VRAM Umongo wokungaziphathi kahle Transformers + FA2 umongo
8GB 2,972 OOM
16 GB 40,724 2,551
24GB 78,475 5,789
48GB 191,728 15,502
80GB 342,733 28,454

I-Unsloth ibeka lokhu ku-algorithm yokuhlola i-gradient ehlanganiswe ne-Apple's Cut Cross Entropy. Ku-Llama 3.3 70B ku-80 GB A100, ibika amathokheni angu-89,389. Isisekelo se-FA2 sifinyelela ku-6,916.

Indaba yenkumbulo ye-MoE

Ukuqeqeshwa kwe-MoE yilapho ukuziphatha kwenkumbulo kushintshe kakhulu ngo-2026. Imibiko ye-Unsloth gpt-oss-20b ukulungisa kahle ngaphakathi kwe-12.8 GB, kuyilapho i-Qwen3-30B-A3B ku-16-bit LoRA idinga u-63 GB.

I-B200 gpt-oss run yayo isebenzise i-47.43 GB kumongo we-8K lapho i-Transformers v5 isebenzisa u-73.80 GB. Ku-16K, i-Transformers v5 iphelelwe yinkumbulo futhi i-Unsloth yasebenzisa i-55.13 GB.

Indlela yokwenza iwukwakhiwa kwe-split-LoRA. I-PEFT yenza i-delta ye-LoRA ibe ngokoqobo kubo bonke ochwepheshe ngaphambi kwe-matmul ye-MoE. I-Unsloth ihlela kabusha imisebenzi esikhundleni salokho, efana nezibalo kodwa igwema ukwenziwa kwezinto.

I-Axolotl ihlasela inkinga efanayo ngokuhlukile. Ukulinganisa kwayo uchwepheshe be-MoE kulinganisa izisindo zochwepheshe ngesikhathi sokulayisha imodeli, kukhulula i-bf16 tensor yoqobo ngokushesha.

Isizathu wushintsho lwe-Transformers v5. Izendlalelo zochwepheshe zisusiwe nn.Linear ukuhlanganisa nn.Parameter I-3D tensor. ama-bitandbyte awakwazanga ukuwalinganisa ngomthwalo. Amadokhumenti e-Axolotl abika i-GLM-4.7-Flash QLoRA yehla isuka cishe ku-127 GiB iye cishe ku-23 GiB egciniwe inkumbulo nge quantize_moe_experts: true.

Yilapho izinga lishintsha khona. I-Unsloth's single-GPU lead ayidluli.

I-Axolotl: i-matrix ye-parallelism ejulile

Umhlahlandlela wama-GPU amaningi we-Axolotl unikeza amasu amathathu okuhlukanisa okukhethekile: Izigaba ze-DeepSpeed ​​ZeRO 1 ukuya ku-3, FSDP, kanye ne-DDP. I-FSDP2 iyindlela enconyiwe, futhi i-FSDP1 yehlisiwe.

Ngaphezu kwalokho, umhlahlandlela wayo we-ND Parallelism uhlanganisa idatha, i-tensor, umongo, kanye nokufana kochwepheshe ngokusebenzisa i-PyTorch's. DeviceMesh. I-matrix yokwesekwa ebhaliwe iqinisekisa i-FSDP+TP, HSDP+TP, FSDP+CP, FSDP+TP+CP, kanye ne-FSDP+EP.

Izinhlanganisela ezimbili azisekelwa ngokusobala. Ukufana kochwepheshe akukwazi ukuqamba ne-TP noma i-CP ku-v1. I-DDP emsulwa ayikwazi ukuqamba nazo futhi.

Ukuhambisana kokulandelana kwe-Axolotl kusebenzisa i- ring-flash-attention umtapo wolwazi. Ibhentshimakhi yayo eshicilelwe ye-H100 ye-Llama 3.1 8B QLoRA isekela i-tradeoff.

SP degree Ubuningi bokuqukethwe Ukukala kokuqukethwe Amathokheni/umzuzwana Ukubalwa kwe-Speedup / GPU
1 17,408 1.00x 9,104 100.0%
2 34,816 2.00x 15,806 86.8%
4 66,560 3.82x 12,314 33.8%
8 129,024 7.41x 11,096 15.2%

Izikali zomongo zisondele kumugqa. Ukusebenza kahle kokusebenza kuyawa. Ku-4090s ku-SP degree 8, ibhentshimark efanayo irekhoda ukusheshisa okungu-0.88x. Ukuqeqeshwa kwehla kancane ngenkathi umongo ufinyelela amathokheni angu-32,768.

I-Axolotl iphinde isekele ukuqeqeshwa kwe-multi-node ngokusebenzisa i-torchrun ne-Ray.

I-TRL: izingemuva ezihlukanisa ngokulandelana okubili

Umhlahlandlela wokuqeqesha osabalalisiwe we-TRL uveza umehluko ohlanzekile. I-Context Parallelism isho Ukunaka Kwendandatho ku-FSDP2. Ukulandelana kwe-Parallelism kusho i-ALST/Ulysses ku-DeepSpeed.

I-Ring Attention idinga Sheshisa i-1.11.0+, isebenzisa cp_size nge cp_backend="torch"futhi okwamanje isekela i-SDPA kuphela. I-FlashAttention ayisekelwe kuleyo ndlela. Ukulandelana kufanele kuhlukaniswe cp_size * 2.

I-ALST/Ulysses idinga i-DeepSpeed ​​0.18.1+ kanye ne-Accelerate 1.12.0+. Isebenzisa sp_size nge sp_backend="deepspeed" futhi isebenza nge-FlashAttention-2. Kuboshwe ukubala kwekhanda lokunaka, okudingayo num_heads >= sp_size.

Iziqondiso ze-TRL ziqondile. I-Ring Attention ifanela ukulandelana kwamathokheni okungu-1M+ kanye ne-topology yenethiwekhi elinganiselwe. I-Ulysses ifanela ukuxhuma kwe-NVLink noma i-InfiniBand futhi ilandelana kufika cishe kumathokheni angu-500k.

Ibhentshimakhi ye-TRL's Ring Attention ecushwe kahle i-Qwen3-8B kuwo wonke ama-1, 2, 4, kanye nama-GPU angu-8 H100. Kuma-GPU angu-8, ubude bomongo obungaphezu kwamathokheni angu-300k buye baqeqesheka.

I-LLaMA-Factory: izinjini ezijwayelekile ezineMegatron

Amadokhumenti okuqeqesha asabalalisiwe e-LLaMA-Factory amboza i-DDP, i-DeepSpeed, ne-FSDP, okuhlanganisa i-FSDP2 ne-Ray yokugijima kwe-single-node kanye nama-multi-node. Amadokhumenti aphinde achaze i-DeepSpeed ​​AutoTP, ehlanganisa i-tensor parallelism ne-ZeRO.

Ukwengezwa kwayo okulandela kakhulu ngo-2025 kwaba ukuqeqeshwa kwe-Megatron-core backend nge-mcore_adapter. Lokho kuvula umzila wangempela wokuqeqeshwa kwangaphambi kwesikhathi.

Indlela ye-FSDP+QLoRA ishuna kahle imodeli engu-70B kuma-GPU amabili angu-24 GB. Leyo yindlela eshibhile ebhalwe phansi eya ku-70B kulesi siqhathaniso.

Iphoyinti lokushayisana yi-interface. Ukucushwa okusabalalisiwe kuhlala ku-YAML ne-CLI, hhayi ku-LlamaBoard. Amaqembu e-Dev amukele i-LLaMA-Factory nge-UI yekhodi enguziro alahlekelwa yileso sakhiwo lapho edlula i-GPU eyodwa.

Unsloth: igebe elivulekile

Imibhalo ye-Unsloth ene-GPU eminingi ithi ama-GPU amaningi asebenza nge-Accelerate ne-DeepSpeed, enikeza ukufinyelela ku-FSDP ne-DDP. Iphinde ithi inqubo iyinkimbinkimbi futhi idinga ukusethwa mathupha, nokusekelwa okusemthethweni kusamenyezelwa.

Umzila ongokoqobo uwukuthi accelerate launch train.py noma torchrun --nproc_per_node N_GPUS train.py. Kumamodeli amakhulu kakhulu ku-GPU eyodwa, device_map = "balanced" ihlukanisa imodeli kuwo wonke amadivayisi.

Uhlu lwe-Unsloth's PyPI lumaka i-multi-GPU njengoba itholakala nokuthuthuka okukhulu okulindile. I-studio changelog ichaza ukwabiwa kwe-multi-GPU okuzenzakalelayo kokuqala kokuqondiswa nokuqeqeshwa kusukela ngoMashi 2026.

Fundani ndawonye, ​​isikhundla sicacile. I-Unsloth isekela i-multi-GPU. Ayinikezi okwamanje i-compostable parallelism matrix ebhalwe yi-Axolotl ne-TRL.

  • Ukungaziphathi kahle ikhefu lapho udinga i-tensor, umongo, noma ukufana kochwepheshe njengokucushwa kwesigaba sokuqala. Iphinda iphule uma imodeli yakho ingekho ohlwini lwayo olusekelwe, njengoba izinzuzo zivela kuma-kernels aqondene nezakhiwo.
  • I-Axolotl aphule ijika lokufunda. Ulungiselela i-FSDP2 ngokumelene ne-DeepSpeed, idigri ye-SP, kanye nezingqinamba zokuhlukaniswa. Lezo zingqinamba zithatha isibalo se-GPU, ubude bokulandelana, namakhanda okunaka.
  • I-TRL iphula kokuzenzakalelayo. Ikunikeza ezakudala ezifanele, hhayi ezishuniwe. Uhlinzeka ngokulungiselelwa kwe-Accelerate, ukulungiselelwa kwememori, nohlelo lokuhambisana.
  • I-LLaMA-Factory iphula emngceleni we-UI. Ukuhunyushwa kwayo kuhle kakhulu kuze kufike endaweni eyodwa futhi kuzacile ngaphezu kwayo.
  • I-GPU yomthengi oyedwa, izakhiwo ezisekelwayo, i-LoRA noma i-QLoRA: Ukungaziphathi kahle. I-headroom yobude bomongo iyodwa iyakuthethelela.
  • Ama-GPU amabili kuya kwayisishiyagalombili, umongo omude, ukulungisa kahle okugcwele noma amapayipi e-RLHF: I-Axolotl. I-FSDP2 kanye nokuhambisana kokulandelana kuyindlela ebhalwe kahle kakhulu.
  • Izihibe zokuqeqesha ngokwezifiso, ama-algorithms anoveli angemuva kokuqeqeshwa, ukuhlanganisa ubuso obuqinile: I-TRL. Wakha phezu kongqimba abanye abagoqayo.
  • Ukufakwa kwemodeli ebanzi, ama-opharetha angewona onjiniyela, ukugijima kokuqala okushesha kakhulu: I-LLaMA-Factory. Bese uya ku-CLI uma ukala.
  • Lezi zinketho azikhethekile. I-LLaMA-Factory ingasebenzisa i-Unsloth njenge-backend. I-TRL ithumela ukuhlanganiswa kwe-Unsloth. I-Axolotl ishayela abaqeqeshi be-TRL ngaphakathi.
  • I-Unsloth iwina isivinini se-GPU eyodwa nobude bomongo; i-multi-GPU ihlala iyiphoyinti layo elibuthakathaka elibhaliwe.
  • I-Axolotl ihambisa i-parallelism matrix ejulile: i-FSDP2, i-DeepSpeed, i-TP, i-CP, ne-EP ehlanganiswe nge-DeviceMesh.
  • I-TRL isendlalelo sakudala esigoqwayo, manje esinokunakwa kweRing kanye nokuhlukaniswa kokulandelana kwe-ALST/Ulysses.
  • I-LLaMA-Factory ihweba ngokujula ngobubanzi: amamodeli angu-100+, i-UI yekhodi enguziro, i-Megatron backend, ukusetha okusatshalaliswe kwe-CLI kuphela.
  • Ukulandelana kwezilinganiso zokulinganisa umongo eduze-ngomugqa kodwa ukusebenza kahle kwe-output kwehla kakhulu kudlule ama-GPU amane.


U-Asif Razzaq uyi-CEO ye-Marktechpost Media Inc. Njengosomabhizinisi nonjiniyela onombono, u-Asif uzibophezele ekusebenziseni amandla e-Artificial Intelligence ukuze kuzuze umphakathi. Umzamo wakhe wakamuva ukwethulwa kwe-Artificial Intelligence Media Platform, i-Marktechpost, egqama ngokufaka kwayo kabanzi ngokufundwa komshini kanye nezindaba zokufunda ezijulile ezizwakala kahle ngokobuchwepheshe neziqondakala kalula yizilaleli eziningi. Inkundla iziqhayisa ngokubuka kwanyanga zonke okungaphezu kwezigidi ezingu-2, okubonisa ukuduma kwayo phakathi kwezithameli.






Isihloko esedluleI-Cisco Foundation AI Ikhipha i-Antares: 350M kanye ne-1B Amamodeli Wesisindo Esivulekile Aveza Ubungozi Obaziwayo Ngaphakathi Kwamakhodi Angempela
























Source link

Related Articles

Leave a Reply

Your email address will not be published. Required fields are marked *

Back to top button