Unsloth, Axolotl, TRL et LLaMA-Factory : le duel des cadres de réglage des LLM
Lorsqu’ils ajustent aujourd’hui des grands modèles de langage, les ingénieurs s’appuient principalement sur quatre cadres open source : Unsloth, Axolotl, TRL et LLaMA-Factory. Tous quatre reposent sur la même pile PyTorch et Hugging Face, mais chacun concentre ses efforts d’ingénierie dans des domaines distincts. Unsloth réécrit les noyaux de bas niveau, Axolotl compose des stratégies de parallélisme, TRL définit les API d’entraînement que les autres utilisent, et LLaMA-Factory optimise la couverture de modèles et l’opération sans code. Les différences réelles se révèlent sur trois axes critiques pour les ingénieurs : le débit d’entraînement, la VRAM maximale et le passage à l’échelle multi-GPU.
Comparaison technique des cadres
TRL constitue la couche d’implémentation de référence. Sa version stable actuelle (v1.8.0) intègre des modules d’entraînement comme SFTTrainer, DPOTrainer, GRPOTrainer, KTOTrainer, RewardTrainer et RLOOTrainer. Axolotl et LLaMA-Factory s’appuient sur TRL, ce qui les aligne sur les algorithmes principaux tout en leur permettant de se spécialiser ailleurs. Unsloth, en revanche, remplace des parties du code de modélisation par des noyaux Triton écrits manuellement et des étapes de rétropropagation dérivées à la main. L’analyse de Hugging Face confirme qu’aucune perte de précision n’est introduite par rapport au QLoRA standard.
Unsloth met en avant des gains au niveau des noyaux sur une seule GPU. Ses bancs d’essai publiés montrent un doublement de la vitesse d’entraînement pour Llama 3.1 8B et 3.3 70B avec Alpaca, une taille de lot de 2 et une accumulation de gradients de 4 avec un QLoRA de rang 32 sur toutes les couches linéaires. Sur une NVIDIA B200, l’ajustement de unsloth/gpt-oss-20b-BF16 avec un contexte de 8 K réduit le temps par étape de 5 226 ms à 712 ms, soit un écart de 7,3 fois qui s’élargit avec des séquences plus longues grâce à Flex Attention et aux noyaux MoE. Qwen3-30B-A3B affiche une amélioration plus modeste, entre 1,1 et 1,7 fois selon la longueur de la séquence et le matériel.
Axolotl, inspiré par Unsloth, a ajouté des noyaux Triton personnalisés et des fonctions d’autograd pour LoRA début 2025. Ces optimisations sont activables via lora_mlp_kernel, lora_qkv_kernel et lora_o_kernel. Des mises à jour récentes ajoutent la prise en charge de SonicMoE LoRA, offrant des accélérations jusqu’à 1,45 fois et une réduction de 30 % de la mémoire par rapport à une référence en grouped_mm sur Qwen3.5-35B-A3B en LoRA 8 bits sur une seule H100 SXM. Axolotl propose également FlashAttention 2/3/4, xFormers, Flex Attention, SageAttention, Liger Kernel, Cut Cross Entropy et ScatterMoE.
LLaMA-Factory, présenté comme une démonstration système à l’ACL 2024, couvre plus de 100 LLM et VLM et intègre une interface web Gradio appelée LlamaBoard pour une utilisation sans code.
Implications pratiques
Pour les équipes disposant d’un budget limité à une seule GPU, Unsloth et Axolotl réduisent le temps par étape d’environ moitié par rapport à TRL vanilla, Unsloth se démarquant sur les contextes longs. Le parallélisme composable d’Axolotl brille lorsqu’il combine plusieurs stratégies sur des configurations multi-GPU. TRL reste le choix le plus sûr car il constitue le dénominateur commun, tandis que LLaMA-Factory convient aux équipes privilégiant une interface graphique et une large couverture de modèles plutôt que la vitesse brute.
Unsloth | Axolotl | TRL | LLaMA-Factory
Pourquoi c’est important
L’écart entre les cadres les plus rapides et les plus lents peut se traduire par des heures économisées par exécution d’entraînement et des milliers de dollars en temps GPU. Les équipes optimisant la latence d’inférence ou travaillant sur des contextes longs devraient d’abord tester Unsloth. Celles qui combinent plusieurs stratégies de parallélisme préféreront Axolotl. Enfin, LLaMA-Factory abaisse la barrière pour les non-ingénieurs souhaitant ajuster des modèles, élargissant ainsi l’accès à la personnalisation des LLM.
Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

