SwarmUI (anciennement StableSwarmUI)
SwarmUI est une interface web modulaire open source pour la génération d’images et de vidéos par IA, conçue pour rendre les outils de puissance facilement accessibles tout en offrant des performances élevées et une extensibilité native. Elle supporte Stable Diffusion, FLUX, Z-Image, Qwen Image, et les modèles vidéo comme Wan et Hunyuan Video.
- Type
- Interface web modulaire pour modèles de diffusion (image + vidéo)
- Développeur
- Alex « mcmonkey » Goodwin (mcmonkeyprojects)
- Licence
- Open source (MIT)
- Version actuelle
- v0.9.8 Beta
- Langages
- C# (.NET 8) + Python (backend ComfyUI intégré)
- Modèles image
- SD 1.x, SD 2.x, SDXL, SD 3.5, FLUX, Z-Image, Qwen Image, HiDream, Chroma
- Modèles vidéo
- Wan, Hunyuan Video, LTX-2, SVD
- Plateformes
- Windows, Linux, macOS, Google Colab, RunPod, Vast.ai
- URL
- swarmui.net
Qu’est-ce que SwarmUI ?
SwarmUI (anciennement StableSwarmUI, quand le projet était sous l’égide de Stability AI) est une interface pour la génération d’images et de vidéos par IA qui se positionne entre la simplicité de Fooocus et la puissance de ComfyUI. Son objectif déclaré : être un « one-stop-shop » complet pour tout ce qui touche à la génération IA visuelle, en rendant les outils avancés accessibles sans sacrifier la flexibilité.
Le projet a été créé par Alex Goodwin (mcmonkey) et était initialement développé sous Stability AI. En juin 2024, suite à des changements chez Stability AI, le projet est devenu indépendant sous le dépôt mcmonkeyprojects/SwarmUI, où il continue d’être activement développé. La v0.9.7 (sortie début 2026) a ajouté le support de HiDream-i1, Chroma, un guide vidéo pour débutants, et une interface mobile expérimentale. La v0.9.8 continue d’élargir le support des modèles.
L’originalité technique de SwarmUI : son backend utilise ComfyUI comme moteur d’exécution, mais l’interface utilisateur est un frontend C#/.NET complètement indépendant. Vous bénéficiez des optimisations et de la compatibilité de modèles de ComfyUI, tout en ayant une interface utilisateur plus conventionnelle et accessible.
La philosophie « Powertools Made Accessible »
SwarmUI résout un dilemme récurrent dans l’écosystème Stable Diffusion : les interfaces simples (Fooocus) manquent de fonctionnalités avancées, et les interfaces puissantes (ComfyUI) sont intimidantes pour les débutants. SwarmUI tente d’offrir les deux : un onglet Generate simple pour les débutants, et des fonctionnalités avancées (paramètres groupés, syntaxe de prompt riche, workflows Comfy personnalisés) pour les experts.
L’interface principale affiche les paramètres dans des groupes organisés et dépliables. Les débutants utilisent les groupes de base (prompt, modèle, résolution), tandis que les utilisateurs avancés déroulent les groupes supplémentaires (Refiner, ControlNet, Image Prompting, Segments, etc.). Cette approche « progressive disclosure » est plus douce que le mur de nœuds de ComfyUI, tout en offrant beaucoup plus de contrôle que Fooocus.
Support des modèles : le plus large de l’écosystème
SwarmUI se distingue par la rapidité avec laquelle il ajoute le support des nouveaux modèles. Grâce à son backend ComfyUI intégré, chaque modèle supporté par ComfyUI est théoriquement utilisable dans SwarmUI, avec une interface de paramètres adaptée automatiquement.
Modèles image
| Architecture | Modèles supportés | Notes |
|---|---|---|
| Stable Diffusion | SD 1.x, SD 2.x, SDXL, SD 3.5 | Support complet, toutes variantes |
| FLUX | FLUX.1 Dev, Schnell, Tools (Redux, Fill, Canny, Depth), Kontext | Support complet incluant les outils FLUX |
| Z-Image | Z-Image, Z-Image Turbo | 6B, support GGUF/FP8, anglais + chinois |
| Qwen Image | Qwen Image, Qwen Image Edit Plus | FP8 recommandé, nunchaku accéléré disponible |
| HiDream | HiDream-i1 (Full, Dev, Fast, Edit) | Ajouté dans v0.9.7 |
| Chroma | Chroma | Ajouté dans v0.9.7 |
Modèles vidéo
SwarmUI traite audio et vidéo comme des « citoyens de première classe » depuis la v0.9.6. Les modèles vidéo supportés incluent Wan (toutes variantes : T2V, I2V, VACE, FLF2V), Hunyuan Video, LTX-2 (premier modèle open source capable de générer de l’audio cohérent), SVD (Stable Video Diffusion), et Cosmos. Chaque modèle vidéo dispose de paramètres dédiés dans l’interface, avec un guide vidéo pour débutants intégré.
Fonctionnalités principales
Onglet Generate
L’interface de génération principale offre un champ de prompt, un sélecteur de modèle, et des paramètres organisés en groupes dépliables : base (résolution, steps, CFG, seed), refiner (pour les workflows SDXL avec refiner), ControlNet, Image Prompting, Segments (guidance régionale), et plus. Les paramètres sont regroupés en sous-groupes depuis la v0.9.7 pour une meilleure organisation des listes longues.
Syntaxe de prompt avancée
SwarmUI propose une syntaxe de prompt riche directement dans le champ de texte, sans nœuds ni extensions. C’est l’une des syntaxes de prompt les plus complètes parmi les interfaces Stable Diffusion :
La pondération par parenthèses fonctionne comme dans A1111 : (mot important:1.3) augmente l’influence d’un terme, (mot secondaire:0.7) la réduit. L’alternance ([option1|option2]) alterne entre deux concepts à chaque step de débruitage, créant des mélanges intéressants. Les wildcards et la randomisation ({choice1|choice2|choice3}) sélectionnent aléatoirement un terme dans la liste à chaque génération, idéal pour le batch processing avec variation.
La segmentation est une fonctionnalité avancée unique : <segment:yolo-face> détecte automatiquement les visages dans l’image en cours de génération via YOLOv8 et applique le prompt qui suit uniquement à la zone du visage. C’est l’équivalent d’ADetailer intégré directement dans la syntaxe du prompt, sans extension séparée.
D’autres syntaxes utiles incluent le préfixe de résolution (<res:1024x1024>) pour forcer la résolution dans le prompt, le lora loading inline (<lora:nom_du_lora:0.8>), et les références de preset. L’autocomplétion intelligente suggère des termes, des LoRAs, des modèles et des presets en temps réel pendant la saisie, ce qui accélère considérablement la rédaction de prompts complexes. L’ensemble de cette syntaxe est documentée dans la page Features/Prompt Syntax du wiki.
Système de presets
SwarmUI intègre un système de presets robuste : vous pouvez sauvegarder n’importe quelle combinaison de paramètres comme preset réutilisable, et les marquer comme favoris (star) pour un accès rapide. Des presets officiels de haute qualité pour SDXL sont fournis. Les presets sont interchangeables entre utilisateurs, ce qui facilite le partage de configurations optimales.
Workflows ComfyUI personnalisés
Grâce à son backend ComfyUI, SwarmUI permet d’importer et d’exécuter des workflows ComfyUI directement depuis son interface. Les nœuds ComfyUI apparaissent comme des paramètres dans l’interface SwarmUI, avec la possibilité de les exposer ou de les masquer. C’est un pont unique : vous bénéficiez de la flexibilité des workflows ComfyUI sans quitter l’interface simplifiée de SwarmUI.
ControlNet et Image Prompting
ControlNet est intégré nativement avec les pré-processeurs les plus courants (Canny, Depth, OpenPose, etc.). IP-Adapter (Image Prompting) est aussi intégré avec support des masques et de FaceID pour le transfert de visage. Les paramètres avancés (Style Model Merge Strength, Style Model Multiply Strength, Style Model Apply Start) offrent un contrôle fin sur l’influence de l’image de référence.
Inpainting, Outpainting, Upscaling
L’inpainting et l’outpainting sont intégrés dans l’onglet Generate. L’upscaling utilise les modèles ESRGAN/Real-ESRGAN via le backend ComfyUI. Le segment YOLOv8 permet la détection automatique de visages pour un inpainting ciblé (similaire à ADetailer dans A1111).
Support multi-GPU et cluster
Une fonctionnalité distinctive de SwarmUI est son support natif du multi-GPU et du déploiement en cluster. L’Auto-Scaling Backend (expérimental dans v0.9.7) permet de distribuer les générations sur plusieurs GPU ou machines, avec une gestion automatique de la file d’attente. C’est une fonctionnalité orientée production que les autres interfaces n’offrent pas nativement.
Historique d’images
L’onglet Image History propose un navigateur complet de toutes les images générées, avec métadonnées, filtres de recherche, et la possibilité de rappeler les paramètres de n’importe quelle image. Les vidéos et fichiers audio sont aussi gérés dans l’historique depuis la v0.9.6.
Extensibilité
SwarmUI supporte des extensions développées en C# (avec leur propre fichier csproj). L’architecture modulaire permet d’ajouter de nouveaux paramètres, de nouveaux backends, ou de nouvelles interfaces sans modifier le code principal. Les webhooks permettent de déclencher des actions externes après chaque génération (notification, post-traitement automatisé, intégration avec d’autres outils).
Installation
Windows
Téléchargez Install-Windows.bat depuis le dépôt GitHub. Stockez-le dans le dossier où vous voulez installer SwarmUI (pas dans Program Files). Lancez-le. Le script installe automatiquement .NET 8, Python, ComfyUI (backend), et configure l’environnement. Au premier lancement, un navigateur s’ouvre sur la page d’installation guidée où vous choisissez les modèles à télécharger.
Linux / macOS
# Prérequis
# Linux : sudo apt install git python3 python3-pip python3-venv
# macOS : installer Git et Python 3 via Homebrew
# Installer .NET 8 SDK
# Voir https://dotnet.microsoft.com/download/dotnet/8.0
# Cloner et lancer
git clone https://github.com/mcmonkeyprojects/SwarmUI.git
cd SwarmUI
bash launch-linux.sh # ou launch-macos.shCloud (Colab, RunPod, Vast.ai)
Un notebook Google Colab officiel est fourni. Des templates RunPod et Vast.ai sont maintenus par la communauté. Le démarrage initial prend quelques minutes (téléchargement des dépendances et du backend ComfyUI). SwarmUI est conçu pour fonctionner efficacement en environnement cloud avec sa gestion de file d’attente et son support multi-backend.
SwarmUI vs les autres interfaces
| Critère | SwarmUI | A1111 | ComfyUI |
|---|---|---|---|
| Interface | Web classique avec groupes dépliables | Web classique avec onglets | Nœuds visuels |
| Courbe d’apprentissage | Douce (progressive disclosure) | Rapide | Raide |
| Support FLUX | Oui (complet, Tools inclus) | Non (via Forge) | Oui (natif) |
| Support vidéo | Natif (Wan, Hunyuan, LTX-2) | Limité | Via custom nodes |
| Multi-GPU / cluster | Natif (Auto-Scaling Backend) | Non | Limité |
| Backend | ComfyUI intégré + C#/.NET | Python/Gradio | Python/PyTorch |
| Extensions A1111 | Non compatibles | Oui (écosystème massif) | Écosystème custom nodes |
| Workflows ComfyUI | Importables et exécutables | Non | Natif |
| Développement | Très actif (~500 commits entre versions) | Ralenti | Très actif |
Le verdict : SwarmUI est une alternative très intéressante pour les utilisateurs qui trouvent ComfyUI trop complexe mais A1111 trop limité. Son support multi-modèles (image + vidéo), son backend ComfyUI transparent, et son approche « progressive disclosure » en font un excellent choix polyvalent. Le principal inconvénient : sa communauté est plus petite que celles d’A1111 et ComfyUI, ce qui signifie moins de tutoriels et de ressources partagées. Mais le développement est très actif et le support de modèles est souvent parmi les premiers disponibles.
Cas d’usage idéaux
Utilisateurs multi-modèles
Si vous travaillez avec SD, SDXL, FLUX, Z-Image et les modèles vidéo, SwarmUI offre une interface unifiée pour tous ces modèles sans avoir à basculer entre différentes applications. Les paramètres s’adaptent automatiquement au modèle sélectionné.
Génération vidéo accessible
SwarmUI est l’une des rares interfaces à traiter la vidéo comme un citoyen de première classe. Le guide vidéo pour débutants et les paramètres intégrés rendent la génération vidéo plus accessible que dans ComfyUI (où il faut construire un workflow nodal complexe).
Déploiement en production
L’Auto-Scaling Backend, le support multi-GPU, et les webhooks font de SwarmUI une option viable pour les déploiements en production. Les entreprises ou studios qui ont besoin de distribuer des générations sur un cluster de GPU trouvent dans SwarmUI des fonctionnalités que les autres interfaces n’offrent pas nativement.
Limites
Statut Beta
SwarmUI est officiellement en Beta. La plupart des fonctionnalités sont stables pour un usage quotidien, mais des bugs peuvent subsister, notamment dans les fonctionnalités les plus récentes (Auto-Scaling Backend, interface mobile). Le développeur recommande l’outil « pour la plupart des utilisateurs, débutants et pros », mais le statut Beta implique que des changements breaking peuvent intervenir entre versions.
Communauté plus restreinte
Avec ~3 500 étoiles sur GitHub (contre 140 000+ pour A1111 et ~60 000+ pour ComfyUI), la communauté SwarmUI est nettement plus petite. Moins de tutoriels, moins de presets partagés, et moins de ressources d’aide. Le Discord officiel est actif mais bien moins peuplé que les communautés A1111/ComfyUI.
.NET 8 SDK requis
Contrairement aux autres interfaces (pure Python), SwarmUI nécessite le .NET 8 SDK. C’est une dépendance supplémentaire qui peut surprendre les utilisateurs de l’écosystème Python. Sur Windows 11, l’installation est automatisée. Sur les autres OS, c’est une étape manuelle supplémentaire.
Pas de compatibilité avec les extensions A1111
Les centaines d’extensions A1111 ne sont pas utilisables dans SwarmUI. Le système d’extensions de SwarmUI est propre (C#/.NET) et l’écosystème est encore restreint par rapport à la richesse d’A1111 ou de ComfyUI. En revanche, les workflows ComfyUI (et par extension les custom nodes ComfyUI) sont importables, ce qui compense partiellement cette limitation. Si vous dépendez fortement d’extensions A1111 spécifiques (Regional Prompter, Dynamic Prompts, Civitai Helper), vérifiez que SwarmUI propose un équivalent intégré ou un workflow ComfyUI importable avant de migrer. Pour de nombreuses extensions populaires (ControlNet, ADetailer, IP-Adapter, upscaling), SwarmUI intègre des fonctionnalités natives équivalentes qui couvrent les mêmes besoins sans extension tierce.
Questions fréquentes sur SwarmUI
SwarmUI est-il gratuit ?
Oui, SwarmUI est 100% gratuit et open source sous licence MIT. Le développeur s’est engagé à ne jamais ajouter de paywall ni de publicité. Un Patreon existe pour les donations volontaires, mais toutes les fonctionnalités restent gratuites. C’est l’une des rares interfaces sous licence MIT (la plus permissive), contre AGPL pour A1111 et GPL pour ComfyUI.
SwarmUI utilise-t-il ComfyUI en arrière-plan ?
Oui. Le backend de SwarmUI est une instance ComfyUI intégrée qui gère l’exécution des modèles, le chargement des poids, et le processus de diffusion. L’interface utilisateur (C#/.NET) communique avec ce backend ComfyUI de manière transparente. Cela signifie que SwarmUI bénéficie automatiquement des optimisations et du support de modèles de ComfyUI, et que les workflows ComfyUI sont importables directement.
SwarmUI supporte-t-il la génération vidéo ?
Oui, et c’est l’un de ses points forts. SwarmUI supporte nativement les modèles Wan (T2V, I2V, VACE), Hunyuan Video, LTX-2 (avec audio), SVD, et Cosmos. Audio et vidéo sont des « citoyens de première classe » depuis la v0.9.6 : ils ont des interfaces dédiées, un support complet dans l’historique, et la possibilité de créer des paramètres d’entrée qui les acceptent. Un guide vidéo pour débutants est intégré.
Comment SwarmUI se compare-t-il à ComfyUI ?
SwarmUI utilise ComfyUI comme backend mais offre une interface utilisateur classique (formulaire web) au lieu de nœuds visuels. C’est plus accessible pour les débutants et les utilisateurs qui préfèrent les interfaces traditionnelles. ComfyUI offre plus de flexibilité pour les workflows entièrement personnalisés, mais SwarmUI couvre la majorité des cas d’usage courants avec une interface plus ergonomique. Les workflows ComfyUI sont importables dans SwarmUI pour les cas qui nécessitent plus de personnalisation.
Quels GPU sont supportés par SwarmUI ?
SwarmUI supporte les GPU NVIDIA (via CUDA), AMD (via ROCm sur Linux), et Apple Silicon (via Metal). Le support multi-GPU est natif, ce qui est rare parmi les interfaces SD. L’Auto-Scaling Backend (expérimental) permet de distribuer les générations sur plusieurs GPU ou machines. Pour les GPU à faible VRAM, les modèles quantifiés (GGUF, FP8, NF4) sont supportés pour la plupart des architectures.