Tu as déjà vu ces images bluffantes générées par IA qui inondent les réseaux sociaux, et tu t'es demandé comment les créer toi-même ? Bonne nouvelle : avec AUTOMATIC1111 Stable Diffusion WebUI, tu peux générer tes propres images en quelques clics, sans savoir coder. Ce tuto te prend par la main, de l'installation à ta première galerie d'images, avec des exemples que tu peux reproduire immédiatement.
Le problème que Stable Diffusion résout
Avant l'arrivée des IA génératives, créer une illustration originale demandait soit des heures de travail sur Photoshop, soit de payer un illustrateur. Aujourd'hui, tu tapes une phrase descriptive — un prompt — et l'IA génère l'image correspondante en quelques secondes.
Le souci, c'est que les outils en ligne comme Midjourney ou DALL·E te mettent derrière un paywall dès que tu veux produire sérieusement. Stable Diffusion, lui, est 100% gratuit et open-source. Et AUTOMATIC1111 WebUI te donne une interface graphique complète pour l'exploiter sans toucher au code.
Concrètement, voici ce que tu vas accomplir dans ce tutoriel :
- Installer Stable Diffusion WebUI sur ton PC (même sans carte graphique haut de gamme)
- Générer ta première image en 30 secondes
- Maîtriser les prompts pour obtenir exactement ce que tu veux
- Utiliser l'img2img pour transformer une photo existante
- Créer un portrait cohérent avec ControlNet
Prérequis : de quoi as-tu besoin ?
Avant de te lancer, vérifie que tu as :
- Un PC sous Windows, macOS ou Linux
- Au moins 8 Go de RAM (16 Go recommandé)
- Une carte graphique NVIDIA avec 4 Go de VRAM minimum pour de bonnes performances. Pas de GPU ? Pas de panique, le mode CPU fonctionne aussi, c'est juste plus lent.
- Environ 20 Go d'espace disque libre (les modèles pèsent lourd)
- Git installé (télécharge-le ici si besoin)
- Python 3.10 (la version 3.11+ ne fonctionne pas avec toutes les extensions — on va installer la bonne version ensemble)
Étape 1 : Installer Stable Diffusion WebUI
Ouvre un terminal (PowerShell sur Windows, Terminal sur Mac/Linux) et suis ces commandes :
# 1. Crée un dossier dédié et place-toi dedans
mkdir ~/stable-diffusion
cd ~/stable-diffusion
# 2. Clone le dépôt AUTOMATIC1111
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
cd stable-diffusion-webui
# 3. Lance l'installation automatique
# Sur Windows :
./webui-user.bat
# Sur Mac / Linux :
./webui.sh💡 Ce qui se passe : Le script télécharge automatiquement Python 3.10 (si besoin), toutes les dépendances, et le modèle Stable Diffusion de base. Le premier lancement peut prendre 15 à 30 minutes selon ta connexion. Tu verras défiler des logs dans le terminal — c'est normal.
Quand l'installation est terminée, tu verras une ligne ressemblant à :
Running on local URL: http://127.0.0.1:7860Ouvre ton navigateur et va sur http://127.0.0.1:7860. Tu devrais voir l'interface ci-dessous : une page avec un champ de texte en haut, des onglets, et plein de réglages.
💡 Illustration : Une capture de l'interface WebUI avec le champ "Prompt" bien visible, le bouton "Generate" orange, et les onglets txt2img / img2img en haut.
Étape 2 : Ta première image en 30 secondes
Maintenant que tout est en place, passons à l'action. Dans l'onglet txt2img (texte vers image), écris ce prompt dans le champ en haut à gauche :
1girl, portrait, detailed face, soft lighting, studio photography, bokeh background, 8k, highly detailedDans le champ Negative prompt (ce que tu ne veux PAS voir), colle ceci :
ugly, deformed, blurry, low quality, extra fingers, bad anatomy, watermark, textLaisse tous les autres réglages par défaut, et clique sur le gros bouton orange Generate.
En quelques secondes (ou minutes si tu es en mode CPU), ton premier portrait IA apparaît ! Félicitations, tu viens de générer ta première image avec Stable Diffusion 🎉
Comprendre ce qui vient de se passer
Stable Diffusion fonctionne en deux mots-clés comme ceci :
Concept | Explication simple |
**Prompt** | Ce que tu demandes à l'IA de dessiner. Plus c'est détaillé, meilleur est le résultat. |
**Negative prompt** | Ce que tu interdis à l'IA de faire. Indispensable pour éviter les doigts tordus et les artefacts moches. |
**Sampling steps** | Le nombre de passes de raffinement. 20-30 suffisent. Plus c'est haut, plus c'est lent (et souvent inutile). |
**CFG Scale** | À quel point l'IA doit suivre ton prompt à la lettre. 7 est un bon équilibre. Trop haut = image cramée. |
Étape 3 : Maîtriser l'art du prompt
La qualité de tes images dépend à 80 % de la qualité de ton prompt. Voici une recette en 4 ingrédients qui marche à tous les coups :
[SUJET], [STYLE], [ÉCLAIRAGE], [QUALITÉ TECHNIQUE]Exemple 1 : Paysage fantasy
Prompt : epic fantasy landscape, floating islands, waterfalls, glowing crystals, atmospheric lighting, trending on ArtStation, digital painting, by Greg Rutkowski, 8k, highly detailed, sharp focus
Negative : blurry, noisy, grainy, oversaturated, ugly, deformed💡 Illustration : Le résultat attendu — des îles flottantes avec cascades et cristaux lumineux, dans un style peinture numérique épique.
Exemple 2 : Photo culinaire
Prompt : gourmet burger, juicy meat, melted cheese, fresh vegetables, sesame bun, food photography, natural window lighting, shallow depth of field, 8k, professional, Canon EOS R5
Negative : burnt, overcooked, plastic looking, artificial, messy, ugly, cartoon, 3d renderExemple 3 : Logo minimaliste
Prompt : minimalist tech logo, letter "A", geometric, gradient blue to purple, vector style, clean lines, white background, professional branding
Negative : text, watermark, complicated, busy, 3d, realistic, shadowAstuce de pro : Ajoute toujours des mots-clés de qualité comme 8k, highly detailed, sharp focus, professional dans tes prompts. Et dans le negative prompt, mets systématiquement ugly, deformed, blurry, low quality, bad anatomy, watermark, text comme base.
Étape 4 : Transformer une image existante avec img2img
L'onglet img2img est une fonctionnalité puissante qui te permet de partir d'une image existante et de la transformer. Voici un cas concret :
Cas pratique : Transformer un croquis en illustration
- Prends une photo d'un croquis rapide que tu as dessiné sur papier (ou trouve une image simple sur ton PC)
- Va dans l'onglet img2img
- Glisse-dépose ton image dans la zone prévue
- Écris un prompt comme :
beautiful digital painting, colorful, detailed, professional illustration, fantasy art, trending on ArtStation, 8k- Règle Denoising strength sur 0.75 (ce paramètre contrôle à quel point l'IA s'éloigne de l'image d'origine : 0 = copie conforme, 1 = image complètement nouvelle)
- Clique sur Generate
💡 Illustration : Un split before/after — à gauche le croquis au crayon tout simple, à droite l'illustration finale générée.
Le résultat garde la composition de ton croquis mais le transforme en illustration pro. Magique, non ?
Étape 5 : Aller plus loin avec ControlNet — le game changer
Tu veux contrôler la pose exacte d'un personnage ? La profondeur d'un paysage ? C'est là que ControlNet entre en jeu.
Installer ControlNet
Dans l'interface WebUI, va dans l'onglet Extensions → Available → clique sur Load from → cherche ControlNet → clique sur Install. Redémarre ensuite l'interface.
Ensuite, télécharge un modèle ControlNet (par exemple le modèle canny) depuis Hugging Face et place-le dans ~/stable-diffusion/stable-diffusion-webui/extensions/sd-webui-controlnet/models/.
Utiliser ControlNet pour un portrait posé
Voici comment créer un portrait avec une pose précise :
# Télécharge un modèle ControlNet Pose (openpose)
# Place-le dans le dossier models de l'extension ControlNet- Trouve une photo de référence avec la pose qui t'intéresse
- Dans l'onglet txt2img, descends jusqu'à la section ControlNet
- Déplie-la et glisse ton image de référence
- Coche Enable
- Sélectionne Preprocessor: openpose_full et Model: control_v11p_sd15_openpose
- Dans le prompt principal, écris :
1girl, warrior princess, leather armor, sword, dramatic lighting, epic fantasy, photorealistic, 8k, highly detailed, sharp focus- Clique sur Generate
💡 Illustration : Trois colonnes — l'image de référence avec le squelette de pose détecté, le squelette extrait, et l'image finale générée avec le personnage dans la même pose.
ControlNet est l'outil qui fait passer tes créations de « joli mais aléatoire » à « exactement ce que j'avais en tête ».
Pièges classiques — et comment les éviter
Piège n°1 : « Out of memory » (VRAM insuffisante)
Le problème : La génération plante avec une erreur CUDA out of memory.
La solution : Dans l'onglet Settings → cherche --medvram ou --lowvram → coche l'option correspondante, puis dans ton fichier webui-user.bat (ou .sh), ajoute à la ligne COMMANDLINE_ARGS= :
set COMMANDLINE_ARGS=--medvram --opt-split-attentionPiège n°2 : Images floues ou déformées
Le problème : Tes portraits ont des visages tordus, des doigts en trop, des yeux qui louchent.
La solution : Augmente la résolution. Passe de 512×512 à 768×768. Active aussi Hires. fix (coche la case dans l'interface) avec un upscaler comme ESRGAN_4x. Et surtout, renforce ton negative prompt avec bad anatomy, extra fingers, fused fingers, too many fingers, distorted face.
Piège n°3 : « Ça ne ressemble pas du tout à ce que j'ai demandé »
Le problème : Tu écris a red apple on a table et tu obtiens une pomme verte flottant dans le vide.
La solution : Ton CFG Scale est peut-être trop bas ou trop haut. Reste entre 5 et 9. Et pèse chaque mot : Stable Diffusion donne la priorité aux premiers mots du prompt. Si tu veux absolument une pomme ROUGE, écris red apple, ... au lieu de apple, red....
Piège n°4 : Installation qui échoue sur Mac M1/M2
Le problème : Les puces Apple Silicon ont besoin de configurations spéciales.
La solution : Dans webui-user.sh, ajoute :
export COMMANDLINE_ARGS="--no-half --precision full"Le premier lancement sera plus lent, mais tout fonctionnera.
Pour aller plus loin
1. Explore les modèles custom sur CivitAI
Le modèle de base SD 1.5 est polyvalent, mais la vraie magie opère avec les modèles entraînés par la communauté. Rends-toi sur CivitAI.com, filtre par « Checkpoint », et télécharge un modèle qui correspond à ton style (anime, photoréaliste, fantasy, etc.). Place le fichier .safetensors dans models/Stable-diffusion/ et sélectionne-le dans le menu déroulant en haut à gauche de l'interface.
2. Apprends le fine-tuning avec LoRA
Les LoRA (Low-Rank Adaptation) sont de petits fichiers qui « greffent » un style ou un personnage sur n'importe quel modèle. Tu peux télécharger des LoRA sur CivitAI, les placer dans models/Lora/, et les activer dans ton prompt avec la syntaxe <lora:nom_du_lora:0.8>.
3. Automatise avec l'API
Stable Diffusion WebUI expose une API REST complète. Tu peux générer des images depuis un script Python :
import requests
import base64
from PIL import Image
from io import BytesIO
url = "http://127.0.0.1:7860/sdapi/v1/txt2img"
payload = {
"prompt": "a cute cat wearing a wizard hat, digital art, 8k",
"negative_prompt": "ugly, deformed, blurry",
"steps": 20,
"cfg_scale": 7,
"width": 512,
"height": 512,
}
response = requests.post(url, json=payload)
image_data = base64.b64decode(response.json()["images"][0])
image = Image.open(BytesIO(image_data))
image.save("chat_sorcier.png")
print(" Image sauvegardée : chat_sorcier.png")Ce script de 15 lignes te permet d'intégrer la génération d'images dans tes propres projets Python. Imagine une app web qui génère des illustrations à la demande, un bot Discord qui crée des mèmes, ou un outil de prototypage pour designers.
En résumé
Tu as installé Stable Diffusion WebUI, généré tes premières images, maîtrisé l'art du prompt, et découvert l'img2img et ControlNet. Le plus important, c'est de pratiquer : plus tu passes de temps à affiner tes prompts, plus tes résultats deviennent impressionnants.
Le secret des créateurs qui cartonnent sur les réseaux ? Ils ne se contentent pas du modèle de base. Ils combinent un bon checkpoint, une LoRA de style, un prompt détaillé, et un negative prompt solide. C'est un écosystème que tu maîtrises maintenant.
Alors lance-toi, expérimente, et surtout : amuse-toi. La seule limite, c'est ton imagination.

