Ratgeber · 8 Min Lesezeit
Midjourney vs Stable Diffusion: Syntax im direkten Vergleich
Wie Midjourney-Flags und SD-Tag-Weightings funktionieren, wann welches System die richtige Wahl ist.
Midjourney und Stable Diffusion sind die zwei dominanten KI-Bild-Systeme im Westen. Beide erzeugen großartige Bilder, aber sie sprechen unterschiedliche Sprachen. Wer in beiden zuhause sein will, muss zwei Grammatiken lernen.
Midjourney: lesbare Sätze plus Parameter-Flags
Midjourney-Prompts wirken wie englische Beschreibungen mit angehängten Schalter-Optionen:
photorealistic portrait of an elderly fisherman, weathered face,
soft window light, 85mm lens, shallow depth of field
--ar 3:4 --v 6.1 --stylize 250
Die ersten Zeilen sind ein normaler englischer Bildtext. Die Flags hinter -- steuern Parameter:
--ar 3:4— Aspect Ratio--v 6.1— Modell-Version--stylize 250— Stilstärke (0-1000)--chaos 25— Variationsbreite (0-100)--no text, watermark— Negative Tokens--seed 1337— Reproduzierbarer Seed--niji 6— Wechselt auf Anime-Sub-Modell
Midjourney interpretiert die Beschreibung relativ frei. Wer „cinematic” sagt, bekommt cinematic. Wer „shot on Fujifilm X-T5” sagt, bekommt Fujifilm-Look. Es gibt kein Token-Weighting im Sinne von Stable Diffusion, dafür aber den Stilize-Regler, der wie ein Filter über das ganze Bild liegt.
Stable Diffusion: Token-Listen mit präziser Gewichtung
SDXL-Prompts sind keine Sätze, sondern kommaseparierte Token-Listen mit optionalen Gewichten:
(masterpiece:1.2), elderly fisherman, weathered face,
photorealistic, soft window light, 85mm lens,
(shallow depth of field:1.3), professional photography
Negative: (low quality:1.4), blurry, watermark, deformed hands
Die Klammern mit Faktor (:1.2) sind ein Schlüssel-Feature: Token werden gewichtet. 1.2 heißt 20% stärker, 0.7 heißt 30% schwächer. Verschachtelung ist möglich.
Wichtige SD-Parameter werden außerhalb des Prompts gesetzt:
- CFG Scale 5-12 (Default 7) — wie strikt am Prompt orientieren
- Steps 20-50 — Diffusion-Iterationen
- Sampler wie
DPM++ 2M KarrasoderEuler a— der Iterations-Algorithmus - Seed — Startrauschen reproduzierbar machen
- CLIP Skip 1-2 — wie tief der Text-Encoder die Embeddings auswertet
Stable Diffusion kennt zusätzlich:
- LoRAs:
<lora:miyazaki-style:0.8>aktiviert einen Stil-Adapter - Textual Inversions:
<easynegative>ruft ein vortrainiertes Negative-Konzept ab - BREAK: trennt Concept-Blöcke, damit sie sich nicht vermischen
- Schedule-Syntax
[a:b:0.5]: bis 50% der Steps wirdaverwendet, dannb
Direkter Übertragungsversuch
Derselbe Bildwunsch in beiden Systemen:
Midjourney:
elderly fisherman in Vietnam, weathered face with deep wrinkles,
holding traditional rowing oar, golden hour, cinematic
--ar 3:4 --v 6.1 --stylize 350
Stable Diffusion SDXL:
(masterpiece:1.2), elderly Vietnamese fisherman, weathered face,
deep wrinkles, holding traditional rowing oar, golden hour lighting,
cinematic composition, (photorealistic:1.3), 85mm lens
Negative: (cartoon:1.4), low quality, blurry, deformed, watermark
CFG 7, Steps 30, Sampler DPM++ 2M Karras
Beide Prompts zielen auf dasselbe Bild, aber:
- Midjourney braucht nur den Modifier
cinematic— der Rest passiert automatisch. - SDXL braucht explizite Token wie
(photorealistic:1.3)und einen vollständigen Negative Prompt, weil ohne ihn Hände und Gesichter oft kaputt werden.
Wann welches Modell?
Midjourney wählen, wenn:
- Schneller Output mit hoher Out-of-the-Box-Qualität gewünscht ist
- Cinematic-Look oder klassische Illustration gewünscht ist
- Kein lokaler Setup möglich oder gewünscht ist
- Eine Discord/Web-Subscription bezahlbar ist (ab $10/Monat)
Stable Diffusion wählen, wenn:
- Maximale Kontrolle gewünscht ist (CFG, Sampler, Steps frei)
- LoRAs für Stil, Charakter, Pose verwendet werden sollen
- Lokales Setup möglich ist (8 GB+ VRAM)
- Open-Source und Customisierung priorisiert wird
- Negative Prompts dringend benötigt werden
DALL-E und Flux
DALL-E 3 versteht natürliche Sprache am besten. Statt Token-Listen schreibt man:
A close-up portrait of an elderly Vietnamese fisherman with
weathered face and deep wrinkles, holding a traditional rowing
oar at golden hour, in the style of cinematic photography.
Keine Flags, keine Klammern. Sehr saubere Composition, aber wenig Kontrolle und harte Filter.
Flux ist ein Mittelding: natürliche Sprache funktioniert, optionale Tag-Detail-Token gehen auch. Beste Text-im-Bild-Qualität aller vier Modelle.
Wechselseitige Übertragung in der Praxis
Wer einen Midjourney-Prompt in SDXL portieren will, sollte:
- Subjekte und Stile in Token aufsplitten (Kommas statt fließender Satz)
- Wichtigste Eigenschaften mit
(token:1.2)gewichten - Einen ordentlichen Negative Prompt ergänzen
- CFG bei 7, Steps bei 30 starten
Andersrum: SDXL-Token-Listen in Midjourney funktionieren auch, aber Midjourney profitiert von zusätzlichem Fließtext drumherum.