Ratgeber · 8 Min Lesezeit

Midjourney vs Stable Diffusion: Syntax im direkten Vergleich

Wie Midjourney-Flags und SD-Tag-Weightings funktionieren, wann welches System die richtige Wahl ist.

Midjourney und Stable Diffusion sind die zwei dominanten KI-Bild-Systeme im Westen. Beide erzeugen großartige Bilder, aber sie sprechen unterschiedliche Sprachen. Wer in beiden zuhause sein will, muss zwei Grammatiken lernen.

Midjourney: lesbare Sätze plus Parameter-Flags

Midjourney-Prompts wirken wie englische Beschreibungen mit angehängten Schalter-Optionen:

photorealistic portrait of an elderly fisherman, weathered face,
soft window light, 85mm lens, shallow depth of field
--ar 3:4 --v 6.1 --stylize 250

Die ersten Zeilen sind ein normaler englischer Bildtext. Die Flags hinter -- steuern Parameter:

  • --ar 3:4 — Aspect Ratio
  • --v 6.1 — Modell-Version
  • --stylize 250 — Stilstärke (0-1000)
  • --chaos 25 — Variationsbreite (0-100)
  • --no text, watermark — Negative Tokens
  • --seed 1337 — Reproduzierbarer Seed
  • --niji 6 — Wechselt auf Anime-Sub-Modell

Midjourney interpretiert die Beschreibung relativ frei. Wer „cinematic” sagt, bekommt cinematic. Wer „shot on Fujifilm X-T5” sagt, bekommt Fujifilm-Look. Es gibt kein Token-Weighting im Sinne von Stable Diffusion, dafür aber den Stilize-Regler, der wie ein Filter über das ganze Bild liegt.

Stable Diffusion: Token-Listen mit präziser Gewichtung

SDXL-Prompts sind keine Sätze, sondern kommaseparierte Token-Listen mit optionalen Gewichten:

(masterpiece:1.2), elderly fisherman, weathered face,
photorealistic, soft window light, 85mm lens,
(shallow depth of field:1.3), professional photography
Negative: (low quality:1.4), blurry, watermark, deformed hands

Die Klammern mit Faktor (:1.2) sind ein Schlüssel-Feature: Token werden gewichtet. 1.2 heißt 20% stärker, 0.7 heißt 30% schwächer. Verschachtelung ist möglich.

Wichtige SD-Parameter werden außerhalb des Prompts gesetzt:

  • CFG Scale 5-12 (Default 7) — wie strikt am Prompt orientieren
  • Steps 20-50 — Diffusion-Iterationen
  • Sampler wie DPM++ 2M Karras oder Euler a — der Iterations-Algorithmus
  • Seed — Startrauschen reproduzierbar machen
  • CLIP Skip 1-2 — wie tief der Text-Encoder die Embeddings auswertet

Stable Diffusion kennt zusätzlich:

  • LoRAs: <lora:miyazaki-style:0.8> aktiviert einen Stil-Adapter
  • Textual Inversions: <easynegative> ruft ein vortrainiertes Negative-Konzept ab
  • BREAK: trennt Concept-Blöcke, damit sie sich nicht vermischen
  • Schedule-Syntax [a:b:0.5]: bis 50% der Steps wird a verwendet, dann b

Direkter Übertragungsversuch

Derselbe Bildwunsch in beiden Systemen:

Midjourney:

elderly fisherman in Vietnam, weathered face with deep wrinkles,
holding traditional rowing oar, golden hour, cinematic
--ar 3:4 --v 6.1 --stylize 350

Stable Diffusion SDXL:

(masterpiece:1.2), elderly Vietnamese fisherman, weathered face,
deep wrinkles, holding traditional rowing oar, golden hour lighting,
cinematic composition, (photorealistic:1.3), 85mm lens
Negative: (cartoon:1.4), low quality, blurry, deformed, watermark
CFG 7, Steps 30, Sampler DPM++ 2M Karras

Beide Prompts zielen auf dasselbe Bild, aber:

  • Midjourney braucht nur den Modifier cinematic — der Rest passiert automatisch.
  • SDXL braucht explizite Token wie (photorealistic:1.3) und einen vollständigen Negative Prompt, weil ohne ihn Hände und Gesichter oft kaputt werden.

Wann welches Modell?

Midjourney wählen, wenn:

  • Schneller Output mit hoher Out-of-the-Box-Qualität gewünscht ist
  • Cinematic-Look oder klassische Illustration gewünscht ist
  • Kein lokaler Setup möglich oder gewünscht ist
  • Eine Discord/Web-Subscription bezahlbar ist (ab $10/Monat)

Stable Diffusion wählen, wenn:

  • Maximale Kontrolle gewünscht ist (CFG, Sampler, Steps frei)
  • LoRAs für Stil, Charakter, Pose verwendet werden sollen
  • Lokales Setup möglich ist (8 GB+ VRAM)
  • Open-Source und Customisierung priorisiert wird
  • Negative Prompts dringend benötigt werden

DALL-E und Flux

DALL-E 3 versteht natürliche Sprache am besten. Statt Token-Listen schreibt man:

A close-up portrait of an elderly Vietnamese fisherman with
weathered face and deep wrinkles, holding a traditional rowing
oar at golden hour, in the style of cinematic photography.

Keine Flags, keine Klammern. Sehr saubere Composition, aber wenig Kontrolle und harte Filter.

Flux ist ein Mittelding: natürliche Sprache funktioniert, optionale Tag-Detail-Token gehen auch. Beste Text-im-Bild-Qualität aller vier Modelle.

Wechselseitige Übertragung in der Praxis

Wer einen Midjourney-Prompt in SDXL portieren will, sollte:

  1. Subjekte und Stile in Token aufsplitten (Kommas statt fließender Satz)
  2. Wichtigste Eigenschaften mit (token:1.2) gewichten
  3. Einen ordentlichen Negative Prompt ergänzen
  4. CFG bei 7, Steps bei 30 starten

Andersrum: SDXL-Token-Listen in Midjourney funktionieren auch, aber Midjourney profitiert von zusätzlichem Fließtext drumherum.

Verwandte Themen

Zum Prompt-Generator
Anzeige
Anzeige
Anzeige
Anzeige
Anzeige