Wir haben es selbst getestet: Lass einen KI-Bildgenerator eine Führungskraft zeigen, und du bekommst in der Regel eine weiße, männlich gelesene Person. Bitte um ein Portrait mit „Größe 54" im Prompt, und das Modell macht die Person oft trotzdem schlanker. KI-Bilder sind in Minuten produziert - aber wen sie zeigen, entscheidet nicht der Zufall, sondern ein eingebautes „Normal": jung, schlank, weiß, ohne sichtbare Behinderung.
Das ist kein Bauchgefühl, sondern inzwischen gut vermessen. Und es betrifft jede Marke, die KI-Bilder veröffentlicht - also bald fast alle.
Woher kommt das eingebaute „Normal"?
KI-Bildmodelle lernen aus riesigen Mengen an Fotos und Bildunterschriften aus dem Netz. Sie zeigen also die Welt, mit der sie gefüttert wurden - inklusive aller Schieflagen, die dort schon drinstecken: Stockfoto-Ästhetik, Werbebilder, jahrzehntealte Bildsprache. Das Ergebnis ist kein Abbild der Gesellschaft, sondern ein Abbild dessen, was fotografiert, hochgeladen und verschlagwortet wurde.
Der entscheidende Punkt: Die Modelle geben diese Verzerrung nicht nur weiter, sie drehen sie lauter. Eine Bloomberg-Auswertung von 5.100 Bildern aus Stable Diffusion v1.5 hat das durchgerechnet: Beim Stichwort „judge" wurden nur rund 3 Prozent der erzeugten Personen als Frauen gelesen - in den USA sind 34 Prozent der Richterinnen und Richter Frauen. Beim Stichwort „fast-food worker" hatten 70 Prozent der erzeugten Personen dunklere Haut, obwohl 70 Prozent der Beschäftigten in dieser Branche in den USA weiß sind - wobei Bloomberg selbst anmerkt, dass Hautton im Bild und Herkunftsangabe in der Statistik nicht dasselbe messen. Bei den Stichworten „CEO" und „lawyer" lag das Modell beim Hautton dagegen nah an der US-Statistik. Die Verzerrung trifft also nicht überall gleich stark - sie verschärft vor allem die Klischees, die ohnehin schon kursieren.
Wie groß ist die Verzerrung wirklich?
Noch deutlicher wird es beim Körperbild. Eine Studie in npj Digital Medicine hat 9.060 KI-Bilder von Patientinnen und Patienten ausgewertet, erzeugt mit vier großen Generatoren (Adobe Firefly, Bing Image Generator, Meta Imagine, Midjourney) zum Prompt „Photo of the face of a patient with ..." für 29 Krankheiten: 88 bis 96 Prozent der dargestellten Personen waren normalgewichtig - im Vergleichswert der WHO für die Allgemeinbevölkerung sind es 63 Prozent. Mehrgewichtige Menschen tauchten nur in 3 bis 5 Prozent der Bilder auf, im Vergleichswert sind es 32 Prozent. Eine Gruppe, die knapp ein Drittel der Bevölkerung stellt, kommt in diesen KI-Bildern also fast nicht vor. Die Studie schränkt selbst ein: Bewertet wurden Gesichter, nicht ganze Körper.
Beim Thema Behinderung ist das Muster ähnlich eng: In einer CHI-Studie mit dem sprechenden Titel „They only care to show us the wheelchair" beurteilten 25 Menschen mit Behinderung in acht Fokusgruppen KI-generierte Bilder und beschrieben immer dieselben reduzierten Archetypen. Eine Analyse gängiger Bildmodelle kommt zum selben Ergebnis: Behinderung wird überwiegend als manueller Rollstuhl dargestellt, und die gezeigten Personen wirken alt und traurig. Die Vielfalt echter Lebensrealitäten, von unsichtbaren Behinderungen bis zu Prothesen im Alltag, kommt schlicht nicht vor, wenn man sie nicht ausdrücklich in den Prompt schreibt.
Warum betrifft das deine Marke?
Werbung hat Schönheitsideale schon immer geprägt. Der Unterschied: Früher brauchte es ein Shooting, ein Briefing, eine bewusste Auswahl. Heute produziert ein Prompt in Sekunden ein Bild, das „gut aussieht" - und das verzerrte Normal gleich mitliefert. Wer die erstbeste Version ungeprüft veröffentlicht, macht dieses Normal ein Stück mehr zum Standard, gegen den sich echte Menschen vergleichen.
Dazu kommt die geschäftliche Seite: Deine Kundschaft ist vielfältiger als der Durchschnitts-Output eines Bildmodells. Wenn deine Website und deine Feeds nur eine einzige Sorte Mensch zeigen, erkennen sich viele deiner tatsächlichen Kundinnen und Kunden schlicht nicht wieder. Das ist dieselbe Logik wie bei der Brand Voice: Was deine Marke zeigt, erzählt, wofür sie steht - ob du es bewusst entschieden hast oder nicht.
Warum reicht ein gut gemeinter Prompt nicht?
Der naheliegende Einwand: „Dann schreibe ich die Vielfalt eben in den Prompt." Das ist der richtige Anfang - aber es funktioniert nur teilweise. In unseren eigenen Tests hat das Modell selbst bei ausdrücklicher Angabe wie „Größe 54" die Person oft schlanker gemacht, als der Prompt verlangt. Das Modell zieht den Output in Richtung seines gelernten Normals zurück, und das tut es leise: Du bekommst kein „geht nicht", sondern einfach ein Bild, das deinen Prompt nur halb ernst nimmt. Genau dieser KI-Bias macht Vielfalt zur Handarbeit.
Verlässlicher wird es mit sauberem Prompt-Engineering: konkrete, respektvolle Beschreibungen statt vager Begriffe, Referenzbilder, wo das Werkzeug sie unterstützt, mehrere Varianten generieren und bewusst auswählen - und ein prüfender Blick vor jeder Veröffentlichung. KI liefert den Entwurf, die Verantwortung bleibt beim Menschen. Das gleiche Prinzip, das sich bei Texten als Human in the Loop bewährt hat, gilt für Bilder erst recht.
Drei Hebel für Bilder, die Menschen wirklich zeigen
Mach Vielfalt zur Prompt-Regel, nicht zur Ausnahme. Nimm Repräsentation in deinen Styleguide auf: Welche Menschen zeigt eure Marke, welche Begriffe nutzt ihr im Prompt, was geht nicht raus? So hängt es nicht am Zufall oder an der Tagesform der Person am Prompt.
Prüfe vor dem Veröffentlichen mit einer einfachen Frage. Zeigt dieses Bild Menschen so, wie sie wirklich sind - oder nur das eingebaute Normal des Modells? Wenn du zehn generierte Bilder nebeneinanderlegst und alle dieselbe Sorte Mensch zeigen, ist das dein Signal.
Vergleiche den Output mit deiner echten Kundschaft. Schau in deine tatsächlichen Kundendaten, Termine, Projekte: Wen bedient ihr wirklich? Wenn die Bildwelt deiner Marke davon systematisch abweicht, verschenkst du Identifikation - und damit Vertrauen.
KI-Bilder sind gekommen, um zu bleiben - umso wichtiger, dass wir ihnen nicht das Bild von Menschen überlassen. Wenn du wissen willst, wie ihr KI-Content produziert, der eure Marke und eure Kundschaft ehrlich abbildet, schreib uns einfach. 💌
