Eines der ersten KI-Modelle, die Bilder generieren konnten, hat diesen Markt gemalt. Vier Jahre später habe ich die heutige Technologie gebeten, dieselbe Szene noch einmal zu malen.
Der Vergleich zeigt, wie schnell sich Bildgenerierung verändert hat.
Warum Gesichter und Hände damals so oft entgleisten
Das alte Bild stammt aus der frühen Phase der Bildgenerierung um 2022. Damals liefen Modelle von Hugging Face noch auf Spielerechnern, bevor Midjourney den Zugang vereinfachte.
Viele dieser Systeme arbeiteten mit Diffusion: Sie entfernten schrittweise Rauschen und setzten aus Trainingsdaten statistisch plausible Muster zusammen. Ein explizites 3D-Modell der Szene oder eine Prüfung der Anatomie fehlte.
Gesichter verziehen sich schon bei kleinen Abweichungen, weil Augen, Nase und Mund exakt zusammenpassen müssen. Hände sind wegen ihrer vielen Posen, Finger, Überlappungen und Verdeckungen noch schwieriger. In Trainingsbildern waren sie zudem oft klein oder abgeschnitten.
Die Modelle konnten Texturen imitieren, wussten aber nicht zuverlässig, wo Finger beginnen und enden. Mehr Auflösung machte die Fehler meist nur schärfer: Gesichter zerflossen, Hände bekamen ihre eigene Anatomie und Text wurde zu Unsinn.
Klick auf eines der Originalbilder, um es in voller Auflösung zu öffnen.
Vier Jahre später
Die neue Version behält Markt, Regale, Menschen und Einkaufswagen bei, wirkt aber bei Material, Ausdruck und Komposition deutlich glaubwürdiger.
Generierter Text bleibt schwierig. Die auffälligsten anatomischen Fehler sind dagegen weitgehend verschwunden. Aus „offensichtlich generiert“ wurde in nur vier Jahren ein Bild, bei dem man zweimal hinschauen muss.
Für Kinder werden generierte Bilder neben Fotos, Filmen und Illustrationen normal sein. Bei jedem Bild wird die Frage wichtiger, woher es kommt und was wir glauben sollen.
Vielleicht wählen wir irgendwann sogar alternative Filmenden, die in Echtzeit mit denselben Figuren und Stimmen entstehen.
Genau deshalb bin ich vorsichtig mit Vorhersagen. Der Weg von verzogenen Gesichtern zu glaubwürdigen Menschen dauerte nur vier Jahre. Wahnsinn.
Was ist das älteste KI-generierte Bild, das du noch hast, und was würdest du heute neu erstellen lassen, wenn du die ursprüngliche Idee noch einmal an ein aktuelles Modell geben könntest?

