Comicfiguren - Fehler bei der Umsetzung


Ist die Umsetzung Comic-Figuren zu KI einfach?


Kurzum: NEIN

Das hat auch die Umsetzung meiner eigenen Zeichnungen zu einer KI Figur gezeigt. Die  Zeichnungen sind schon viele Jahre alt, aber die Umsetzung wurde erst durch neue Programme möglich:

 

Was war das grösste Problem:

KI wir trainiert, mit dem was es gibt. Aber meine Figur ist kein Tier, das es so in der Realität gibt, deshalb erkennt KI meine Figur nicht und so erstellen die Programme daraus verschiedene Figuren die z.B. Hamstern, Murmeltieren oder Mäusen ähnlich sehen.
- Das sogar bei der gleichen Zeichnung und dem gleichen Prompt (Eingabetext)
- Auch wenn das KI Bild passt, wird es je nach KI Videoprogramm wieder verändert , nicht selten sogar innerhalb einer Szene.

Rückfrage an KI:
Es gibt ja viel Programme mit denen man sogar gleichbleibende Figuren und damit ganze Videos erstellen kann, diese sehen oft super aus, will man aber eine exakte Kopie einer Logo-Figur oder eines Maskottchens machen, scheint das noch kaum zu gelingen?

KI bestätigt das:

Du hast hier einen absolut wunden Punkt der aktuellen KI-Technologie getroffen. Deine Beobachtung ist völlig korrekt: Während KIs fantastische, fotorealistische Menschen oder komplett neue 3D-Animationen flüssig in Videos bewegen können, scheitern sie fast immer an der exakten Kopie eines bestehenden Firmenmaskottchens oder einer Logo-Figur. 

Dass eine 1:1-Kopie deines Maskottchens kaum gelingen will, liegt an den folgenden drei Hauptgründen:

1. Das „Pixel-Gedächtnis“ vs. Vektoren (Geometrische Präzision)
Ein Firmenlogo oder Maskottchen basiert auf exakter Geometrie: Die Kurve des Ohrs hat einen bestimmten Radius, die Augen stehen in einem exakten Abstand, und die Linienführung ist absolut sauber.
Eine Bild-KI (wie Midjourney oder Stable Diffusion) „denkt“ aber nicht in Vektoren oder festen 3D-Formen, sondern in Wahrscheinlichkeiten von Pixelmustern. Für die KI reicht es, wenn ein Bild ungefähr wie eine Comic-Figur aussieht. Sobald sich die Perspektive ändert, berechnet die KI die Pixel neu, wodurch feine Details des Logos (z. B. die genaue Form einer Mütze oder das Logo auf der Brust) sofort verzerren („Visual Drift“). 

2. Fehlendes Vorwissen (Training Data)
Wenn du einer KI sagst „Erstelle ein Video mit einem bekannten Charakter wie Micky Maus oder Pikachu“, klappt das oft überraschend gut. Warum? Weil diese Figuren millionenfach in den Trainingsdaten der KI vorkommen. Die KI kennt jede Falte und jede Proportion.

Dein individuelles Firmenmaskottchen ist für die KI jedoch völlig neu. Selbst wenn du ein Referenzbild hochlädst, versucht die KI nur, den Stil und die Farben dieses Bildes zu kopieren, versteht aber nicht die dreidimensionale Anatomie dahinter. 

3. Das Problem mit Abstraktionen und Texturen
KIs tun sich paradoxerweise mit stark vereinfachten, flachen 2D-Logos oder glatten 3D-Vektor-Figuren schwerer als mit komplexen menschlichen Gesichtern. Bei einem Menschen verzeiht das Auge kleine Abweichungen im Schatten oder der Hauttextur. Bei einer minimalistischen Logo-Figur fällt jede minimale Abweichung einer Linie sofort extrem störend auf.


 Eigener Text:

Warum sind die Figuren in vielen KI Videos im Internet immer wieder verschieden?

Figuren,, vor allem von denen es nicht viel Bilder gibt, müssen zuerst trainiert werden.

Ist das nur ein Problem bei Comicfiguren oder eingescannten Vorlagen?

Nein, im Internet gibt es massenhaft  Geschichten mit Darstellungen "echter" Menschen, doch diese verändern sich oft sogar so stark, dass es schwierig ist, diese wieder zuzuordnen. Die Videos werden dadurch chaotisch schlecht.

Warum werden Videos mir vielen Fehlern trotzdem veröffentlicht?

Aus verschiedenen Gründen werden auch fehlerhafte bis katastrophale KI Videogeschichten veröffentlicht:
- u.a. Kosten:

  • Abonnements sind je nach Qualität sehr teuer. Fertige gute Videoclips von 30 Sekunden können schnell auch 30 und mehr Franken kosten, da sind die misslungenen Clips noch nicht einberechnet.
  • Mit kostenlosen Programmen ist es oft gar nicht möglich, Figuren zu trainieren. Figuren werden dadurch unterschiedlich.
  • Will man Fehlerfreie Videos haben, oder nur kleine Fehler akzeptieren, sind trotzdem, nicht nur am Anfang, viele Clips Müll, haben gekostet, sind aber nicht zu gebrauchen.

andere Gründe:

  • Es ist gar nicht so einfach, Prompts (Anweisungen an die KI) zu lernen, vor allem, weil diese jedes Programm anders umsetzt, sogar das gleich Programm den gleichen Prompt nie gleich.
  • Viele nutzen heute Prompts, die man z.B. bei Mustern andere in den Programmen ( dann ist der Vorteil dass man im gleichen Programm bleiben kann) oder auf Facebook finden kann und wundern sich, was bei ihnen rauskommt, da sie ein anderes Programm nutzen. 
  • Viele wollen damit auch einfach nur massenhaft Videos einstellen, verstehen aber kaum etwas davon.


"Consistent Characters" (konsistente Charaktere) oder Charakter-Konsistenz. sind dazu die Zauberworte,


Gemäss KI :

Um dies in Tools wie Midjourney, Stable Diffusion oder DALL-E umzusetzen, nutzt man verschiedene Techniken:
    • Character Reference (In-App-Funktionen): Viele KIs haben eigene Funktionen dafür. Bei Midjourney nutzt man dafür beispielsweise den Parameter --cref (Character Reference), um ein Referenzbild des Gesichts zu übergeben.
      • Seed-Nummern: Die Verwendung derselben Startnummer (Seed) bei gleichen Prompts, um die mathematische Basis des Bildes stabil zu halten.
        • Lora (Low-Rank Adaptation): Bei Stable Diffusion trainiert man ein eigenes kleines KI-Modell (eine LoRA-Datei) speziell auf das Gesicht und Aussehen einer bestimmten Person.
          • Präzise Text-Prompts: Die exakte Beschreibung von markanten Merkmalen (z. B. Kleidung, Frisur, Narben) in Kombination mit einem einzigartigen Namen für die Figur.


            Das heisst, selbst der gleiche Prompt, sogar mit dem gleichen Vorlagebild, bringt je nach Programm andere Resultate?

            Ja, exakt. Selbst der absolut gleiche Prompt mit demselben Referenzbild liefert je nach KI-Programm völlig unterschiedliche Ergebnisse.

            Das liegt daran, dass jede Bild-KI (wie Midjourney, DALL-E 3 oder Stable Diffusion) wie ein eigenständiger Künstler mit einem ganz eigenen Gehirn funktioniert. Sie unterscheiden sich grundlegend in folgenden Punkten:

            • Andere Trainingsdaten: Die Programme wurden mit völlig unterschiedlichen Bilddatenbanken gefüttert. Wenn du „eine Frau mit roten Haaren“ eingibst, hat Midjourney eine andere Vorstellung von Ästhetik gelernt als DALL-E 3.
            • Andere Interpretation (LLM-Interpreter): DALL-E 3 (von OpenAI) nutzt im Hintergrund ChatGPT, um deinen Prompt heimlich im Hintergrund zu erweitern und auszuschmücken. Midjourney hingegen reagiert eher auf kurze, präzise Schlagworte und mathematische Parameter.
            • Andere KI-Architekturen: Die mathematischen Modelle dahinter berechnen Pixel auf völlig unterschiedliche Weise. Auch die Funktionen für die Charakter-Konsistenz (wie --cref in Midjourney) sind einzigartige, herstellergeschützte Technologien, die bei der Konkurrenz schlicht nicht existieren.

            Gibt es andere Wege, das "Consistent Characters" Problem zu lösen?

            KI dazu:

             Wenn Unternehmen heute (Stand 2026) Videos mit ihren exakten Maskottchen erstellen, nutzen sie meistens hybride Workflows statt reiner Text-zu-Video-KIs

            • Spezialisierte Mascot-Generatoren: Plattformen wie Masko.ai oder die Charakter-Modi auf OpenArt.ai bieten Werkzeuge, die darauf ausgelegt sind, hochgeladene Maskottchen-Strukturen strikter zu fixieren und in kontrollierte Posen zu setzen. 

            • Eigenes KI-Training (LoRA): Man füttert Tools wie Flux oder Stable Diffusion mit 15 bis 20 Bildern des Maskottchens aus absolut jeder Perspektive (vorne, hinten, Profil, verschiedene Emotionen). Dadurch lernt die KI die spezifischen Regeln der Figur.

            • 3D-Modelling + AI-Rendering (Der sicherste Weg): Die Figur wird einmalig traditionell von einem Designer als echtes 3D-Modell (z. B. in Blender) gebaut. Die Animationen und Bewegungen werden im 3D-Programm gemacht. Die KI wird am Ende nur darübergelegt (z. B. via ControlNet), um Texturen, Licht und Schatten kinoreif zu rendern.

            Die harte Realität: Warum Masko.ai und Co. das Problem im Kern nicht lösen

            Du hast völlig recht: Auch Tools wie Masko.ai (die sich auf App- und Web-Maskottchen spezialisiert haben) können diese optischen Veränderungen („Visual Drift“) bei komplexen Video-Geschichten nicht komplett verhindern.

            Das liegt an der grundlegenden Arbeitsweise solcher Programme:

            • Sie arbeiten mit „Bild-Referenzen“: Masko.ai und ähnliche Generatoren nehmen dein hochgeladenes Logo als stilistischen Leitfaden. Sie versuchen, die Farben, die Textur (z.B. Clay-Look oder 3D) und die ungefähre Form zu kopieren.
            • Kein echtes 3D-Verständnis: Sobald die Figur im Video den Kopf dreht, sich duckt oder hinter etwas hervorlugt, muss die KI die „Rückseite“ oder neue Perspektiven der Figur erfinden.
            • Das Ergebnis beim Storytelling: In isolierten, kurzen Animationen (wie einem einfachen Sprung oder Winken vor transparentem Hintergrund) sieht das oft super aus. Sobald die Figur aber in eine echte Geschichte eingebaut wird – Interaktion mit Gegenständen, wechselndes Licht, verschiedene Räume –, verändern sich die Details (Proportionen, Augenabstände, Logo-Aufdrucke) von Sekunde zu Sekunde.

             

            Der „KI-Einheitsbrei“ 

            Der Markt wird aktuell von Designern überschwemmt, die Kunden schnelle KI-Logos und Maskottchen verkaufen. Das Problem dieser Konkurrenz: Sobald der Kunde eine Änderung wünscht („Können wir den Arm des Bären etwas nach links drehen?“ oder „Wir brauchen die Figur exakt so von hinten“), fliegen diese Designer aus der Kurve. Sie können es nicht liefern, weil sie von der Willkür der KI abhängig sind.

             

            Meine Nachfrage bei KI, da ich das ja von den Logos sehr gut kenne:

            Das Problem der Urheberrecht und das Markenrecht

            KI dazu:
            Du hast am Ende noch einen extrem wichtigen Punkt angesprochen, den die meisten „schnellen“ KI-Agenturen komplett verschweigen oder schlicht ignorieren: Das Urheberrecht und das Markenrecht (Copyright).

            Wenn Kunden ein Maskottchen für ihr Unternehmen wollen, brauchen sie Rechtssicherheit.

            • Das KI-Problem: Rein KI-generierte Bilder und Videos ohne menschliche Schöpfungshöhe lassen sich in vielen Ländern (wie Deutschland, Österreich und der Schweiz) rechtlich kaum oder gar nicht als Marke schützen, weil kein menschlicher Urheber dahintersteht. Zudem besteht immer das Risiko, dass die KI geschützte Elemente anderer Marken einspeist.
            • Z.B. nutzen bekannte Figuren und verletzen damit das Urheberrecht und das Markenrecht (Copyright).
            • Auch wenn KI "nur" zum verwechseln ähnliches erstellt, kann das so gewertet werden.
            • Das grosse Problem liegt dabei in der kommerziellen Nutzung.
            • Auch das Missverständnis, dass Urheberrechte und Nutzungsrechte nicht das gleiche sind.

            Meine eigene Figur hat also den Vorteil, dass sie ursprünglich als Grafik von Hand entstanden ist und ich die Urheberrechte und alle Nutzungsrechte habe.

             

            Wocles Comicfigur von feser-ch
            Ich habe es endlich geschafft, meine alte, handgezeichnete Comic-Figur lebendig zu machen. Ich musste sie etwas anpassen, sie ist aber noch klar erkennbar.




             

            Hier hatte ich erste Versuche gemacht mit KI die Figur etwas zu verändern, dabei kamen auch etwas skurrile Bilder heraus. Die Programme waren noch nicht gut genug.