Vor drei Jahren waren erzeugte Videos ein Kuriosum: verwackelte Sekunden, in denen Gesichter zerflossen und Hunde sechs Beine hatten. Heute entstehen Aufnahmen, die in einem Werbespot nicht auffallen würden. Was dazwischen passiert ist, lässt sich erklären – und wer es versteht, kann besser einschätzen, wofür sich diese Werkzeuge im eigenen Betrieb eignen und wofür nicht. Dieser Beitrag geht den Weg vom Satz bis zum fertigen Video Schritt für Schritt durch, mit sechs Grafiken zum Ausprobieren.
Der Kern: Aus Rauschen wird ein Bild
Der überraschendste Teil kommt gleich am Anfang. Ein Videomodell malt kein Bild, so wie ein Mensch es täte – es beginnt mit reinem Zufall und räumt ihn auf. Man nennt das Verfahren Diffusion, und es beruht auf einer einfachen Umkehrung: Im Training wurden echte Videos schrittweise mit Rauschen zugekleistert, bis nichts mehr zu erkennen war. Das Modell lernte dabei nur eine einzige Sache – für ein verrauschtes Bild zu schätzen, welcher Teil davon das Rauschen ist.
Beim Erzeugen wird diese Fähigkeit rückwärts angewendet. Man gibt dem Modell reines Rauschen und lässt es abziehen, was es für Rauschen hält. Was übrig bleibt, ist etwas weniger zufällig. Das wiederholt man zwanzig- bis fünfzigmal, und am Ende steht ein Bild.
Schritt 0 von 8
Am Anfang steht reines Rauschen – zufällige Farbwerte ohne jede Bedeutung.
Gesteuert wird das Ganze durch die Beschreibung. Sie sorgt dafür, dass das Modell nicht irgendein plausibles Bild ansteuert, sondern eines, das zum Text passt. Deshalb ist die Beschreibung kein Suchbegriff, sondern eine Richtungsangabe – und deshalb liefert derselbe Satz bei jedem Durchlauf ein anderes Ergebnis: Das Rauschen am Anfang ist jedes Mal neu.
Was Video schwerer macht als ein Bild
Ein Video ist auf den ersten Blick nur eine Folge von Bildern. Fünf Sekunden mit 24 Einzelbildern je Sekunde sind 120 Bilder. Würde man sie einzeln erzeugen, wäre das Ergebnis unbrauchbar – jedes Bild wäre für sich genommen richtig und würde doch nicht zum vorigen passen.
Mit Konsistenz bleibt das Auto dasselbe Auto: gleiche Farbe, gleiche Größe, gleiche Höhe über der Straße. Nur die Position ändert sich – das nimmt das Auge als Bewegung wahr.
Die Lösung besteht darin, alle Einzelbilder gemeinsam zu erzeugen statt nacheinander, und dem Modell zusätzliche Schichten mitzugeben, die die Bilder untereinander vergleichen. So wird Bewegung nicht nachträglich hergestellt, sondern von Anfang an mitgedacht. Genau dieser Schritt hat den sichtbaren Sprung der letzten Jahre gebracht – und er erklärt auch, warum Video so viel teurer zu rechnen ist als ein Einzelbild.
Der Weg vom Satz zum Video
Zwischen der Eingabe und dem fertigen Clip liegen mehrere Stufen. Die Begriffe unterscheiden sich je nach Anbieter, die Reihenfolge ist bei den verbreiteten Modellen aber erstaunlich ähnlich.
Ein Satz, oft ergänzt um ein Startbild. Das Modell wandelt den Text in eine Zahlendarstellung um, die festhält, was gemeint ist – nicht die Wörter, sondern deren Bedeutung.
„Eine rote Straßenbahn fährt bei Regen durch eine Altstadtgasse, Kamerafahrt von der Seite“
Wichtig ist die vorletzte Stufe. Gerechnet wird nicht in voller Auflösung, sondern in einer stark verkleinerten Darstellung – sonst wäre der Aufwand nicht zu bezahlen. Erst am Schluss wird daraus ein Video in 1080p oder mehr. Das erklärt einen Effekt, den viele beobachten: Die großen Formen stimmen, die feinen Details wirken weich oder erfunden. Sie waren in der Darstellung, in der gerechnet wurde, schlicht nicht enthalten.
Die Beschreibung entscheidet
Wer ein brauchbares Ergebnis will, beschreibt nicht nur das Motiv, sondern auch, wie es aufgenommen sein soll. Ein Videomodell hat an Filmmaterial gelernt und versteht deshalb filmische Begriffe: Kamerafahrt, Gegenlicht, feste Einstellung, Brennweite. Fehlen diese Angaben, entscheidet das Modell selbst – und dann schwankt das Ergebnis von Durchlauf zu Durchlauf stark.
eine rote Straßenbahn, fährt durch eine Altstadtgasse
Beschreibung: knapp · 2 von 5 Bausteinen
Zwei Hinweise aus der Praxis. Erstens wirkt ein Startbild stärker als jede Beschreibung: Wer ein Foto mitgibt und das Modell daraus Bewegung erzeugen lässt, behält die Kontrolle über Farbe, Raum und Bildausschnitt. Zweitens lohnt es sich, negative Angaben wegzulassen. „Keine Menschen im Bild“ funktioniert bei Videomodellen deutlich schlechter als eine positive Beschreibung dessen, was zu sehen sein soll.
Und der Ton?
Lange war erzeugtes Video stumm. Inzwischen erzeugen mehrere Modelle passende Geräusche gleich mit – Schritte, Regen, Umgebungsgeräusche, teils auch Sprache, die zu den Lippenbewegungen passt. Das ist technisch beeindruckend und praktisch der Punkt, an dem es rechtlich unübersichtlich wird: Eine Stimme, die nach einer bestimmten Person klingt, ist nicht dasselbe wie ein Regengeräusch. Musik kommt meist aus getrennten Werkzeugen und sollte im geschäftlichen Umfeld lizenziert bezogen werden, statt sich auf die Angaben eines Anbieters zu verlassen.
Was 2026 noch nicht gut funktioniert
Die veröffentlichten Beispielvideos der Anbieter sind ausgewählt. In der täglichen Arbeit stößt man schnell auf immer dieselben Punkte.
Firmenlogos, Straßenschilder, Bedienfelder: Buchstaben geraten oft verzerrt oder verändern sich von Bild zu Bild. Für Werbung mit Markennamen ist das ein echtes Hindernis – Text wird deshalb meist nachträglich eingefügt.
Balken: wie häufig dieser Punkt in der Praxis Probleme macht.
Die praktische Folge daraus ist eine Erwartungshaltung, die vor Enttäuschung schützt: Erzeugte Videos eignen sich hervorragend für Stimmung, Hintergründe, Zwischenschnitte und Ideenskizzen. Sie eignen sich schlecht überall dort, wo etwas Bestimmtes genau so aussehen muss – das eigene Produkt, die eigene Werkstatt, die eigenen Mitarbeiter. Für diese Aufnahmen bleibt eine Kamera der schnellere Weg.
Wofür sich das im Betrieb lohnt
Vier Anwendungen tragen sich in der Praxis. Erstens Hintergrundmaterial für die eigene Website: ruhige, kurze Aufnahmen, die Stimmung erzeugen, ohne etwas Konkretes zu behaupten. Zweitens Zwischenschnitte in echten Videos – wenn ein Bild fehlt, das man nicht mehr nachdrehen kann. Drittens Entwürfe: Bevor ein Filmteam anrückt, lässt sich eine Bildidee in einer halben Stunde sichtbar machen und mit allen Beteiligten besprechen. Und viertens Erklärendes, das sich ohnehin nicht filmen lässt, etwa ein Vorgang im Inneren eines Geräts.
Was in aller Regel nicht trägt: ein vollständiger Werbefilm ohne echtes Material. Der Aufwand für Auswahl, Nachbesserung und Schnitt wird unterschätzt, und das Ergebnis wirkt in der Summe beliebig – gerade weil es technisch gut aussieht.
Darf ich das veröffentlichen?
Bevor ein erzeugtes Video auf die Website oder in soziale Netzwerke geht, lohnen sich ein paar Minuten Nachdenken. Die sechs häufigsten Fälle zum Durchprüfen.
Ein erzeugtes Stimmungsvideo als Hintergrund auf der Startseite
Ein Video, das eine echte Baustelle Ihres Betriebs zeigen soll – aber erzeugt ist
Das Gesicht eines Mitarbeiters aus einem Foto in ein Video übernehmen
Eine bekannte Persönlichkeit für Ihr Produkt sprechen lassen
Aktuelle Chartmusik unter das Video legen
Ein erzeugtes Video in sozialen Netzwerken veröffentlichen
Zwei Regeln fassen das zusammen. Erstens: Erzeugtes Material darf nie als Beleg für etwas Tatsächliches auftreten – kein erfundenes Referenzprojekt, keine erfundene Werkstatt, kein erfundener Kunde. Zweitens: Sobald erkennbare Personen oder fremde Marken ins Spiel kommen, braucht es eine Erlaubnis. Die KI-Verordnung verlangt zudem für Inhalte, die echt wirken sollen, eine Offenlegung; große Plattformen setzen Ähnliches bereits über ihre eigenen Regeln durch.
Häufige Fragen
Wie lange dauert es, ein Video zu erzeugen?
Je nach Modell und Länge einige Sekunden bis einige Minuten für fünf bis zehn Sekunden Material. Der eigentliche Zeitaufwand liegt woanders: Bis ein Ergebnis brauchbar ist, braucht es meist fünf bis zwanzig Versuche. Rechnen Sie für einen verwendbaren Clip eher mit einer Stunde als mit zwei Minuten.
Was kostet das?
Abgerechnet wird meist nach Sekunden oder in Abonnements mit Kontingent. Für gelegentliche Nutzung liegen die Kosten im Bereich eines Monatsabos für Bürosoftware. Teuer wird es erst bei hoher Auflösung und vielen Versuchen – und Versuche gibt es viele.
Kann ich mein eigenes Produkt in ein Video bringen?
Am ehesten über ein Startbild: ein echtes Foto des Produkts, aus dem das Modell Bewegung erzeugt. Rein über eine Textbeschreibung entsteht ein ähnliches, aber nicht Ihr Produkt – mit falschen Details, die Fachleuten sofort auffallen.
Gehören mir die Rechte an dem erzeugten Video?
Die Anbieter räumen in ihren Bedingungen üblicherweise ein Nutzungsrecht ein, auch für gewerbliche Zwecke. Ein Urheberrecht im klassischen Sinne entsteht an rein maschinell erzeugtem Material in Deutschland nicht, weil es an der menschlichen Schöpfung fehlt. Praktisch heißt das: Sie dürfen es verwenden, können aber schwer anderen verbieten, etwas sehr Ähnliches zu nutzen.
Muss ich erzeugte Videos kennzeichnen?
Wenn sie echt wirken und Menschen oder Ereignisse zeigen, ja – das ergibt sich aus der KI-Verordnung und aus den Regeln der Plattformen. Bei erkennbar stilisiertem Hintergrundmaterial ist eine Kennzeichnung in der Regel nicht verlangt. Im Zweifel kennzeichnen: Der Nachteil ist gering, der Schaden bei Kritik groß.
Wie fange ich am besten an?
Nehmen Sie ein Foto, das Sie ohnehin haben, geben Sie es einem Videowerkzeug und beschreiben Sie eine einzige, ruhige Bewegung – eine langsame Annäherung etwa. Dieses eine Experiment zeigt in zehn Minuten mehr über Stärken und Grenzen als jede Präsentation.



