Content & Social Media · Modul 5: KI für Bild, Video und Audio

Lektion 2 von 5Übung 15 Min.

Video mit KI: was geht und was nicht

Lernziele
  • den Stand der Videomodelle realistisch einschätzen
  • geeignete von ungeeigneten Anwendungsfällen trennen
  • erzeugtes Material mit eigenen Aufnahmen kombinieren
  • den Aufwand richtig veranschlagen

Kaum ein Bereich wird so überschätzt wie erzeugtes Video. Die Vorführungen der Anbieter sind beeindruckend; der Alltag in einem Betrieb sieht anders aus. Diese Lektion trennt das eine vom anderen.

1. Die Einordnung

EinordnungWas geht – und was nicht

Fünf bis zehn Sekunden ohne Handlung und ohne Sprache – Material, Licht, Bewegung. Funktioniert zuverlässig und eignet sich als Zwischenschnitt.

Stand Herbst 2026. Die Grenze verschiebt sich, aber langsamer, als die Ankündigungen vermuten lassen. Prüfen Sie den Stand, bevor Sie darauf planen.

2. Die realistische Anwendung

Für die meisten Betriebe sieht der sinnvolle Einsatz so aus: Sie filmen selbst mit dem Handy – das eigentliche Geschehen – und nutzen KI für alles danach. Untertitel, Pausen herausschneiden, Tonspur verbessern, ein kurzer erzeugter Zwischenschnitt als Übergang.

Das spart bei einem Minutenvideo zwanzig bis dreißig Minuten Nachbearbeitung, ohne dass die Glaubwürdigkeit leidet. Es ist der unspektakuläre Einsatz mit dem besten Verhältnis von Aufwand und Nutzen.

Wer sein Produkt erzeugen lässt, statt es zu filmen, spart eine Stunde und verliert das Einzige, was ein kleiner Betrieb gegenüber großen Wettbewerbern sicher hat: den Beweis, dass es die Sache wirklich gibt.

3. Warum längere Szenen scheitern

Videomodelle erzeugen Bildfolgen, die für sich plausibel sind. Über mehrere Sekunden hinweg fehlt ihnen aber ein festes Modell der Szene: Es gibt keinen gespeicherten Zustand darüber, wie viele Schrauben auf dem Tisch lagen oder welche Farbe die Jacke hatte.

Deshalb bleiben kurze Einstellungen ohne Handlung verlässlich und erzählte Szenen nicht. Wer trotzdem eine längere Sequenz braucht, schneidet sie aus mehreren kurzen zusammen – mit dem Risiko sichtbarer Sprünge.

Definition 2.1
Zeitliche Konsistenz
Die Eigenschaft eines erzeugten Videos, Gegenstände, Personen und Beleuchtung über die Zeit gleich zu halten. Sie ist der Hauptunterschied zwischen einer beeindruckenden Vorführung und einem brauchbaren Video.

4. Aufwand realistisch

Tab. 2.1Ein Video von sechzig Sekunden
WegAufwandErgebnis
Selbst filmen, KI für Schnitt und Untertitel60–90 Min.Echt, glaubwürdig, wiederholbar
Vollständig erzeugen3–6 Std.Wechselnde Qualität, rechtlich heikel bei Produktbezug
Agentur1.500–5.000 €Hochwertig, nicht wiederholbar im Wochenrhythmus

5. Häufige Fragen

Muss erzeugtes Video gekennzeichnet werden? Ja, wenn es reale Personen, Orte oder Ereignisse zeigt oder zu zeigen scheint. Die KI-Verordnung verlangt in diesen Fällen eine klare Offenlegung. Lektion 5 behandelt die Einzelheiten.

Wie kurz darf ein Video sein? Fünfzehn Sekunden reichen, wenn etwas zu sehen ist. Kurz und konkret schlägt lang und allgemein.

Lohnt sich ein Abonnement für Videomodelle? Für die meisten Betriebe nicht. Prüfen Sie erst, ob Sie in drei Monaten mehr als fünf Videos veröffentlicht haben – sonst ist das Geld in Schnittwerkzeugen besser angelegt.

6. Übung zum Selbermachen

Filmen Sie mit dem Handy sechzig Sekunden aus Ihrem Betrieb – ein Arbeitsschritt, erklärt in eigenen Worten. Lassen Sie automatisch untertiteln und Pausen kürzen. Stoppen Sie die Gesamtzeit. Die meisten liegen beim ersten Mal unter neunzig Minuten und beim dritten Video unter vierzig.

Quellen und weiterführende Literatur
  1. [1]Verordnung (EU) 2024/1689 (KI-Verordnung), Art. 50 Abs. 4 – Deepfakes.
  2. [2]Stanford HAI (2026): AI Index Report – Video Generation Benchmarks.

Stand: September 2026. Plattformregeln und Reichweitenmechanik ändern sich laufend – prüfen Sie Zahlenangaben an Ihren eigenen Werten.

Fortschritt sichern

Kostenlos registrieren, Lektionen abhaken und 3 Kernideen als Karteikarten wiederholen.