Alle Beiträge

KI & Entwicklung 9 Min. LesezeitAktualisiert am 21. September 2026

Wie KI Bilder erkennt – und mit ihnen lernt

Vom Zahlenraster über Filter und Schichten bis zum Training: Bilderkennung zum Anfassen erklärt – mit fünf interaktiven Grafiken, Einsatzfällen für Unternehmen und den Grenzen, die man kennen muss.

Wie KI Bilder erkennt – und mit ihnen lernt

Ein Mensch sieht ein Foto und weiß sofort: ein Fahrrad, eine Sieben, ein verkratztes Bauteil. Diese Leistung erscheint so selbstverständlich, dass kaum jemand darüber nachdenkt. Für einen Computer ist sie das Gegenteil von selbstverständlich – er bekommt keine Bilder, sondern Zahlen. Wie aus diesen Zahlen wieder Bedeutung wird und wie ein Programm das lernt, ohne dass jemand ihm Regeln beibringt, lässt sich erstaunlich gut nachvollziehen. Dieser Beitrag erklärt es Schritt für Schritt, mit fünf Grafiken zum Ausprobieren.

Ein Bild ist eine Tabelle aus Zahlen

Am Anfang steht eine Umrechnung. Jedes digitale Bild besteht aus Bildpunkten, und jeder Bildpunkt ist eine Zahl: bei Graustufen ein Helligkeitswert, bei Farbbildern drei Werte für Rot, Grün und Blau. Ein Foto einer Handykamera hat davon mehrere Millionen. Das Programm sieht also kein Motiv, sondern eine sehr große Tabelle.

GrundlageFür den Computer ist ein Bild eine Tabelle aus Zahlen
0000000009999990000008900000693000059400004950000097000000000000

Dasselbe in beiden Ansichten. Die Aufgabe der Bilderkennung lautet: aus diesen Zahlen wieder eine Bedeutung machen.

Vereinfacht: 8 × 8 Felder mit Helligkeitswerten von 0 bis 9. Ein echtes Foto hat Millionen Bildpunkte und je drei Farbwerte.

Genau hier liegt die Schwierigkeit. Verschieben Sie die Ziffer um zwei Bildpunkte nach rechts, ändern sich sämtliche Zahlen – für einen Menschen bleibt es dieselbe Sieben. Ändern Sie die Beleuchtung, ändern sich alle Werte gleichzeitig. Ein Ansatz, der Zahlenmuster einfach auswendig lernt, scheitert an dieser Vielfalt. Gebraucht wird etwas, das Formen erkennt, unabhängig davon, wo sie im Bild liegen und wie hell es ist.

Filter: der Trick mit den Kanten

Die Lösung ist ein kleines Rechenverfahren, das über das Bild wandert. Man legt ein Fenster von drei mal drei Bildpunkten über eine Stelle, multipliziert jeden Wert mit einer festen Zahl, addiert alles zusammen und notiert das Ergebnis. Dann rückt das Fenster einen Punkt weiter, und das Ganze beginnt von vorn. Dieses Verfahren heißt Faltung, das Fenster nennt man Filter.

Der Reiz liegt in den Zahlen im Filter. Stehen links positive und rechts negative Werte, misst der Filter den Unterschied zwischen links und rechts – er schlägt genau dort aus, wo eine senkrechte Kante verläuft. Dreht man die Zahlen um 90 Grad, findet derselbe Filter waagerechte Kanten. Probieren Sie es aus: Verschieben Sie das Fenster über die Ziffer und wechseln Sie den Filter.

LaborWie ein Filter Kanten findet

Bild · Fenster verschieben

Filter

10-120-210-1

= 25.0

starker Ausschlag: hier ist eine Kante

Ergebnis über das ganze Bild

Dieser Filter vergleicht links und rechts. Wo links dunkel und rechts hell ist (oder umgekehrt), schlägt er aus – er findet senkrechte Kanten.

Ein Faltungsnetz lernt solche Filter selbst – niemand programmiert sie von Hand. Gezeigt ist das Rechenprinzip an einem 3 × 3-Filter.

Das Entscheidende daran: Derselbe Filter wird auf jede Stelle des Bildes angewendet. Eine Kante wird damit erkannt, egal ob sie oben links oder unten rechts liegt. Damit ist das Problem der Verschiebung gelöst, das einfache Verfahren zum Scheitern bringt. Und noch etwas ist wichtig – bei modernen Verfahren gibt niemand die Zahlen in den Filtern vor. Das Programm findet sie selbst, beim Training.

Schichten: vom Strich zur Bedeutung

Ein einzelner Filter findet Kanten, mehr nicht. Von einer Kante zu einem Fahrrad ist es ein weiter Weg. Deshalb werden viele Filter hintereinandergeschaltet, in Schichten. Die erste Schicht arbeitet auf dem Bild und findet Kanten. Die zweite Schicht arbeitet nicht mehr auf dem Bild, sondern auf dem Ergebnis der ersten – sie sieht also Kantenmuster und kann daraus Ecken, Bögen und Kreuzungen bilden. Die dritte Schicht kombiniert diese zu Bestandteilen, die vierte zu ganzen Gegenständen.

AufbauVom Strich zur Bedeutung – Schicht für Schicht

Die erste Schicht findet nur Helligkeitswechsel: senkrechte, waagerechte und schräge Kanten. Mehr nicht – aber überall im Bild.

Schicht 1 von 4
Vereinfachte Darstellung. Echte Netze haben Dutzende Schichten; die Zwischenstufen lassen sich sichtbar machen, sind aber selten so eindeutig benannt.

Diese Staffelung ist der Kern dessen, was man Faltungsnetz nennt – im Englischen Convolutional Neural Network, abgekürzt CNN. Sie erklärt auch, warum solche Netze so gut funktionieren: Sie bauen Bedeutung von unten auf, statt sie in einem Schritt zu erraten. Und sie erklärt, warum die Zwischenergebnisse sich betrachten lassen. Wer die erste Schicht eines trainierten Netzes sichtbar macht, sieht tatsächlich Kantenmuster – ganz ähnlich denen, die Forscher bei der Untersuchung des Sehsystems im Gehirn gefunden haben.

Wie das Netz lernt: raten, Fehler messen, nachjustieren

Am Anfang kann ein Netz gar nichts. Alle Filterwerte sind zufällig, die Vorhersagen entsprechend beliebig. Das Training läuft dann in einer Schleife, die sich in drei Worten zusammenfassen lässt: raten, vergleichen, anpassen.

Das Netz bekommt ein Bild und gibt eine Einschätzung ab – etwa „mit 31 Prozent eine Eins“. Daneben steht die richtige Antwort, die ein Mensch vorher vergeben hat. Aus dem Abstand zwischen Vorhersage und Wahrheit wird eine einzelne Zahl berechnet: der Fehler. Anschließend wird jeder Filterwert im Netz ein winziges Stück in die Richtung verschoben, die diesen Fehler kleiner macht. Dann kommt das nächste Bild. Und das nächste. Tausende Male.

SimulatorSo lernt ein Netz: raten, Fehler messen, nachjustieren

Beispiel 1

Vorhersage:Eins34 %

richtig wäre: Sieben

Fehler96
Am Anfang rät das Netz – die Gewichte sind zufällig.
Schematisch: Ein echtes Training läuft über Tausende Beispiele und viele Durchgänge. Der Ablauf – vorhersagen, vergleichen, anpassen – ist derselbe.

Bemerkenswert ist, dass niemand dem Netz sagt, worauf es achten soll. Es bekommt nur Bilder mit richtigen Antworten und die Rückmeldung, wie weit es danebenlag. Dass die erste Schicht am Ende Kanten findet und die dritte Räder, ist kein Plan, sondern ein Ergebnis: Es ist schlicht der wirksamste Weg, den Fehler zu senken. Genau deshalb heißt das Verfahren „Lernen“ und nicht „Programmieren“.

Ein Punkt verdient Aufmerksamkeit, weil er in der Praxis über Erfolg und Misserfolg entscheidet. Ein Netz kann die Trainingsbilder auswendig lernen, statt allgemeine Muster zu finden. Auf den bekannten Bildern liegt es dann bei nahezu hundert Prozent, auf neuen versagt es. Deshalb wird ein Teil der Bilder zurückgehalten und erst am Ende verwendet – als Prüfung mit Material, das das Netz nie gesehen hat. Nur diese Zahl zählt.

Woher die Bilder kommen

Ein Netz für eine anspruchsvolle Aufgabe braucht sehr viele Beispiele – historisch waren Sammlungen mit über einer Million beschrifteter Bilder der Auslöser für den Durchbruch dieser Technik. Für ein Unternehmen klingt das entmutigend, ist es aber nicht. In der Praxis wird selten bei null begonnen. Stattdessen nimmt man ein Netz, das bereits an Millionen allgemeiner Bilder gelernt hat, und trainiert nur die letzten Schichten mit eigenen Beispielen nach. Die unteren Schichten können bereits Kanten und Formen – das muss niemand zweimal lernen.

Dieses Vorgehen senkt den Bedarf erheblich: Für eine klar umrissene Aufgabe genügen oft einige hundert bis wenige tausend eigene Bilder. Entscheidend ist dabei weniger die Menge als die Ähnlichkeit zur späteren Wirklichkeit. Bilder, die unter denselben Bedingungen entstanden sind wie die späteren – gleiche Kamera, gleiches Licht, gleicher Abstand, auch mit Schmutz und Unschärfe –, sind mehr wert als doppelt so viele Bilder aus der Studiofotografie.

Wo Unternehmen Bilderkennung einsetzen

Die sichtbarsten Anwendungen sind nicht die interessantesten. Für kleine und mittlere Unternehmen sind vier Felder in der Praxis relevant.

Dokumente und Belege lesen. Der mit Abstand häufigste Fall: Rechnungen, Lieferscheine und Bestellungen als PDF oder Foto, aus denen Betrag, Datum und Lieferant gewonnen werden. Hier verbindet sich Bilderkennung mit Sprachverarbeitung, und der Nutzen ist unmittelbar messbar, weil die Arbeit heute von Hand erledigt wird.

Qualitätsprüfung. In der Fertigung erkennen Kameras Kratzer, fehlende Teile oder falsche Montage. Der Einstieg ist anspruchsvoller, weil Beleuchtung und Aufnahmeposition stimmen müssen – dafür ist der Nutzen hoch, wenn der Ausschuss sinkt.

Sortieren und Zuordnen. Fotos einer Baustelle dem richtigen Projekt zuordnen, Produktbilder nach Kategorien ordnen, Schadensfotos einer Versicherungsmeldung anhängen. Unspektakulär, aber es spart in Summe viel Zeit.

Zugänglichkeit. Alternativtexte für Bilder vorschlagen, damit Websites für Menschen mit Sehbehinderung nutzbar sind. Die Vorschläge werden geprüft, nicht blind übernommen – dann ist es eine der lohnendsten Anwendungen überhaupt, weil sie eine Aufgabe erledigt, die sonst regelmäßig liegen bleibt.

Was schiefgehen kann

Bilderkennung wirkt oft zuverlässiger, als sie ist. Die Ausgabe ist eine Prozentzahl, und Prozentzahlen wirken wie Wissen. Tatsächlich handelt es sich um eine Einschätzung auf Basis dessen, was im Training vorkam – und die kann gründlich danebenliegen.

GrenzenSechs Gründe, warum Bilderkennung danebenliegt

Ein Modell, das Hautveränderungen nur an heller Haut gelernt hat, erkennt sie an dunkler Haut schlechter. Solche Lücken fallen erst im Einsatz auf – deshalb gehört die Frage „woher stammen die Beispiele?“ an den Anfang jedes Projekts.

Alle sechs Fälle sind dokumentiert und keine Randerscheinungen – sie gehören in jede Planung eines Projekts mit Bilderkennung.

Daraus folgen drei praktische Regeln. Erstens: Prüfen Sie, woher die Trainingsbilder stammen und ob sie zu Ihrer Wirklichkeit passen. Zweitens: Bauen Sie eine Schwelle ein – unsichere Fälle gehen an einen Menschen, statt automatisch entschieden zu werden. Drittens: Messen Sie die Qualität an Ihren eigenen Bildern, nicht an den Angaben des Anbieters. Dreißig echte Bilder aus dem eigenen Betrieb sagen mehr als jedes Datenblatt.

Rechtliches in Kürze

Zwei Punkte sind für Unternehmen wichtig. Zeigt ein Bild Personen, gelten die Regeln der Datenschutz-Grundverordnung – es braucht eine Rechtsgrundlage, und bei einer Übertragung an einen Dienstleister einen Vertrag zur Auftragsverarbeitung. Besonders streng ist die biometrische Erkennung, also das Wiedererkennen bestimmter Personen: Sie fällt unter die besonders geschützten Daten und ist in der KI-Verordnung für mehrere Einsatzzwecke verboten oder stark eingeschränkt. Für die genannten betrieblichen Anwendungen – Belege lesen, Bauteile prüfen, Fotos sortieren – ist das in der Regel unproblematisch, solange keine Personen identifiziert werden.

Häufige Fragen

Braucht man für Bilderkennung Millionen Bilder?

Nein, wenn man auf einem vortrainierten Netz aufsetzt. Für eine klar umrissene Aufgabe genügen oft einige hundert bis wenige tausend eigene Bilder. Wichtiger als die Menge ist, dass sie den späteren Aufnahmebedingungen entsprechen.

Was ist der Unterschied zwischen Bilderkennung und Texterkennung?

Texterkennung wandelt Schrift in Zeichen um, ohne die Bedeutung zu verstehen. Bilderkennung ordnet ein Bild einer Bedeutung zu. In der Praxis werden beide kombiniert: Erst wird der Text gelesen, dann eingeordnet, welche Zahl der Rechnungsbetrag ist.

Kann man nachvollziehen, warum ein Modell so entschieden hat?

Teilweise. Es gibt Verfahren, die farbig markieren, welche Bildbereiche eine Entscheidung am stärksten beeinflusst haben. Das hilft, grobe Fehler zu erkennen – etwa wenn ein Modell auf den Hintergrund statt auf das Objekt achtet. Eine vollständige Begründung liefert es nicht.

Läuft das in der Cloud oder auf eigener Hardware?

Beides ist möglich. Kleine Modelle laufen auf einem normalen Rechner oder sogar auf einem Gerät in der Fertigung, ohne dass Bilder das Haus verlassen. Große Modelle laufen bei Anbietern – dann sind Datenschutz und Vertragslage zu klären.

Wie fängt man in einem Unternehmen damit an?

Mit einer Aufgabe, die heute von Hand erledigt wird und oft vorkommt. Sammeln Sie dreißig typische Bilder, probieren Sie ein bestehendes Modell daran aus und vergleichen Sie das Ergebnis mit Ihrer eigenen Einschätzung. Diese eine Stunde sagt mehr über die Machbarkeit als jede Beratung.

Bereit, den nächsten Ablauf zu digitalisieren?

Buchen Sie ein kostenloses Erstgespräch. Gemeinsam finden wir heraus, was sich bei Ihnen lohnt – Website, Konfigurator, KI-Lösung oder Schulung.

Erstgespräch buchen

Antwort in der Regel innerhalb weniger Stunden