KI-Entwicklung · Modul 1: KI-Grundlagen

Lektion 3 von 6Übung 15 Min.

Neuronale Netze anschaulich erklärt

Lernziele
  • den Aufbau eines künstlichen Neurons mit Gewichten, Bias und Aktivierungsfunktion erklären
  • verstehen, wie aus vielen Neuronen ein tiefes Netz entsteht
  • Backpropagation und Gradientenabstieg in eigenen Worten beschreiben
  • einordnen, was „Parameter“ bei großen Modellen bedeuten

Neuronale Netze sind das Fundament fast aller aktuellen KI-Durchbrüche – von der Bilderkennung bis zu Sprachmodellen. Ihr Grundbaustein ist erstaunlich einfach. Die Leistungsfähigkeit entsteht erst durch die Menge und das Zusammenspiel.

1. Das künstliche Neuron

Definition 3.1
Künstliches Neuron
Eine Recheneinheit, die ihre Eingaben mit Gewichten multipliziert, aufsummiert, einen Bias addiert und das Ergebnis durch eine Aktivierungsfunktion schickt.

Als Formel sieht das so aus: y = f(w₁·x₁ + w₂·x₂ + b). Die Gewichte bestimmen, wie stark eine Eingabe zählt, der Bias verschiebt die Schwelle, und die Aktivierungsfunktion entscheidet, wie stark das Neuron „feuert“. Probieren Sie es aus:

Labor 3.1Ein künstliches Neuron einstellen
1.0x₁w = 1.20.0x₂w = 0.8Σz=0.20f(z)0.55Bias b = -1.0
z = 1.2 · 1.0 + 0.8 · 0.0 + (-1.0) = 0.20Sigmoid(z) = 0.55
Setzen Sie ein Gewicht negativ: Die Eingabe hemmt dann das Neuron. Genau durch das Einstellen solcher Gewichte lernt ein Netz – beim Training werden sie automatisch angepasst.

2. Aktivierungsfunktionen

Ohne Aktivierungsfunktion wäre ein noch so großes Netz nur eine einzige lineare Rechnung. Erst die nichtlineare Aktivierung erlaubt es, komplexe Zusammenhänge abzubilden.

Abb. 3.1Drei gebräuchliche Aktivierungsfunktionen
Abb. 3.1: Drei gebräuchliche Aktivierungsfunktionen. Drei Aktivierungsfunktionen: Sigmoid als S-Kurve zwischen 0 und 1, tanh als S-Kurve zwischen minus 1 und 1, ReLU gleich null für negative Werte und linear steigend für positive.
Abb. 3.1Sigmoid und tanh begrenzen die Ausgabe. ReLU ist rechnerisch besonders einfach und wird in tiefen Netzen häufig verwendet (Darstellung von ReLU horizontal gestaucht).

3. Vom Neuron zum Netz

Neuronen werden in Schichten angeordnet. Die Eingabeschicht nimmt die Daten auf, verdeckte Schichten verarbeiten sie, die Ausgabeschicht liefert das Ergebnis. Von Deep Learning spricht man, wenn viele verdeckte Schichten hintereinanderliegen.

Abb. 3.2Aufbau eines vollständig verbundenen Netzes
Abb. 3.2: Aufbau eines vollständig verbundenen Netzes. Neuronales Netz mit einer Eingabeschicht aus drei Neuronen, zwei verdeckten Schichten mit je fünf Neuronen und einer Ausgabeschicht mit zwei Neuronen. Jedes Neuron ist mit allen Neuronen der nächsten Schicht verbunden.
Abb. 3.2Jede Linie steht für ein Gewicht. Schon dieses kleine Netz hat 3·5 + 5·5 + 5·2 = 50 Gewichte und 12 Bias-Werte, also 62 Parameter.
Tab. 3.1 Größenordnungen von Modellen
ModellJahrParameterEinordnung
Netz aus Abb. 3.262Lehrbeispiel
AlexNet2012ca. 60 Mio.Durchbruch in der Bilderkennung
GPT-32020175 Mrd.großes Sprachmodell

Für viele aktuelle Modelle veröffentlichen Anbieter keine Parameterzahlen mehr.

4. Wie ein Netz lernt

Zu Beginn sind alle Gewichte zufällig. Das Training besteht aus einer Schleife:

  1. Vorwärtsdurchlauf: Ein Beispiel läuft durch das Netz, am Ende steht eine Vorhersage.
  2. Verlust berechnen: Die Vorhersage wird mit der richtigen Antwort verglichen.
  3. Backpropagation: Der Fehler wird rückwärts durch das Netz verteilt. Für jedes Gewicht wird berechnet, wie stark es zum Fehler beigetragen hat – mathematisch über Ableitungen und die Kettenregel.
  4. Gradientenabstieg: Jedes Gewicht wird ein kleines Stück in die Richtung verändert, die den Fehler verringert.

Die Mathematik dahinter – Steigung, Ableitung und Gradient – ist anschaulicher, als sie klingt. Sie finden sie im Modul Mathe für KI.

Übung

  1. Stellen Sie im Labor x₁ = 1, x₂ = 1, w₁ = w₂ = 1 und die Schwellenwert-Funktion ein. Welchen Bias brauchen Sie, damit das Neuron nur feuert, wenn beide Eingaben 1 sind (logisches UND)?
  2. Warum braucht ein Netz nichtlineare Aktivierungsfunktionen?
Lösungshinweise
  1. Ein Bias zwischen −2 und −1, z. B. −1,5: Dann ist z nur bei beiden Eingaben = 1 positiv (1 + 1 − 1,5 = 0,5), bei nur einer Eingabe negativ (1 − 1,5 = −0,5).
  2. Weil hintereinandergeschaltete lineare Rechnungen wieder eine lineare Rechnung ergeben – ohne Nichtlinearität könnte das Netz keine komplexen Muster lernen.
Quellen und weiterführende Literatur
  1. [1]Rosenblatt, F. (1958): The Perceptron – A Probabilistic Model for Information Storage and Organization in the Brain. Psychological Review, 65(6).
  2. [2]Rumelhart, D. E., Hinton, G. E., Williams, R. J. (1986): Learning Representations by Back-Propagating Errors. Nature, 323.
  3. [3]Goodfellow, I., Bengio, Y., Courville, A. (2016): Deep Learning. MIT Press, Kapitel 6.
  4. [4]Brown, T. et al. (2020): Language Models are Few-Shot Learners. NeurIPS.

Stand: September 2026. Kursmaterial der Klarwerk Akademie – Abbildungen sind vereinfachte, schematische Darstellungen.

Kostenlos mitlernen

Lektion abhaken und das Wichtigste nie wieder vergessen.

  • Fortschritt je Kurs speichern
  • 4 Kernideen als Karteikarten
  • Teilnahme dokumentiert