KI & Automatisierung · Grundlagen
Vom Neuron zum Sprachmodell: Wie KI rechnet – erklärt an einer Schraubenfeder
Wie KI rechnet – erklärt an einer Schraubenfeder. Vier Teile, ein Bauteil, Schulmathematik. Mit Animationen zum Selbstausprobieren.
Einleitung
Warum eine Feder?
Jeder redet über KI. Die wenigsten können sagen, was dabei eigentlich gerechnet wird. Dieser Beitrag schließt die Lücke – nicht mit Metaphern, sondern mit der Mathematik selbst. Die ist überraschend klein.
Hinter jedem Sprachmodell steckt eine Rechenzelle, die Sie aus der achten Klasse kennen: die Geradengleichung. Milliardenfach kopiert, mit einem Trick dazwischen und einem Verfahren, das die Zahlen aus Beispielen bestimmt – mehr ist es nicht. Wer diese drei Dinge versteht, versteht auch, was ein Sprachmodell kann und warum man ihm nie ungeprüft glauben sollte. Wir finden: Man sollte Technik verstehen, bevor man ihr Entscheidungen überlässt.
Wir erklären das an einer Schraubenfeder. Sie ist das einfachste lineare Bauteil, das man in die Hand nehmen kann, jeder Techniker kennt ihre Kennlinie, und sie reicht – mit einem kleinen Kniff – bis zum neuronalen Netz. Das Bild ist dabei keine bloße Analogie: Ein Federpaket aus mehreren Federn mit gestaffeltem Spiel ist rechnerisch ein neuronales Netz. Beim Sprachmodell in Teil 4 wird das Bild etwas großzügiger – das Prinzip trägt bis zum Schluss.
So lesen Sie diesen Beitrag
Vier Teile, aufeinander aufbauend. Teil 1 und 4 tragen auch allein; Teil 3 ist der technischste und lässt sich überspringen. Die Zahlen sind echt – alle Kurven werden in Ihrem Browser so berechnet, wie beschrieben.
Wo ein Rechenschritt besser erlebt als gelesen wird, steht eine Animation direkt im Text: Regler schieben, Lernschritte auslösen, zusehen.
Teil 1
Ein Neuron an einer Feder
Was rechnet ein künstliches Neuron? Weniger, als man denkt – eine Geradengleichung. Wir hängen es an eine Schraubenfeder und sehen zu, wie es die Formel findet.
Erinnern Sie sich noch an m · x + b?
Achte Klasse, lineare Funktionen: Wertetabelle anlegen, Punkte ins Koordinatensystem eintragen, Lineal anlegen, Steigung m und Achsenabschnitt b ablesen.
y = m · x + b
Wer das konnte, kennt bereits das künstliche Neuron. Es rechnet genau das, nur heißen die Buchstaben anders: Die Steigung nennt man Gewicht w, den Achsenabschnitt Bias b.
y = w · x + b
Das ist kein vereinfachtes Bild, das ist die ganze Rechenvorschrift. w und b sind die einzigen Stellen, an denen ein Neuron etwas „weiß". Der Unterschied zur Schule liegt nicht in der Formel, sondern darin, wer das Lineal anlegt.
Die Feder
Eine Schraubenfeder ist das einfachste lineare Bauteil, das man in die Hand nehmen kann. Drückt man sie um einen Weg x zusammen, drückt sie mit einer Kraft F zurück, die proportional zum Weg wächst – das Hookesche Gesetz. Die Konstante ist die Federrate k. Eingebaut ist eine Feder meist leicht vorgespannt: Bei Weg null wirkt schon eine kleine Kraft F0.
F = k · x + F0
Jetzt passt alles aufeinander. Das Neuron hat y = w·x + b, die Feder F = k·x + F0. Wenn das Neuron die Feder richtig beschreibt, muss w die Federrate sein und b die Vorspannung. Die Frage ist, ob es die beiden Werte findet – nur aus der Wertetabelle.
Das Neuron findet die Federrate
| x (mm) | F (N) |
|---|---|
| 2 | 9,3 |
| 4 | 13,2 |
| 6 | 17,8 |
| 8 | 21,9 |
| 10 | 26,2 |
| 12 | 30,0 |
| 14 | 34,6 |
| 16 | 38,5 |
Acht Wege, acht abgelesene Kräfte. Das Neuron startet mit zufälligen Werten für w und b – seine Gerade liegt irgendwo. Dann vergleicht es für jede Zeile seine Ausgabe mit der gemessenen Kraft. Die Abweichungen sind der Fehler. Und es dreht w und b ein kleines Stück in die Richtung, in der der Fehler kleiner wird. Das ist ein Lernschritt.
Nach etwa zwanzig Schritten liegt die Gerade auf den Punkten. Das Neuron meldet rund 2,1 N/mm und eine Vorspannung von rund 5 N – die Werte aus dem Datenblatt dieser Feder. Niemand hat sie eingetragen; sie sind aus acht Messungen entstanden.
Interaktiv · Neuron mit einem Eingang
| x (mm) | F (N) | Neuron |
|---|
Gestrichelt: die Abweichung je Messpunkt. Fehler = Mittel der quadrierten Abweichungen.
Zwei Eingänge: die Temperatur kommt dazu
Stahl wird mit steigender Temperatur etwas weicher; eine warme Feder drückt bei gleichem Weg schwächer zurück. Wer die Messreihe bei 20, 50 und 80 °C wiederholt, bekommt drei leicht verschobene Geraden – ein einzelnes w reicht nicht mehr. Ein Neuron mit zwei Eingängen löst das. Jeder Eingang bekommt ein eigenes Gewicht, die Summe bleibt:
F = w1 · x + w2 · T + b
Das Neuron findet drei Zahlen: Federrate, Temperatureinfluss und Vorspannung. w2 wird negativ – „wärmer heißt weniger Kraft" – ohne dass jemand Werkstoffkunde eingegeben hätte. So skaliert es weiter: Zehn Eingänge, zehn Gewichte, ein Bias. Die Formel bleibt eine Summe.
Interaktiv · Neuron mit zwei Eingängen
| x (mm) | T (°C) | F (N) | Neuron |
|---|
Drei Farben, drei Temperaturen. Das Neuron erzeugt für jede Temperatur eine eigene Gerade – aus einem Satz Gewichte.
Was ein Neuron nicht kann
Alles, was ein Neuron ausgibt, ist eine gewichtete Summe seiner Eingänge – eine Gerade, eine Ebene, in mehr Dimensionen eine „Hyperebene". Krumm wird es nie. Sobald die Feder über ihren linearen Bereich hinaus gestaucht wird und die Kraft steil ansteigt, passt keine Wahl von w und b mehr. Dafür braucht es viele Neuronen – und einen kleinen Trick.
Mitnehmen
Mitnehmen aus Teil 1
- Ein Neuron rechnet
y = w·x + b– die Geradengleichung aus der Schule, mit einem Gewicht je Eingang. - Gewichte und Bias sind das ganze „Wissen". Sie entstehen aus Messwerten, indem der Fehler schrittweise verkleinert wird.
- Ein Neuron allein bleibt linear. Für alles Krumme braucht es ein Netz.
Teil 2
Viele Neuronen – das Netz
Ein Neuron kann nur Geraden. Unsere Feder kann mehr: Drückt man sie zu weit, steigt die Kraft steil an. Wie aus geraden Neuronen eine Kurve wird – mit einem Trick, der kleiner ist, als er klingt.
Die Feder geht auf Block
Ab etwa 12 mm legen sich die ersten Windungen aufeinander – die Feder „geht auf Block" – und die Kraft steigt steil an. Die Messreihe bis 20 mm und die beste Gerade, die ein einzelnes Neuron finden kann:
Messreihe · Feder bis zum Block
| x (mm) | F (N) |
|---|
Teal: die beste Gerade, die ein einzelnes Neuron finden kann. Die Abweichungen unten links und oben rechts bekommt es nicht weg.
Egal wie lange das Neuron lernt, der Fehler bleibt groß, weil eine Gerade durch diese Punkte nicht passt. Mehr Eingänge helfen nicht – wir haben nur den Weg. Es braucht etwas anderes.
Eine zweite Feder mit Spiel
Wie baut ein Konstrukteur eine Feder, die ab 12 mm steiler wird? Er legt eine zweite, kürzere Feder daneben. Die hat Spiel: Bis 12 mm berührt die Platte sie nicht, sie trägt nichts bei. Ab 12 mm liegt sie an und drückt mit ihrer eigenen Federrate zusätzlich mit. Die Gesamtkraft ist die Summe beider Federn – und die Kennlinie bekommt genau dort einen Knick.
Genau das ist der Trick im Neuron. Ein Neuron aus Teil 1 ist Feder 1: Es trägt über den ganzen Bereich bei. Ein Neuron mit Knick ist Feder 2: Bis zu einer Stelle trägt es nichts bei, ab dort steigt es mit seiner eigenen Steigung.
y = max(0, w · x + b)
Das max(0, …) heißt nur: „vorher null". Wo der Knick liegt – wie viel Spiel die Feder hat –, bestimmt b. Wie steil es danach weitergeht, bestimmt w. In der Fachsprache ist das die Aktivierungsfunktion, diese hier heißt ReLU.
Interaktiv · Ein Neuron mit Knick = eine Feder mit Spiel
Der orange Punkt ist der Knick: Dort liegt die Feder an. Vorher null Beitrag – das ist das ganze max(0, …).
Jetzt die Idee, die alles trägt: Man nimmt mehrere solcher Federn mit unterschiedlichem Spiel und addiert ihre Kräfte. Feder 1 trägt immer, Feder 2 ab 12 mm, Feder 3 ab 16 mm. Die Kennlinie bekommt einen Knick nach dem anderen – und aus Geradenstücken wird eine Kurve.
Schichten
Damit ist das Netz fertig. Die Eingabeschicht reicht den Weg x weiter. Die verdeckte Schicht besteht aus mehreren Knick-Neuronen – unsere Federn mit Spiel –, die alle dasselbe x sehen, aber eigenes w und b haben. Das Ausgabeneuron ist eines aus Teil 1 ohne Knick: Es gewichtet die Ausgaben der verdeckten Neuronen und summiert sie zur Kraft.
Mehr ist ein neuronales Netz nicht: Summen von Federn mit Spiel, deren Spiel und Federraten gelernt werden. Das Lernen läuft wie in Teil 1 – nur dass es jetzt dreizehn Gewichte gleichzeitig betrifft statt zwei.
Mit einer Feder bleibt der Fehler hoch. Mit zwei legt sich ein Knick ungefähr dorthin, wo die Feder auf Block geht, und der Fehler fällt auf einen Bruchteil. Mit acht schmiegt sich die Kurve an jeden Punkt. Das Netz hat nicht „verstanden", dass Windungen aufeinanderliegen. Es hat das Spiel seiner Federn dorthin geschoben, wo die Daten es brauchen. Die Zahl „Fehler" ist dabei einfach ein Maß dafür, wie weit die Kurve im Schnitt von den Messpunkten entfernt ist.
Interaktiv · Das Netz lernt die Federkennlinie
Neuronen in der verdeckten Schicht:
Kleine Striche auf der Achse: das Spiel jeder Feder, also die Knickstellen. Sehen Sie, wohin sie beim Training wandern.
Schicht auf Schicht
Was mit einer verdeckten Schicht geht, geht mit mehreren: Die Ausgaben der Knick-Neuronen werden zu Eingängen einer zweiten Schicht, und so weiter. Bei der Feder bringt das nichts mehr. Interessant wird es bei vielen Eingängen: Ein Netz, das Bilder liest, bekommt tausende Pixelwerte. Die ersten Schichten lernen „hier ist eine Kante", die nächsten „hier treffen sich zwei Kanten", die übernächsten „das ist ein Schraubenkopf". Niemand hat diese Zwischenbegriffe vorgegeben. Sie entstehen, weil sie den Fehler verkleinern.
Mitnehmen
Mitnehmen aus Teil 2
- Der Trick ist
max(0, …): ein Neuron, das wie eine Feder mit Spiel erst ab einer Stelle beiträgt. - Ein Netz addiert viele solcher Federn. Mehr Neuronen, mehr Knicke, feinere Kurve.
- Mehrere Schichten übereinander lernen Zwischenbegriffe – aus Kanten werden Formen, aus Formen Objekte.
Teil 3
Lernen – Fehler zurückrechnen
Zweimal haben wir gesagt: „Das Netz dreht jedes Gewicht ein Stück in die bessere Richtung." Nie, woher es die Richtung kennt. Das holen wir jetzt nach.
Hinweis. Dieser Teil ist der technischste des Beitrags. Es bleibt bei Schulmathematik, aber es wird dichter. Wer nur wissen will, was herauskommt, liest „Wo Lernen schiefgeht" und geht dann zu Teil 4.
Der Berg im Nebel
Nehmen wir das Neuron aus Teil 1 und halten alles fest bis auf die Federrate w. Für jeden Wert von w können wir den Fehler ausrechnen. Trägt man das auf, ergibt sich eine Mulde: links zu flach, rechts zu steil, in der Mitte passt es.
Das Netz sieht diese Mulde nicht. Es steht irgendwo darauf, im Nebel, und kennt nur den Fehler an seiner eigenen Stelle. Was es ausrechnen kann: Wird der Fehler kleiner oder größer, wenn ich w ein winziges Stück erhöhe? Das ist die Steigung des Hangs unter den Füßen. Bergab heißt erhöhen, bergauf verringern. Wie weit pro Schritt, bestimmt die Lernrate.
Die Lernrate ist die erste echte Stellschraube beim Training. Zu klein: Das Netz kriecht. Zu groß: Es springt über das Tal und der Fehler steigt statt zu fallen. In der Praxis fängt man groß an und wird kleiner, je näher man dem Tal kommt.
Interaktiv · Schrittweise in die Mulde
Probieren Sie eine Lernrate über 1: Der Punkt springt über die Mulde hinaus und wird mit jedem Schritt schlechter.
Die Landschaft
Mit w und b zusammen wird aus der Mulde eine Schüssel. Das Netz rechnet für jedes Gewicht einzeln aus, ob es bergauf oder bergab geht; beide zusammen ergeben eine Richtung – die steilste nach unten. Bei dreizehn Gewichten ist es eine Landschaft in dreizehn Dimensionen, bei einem Sprachmodell in Milliarden. Zeichnen kann das niemand. Rechnen geht genauso: für jedes Gewicht „bergauf oder bergab?", dann ein Schritt in die gemeinsame Richtung. Das Verfahren heißt Gradientenabstieg.
Interaktiv · Fehlerlandschaft über w und b
Dunkel: kleiner Fehler. Die Spur zeigt, dass jeder Schritt senkrecht zu den Höhenlinien geht – immer den steilsten Weg nach unten.
Schuld verteilen
Bleibt die eigentliche Frage: Im Netz entsteht der Fehler am Ausgang, aber die Gewichte sitzen in den Schichten davor. Wie viel vom Fehler geht auf welches Gewicht zurück?
Nehmen wir das Federpaket mit zwei Federn. Eine Messung bei 8 mm: Die Kraft ist zu hoch. Wer ist schuld? Feder 1 liegt an, ihre Federrate war zu groß – sie bekommt einen Anteil. Feder 2 hat 12 mm Spiel, bei 8 mm berührt sie die Platte nicht. Sie war am Ergebnis nicht beteiligt, also bekommt sie keine Schuld – ihre Gewichte bleiben. Bei 16 mm liegen beide an, beide werden korrigiert, im Verhältnis ihres Beitrags.
Das ist Backpropagation in einem Satz: Der Fehler wird vom Ausgang her rückwärts durch die Schichten verteilt, und jedes Gewicht bekommt so viel Schuld, wie es zum Ergebnis beigetragen hat. Danach macht jedes Gewicht seinen Schritt bergab – mit seiner eigenen Schuld als Steigung.
Animation · Der Fehler läuft rückwärts
Orange leuchtet, was Schuld bekommt. Eine Feder, die nicht anliegt, ist abgeblendet – sie lernt aus dieser Messung nichts.
Wo Lernen schiefgeht
Das Verfahren hat eine Eigenschaft, die man nie vergessen darf: Es verkleinert den Fehler auf den Messpunkten, die es gesehen hat. Nicht mehr.
Interaktiv · Dasselbe Netz, andere Messreihe
Weiß: Messpunkte, die das Netz gesehen hat. Grau gestrichelt: die wahre Kennlinie. Teal: was das Netz gelernt hat.
Nur bis 12 mm gemessen. Auf den Messpunkten ist der Fehler nahe null, das Netz ist „fertig". Vom Block weiß es nichts und verlängert jenseits von 12 mm die Gerade. Ein Netz kann nichts wissen, was nicht in seinen Daten steckt – banal, und die häufigste Fehlerquelle in der Praxis.
Verrauschte Messung. Acht Federn sind beweglich genug, um auch den Messfehlern hinterherzulaufen. Der Fehler auf den Messpunkten wird klein – die Kurve ist trotzdem falsch, weil sie Zufall mitgelernt hat. Das nennt man Überanpassung.
Beide Fälle haben dieselbe Lehre: Der Fehler auf den Trainingsdaten sagt nichts darüber, ob das Netz auf neuen Daten richtig liegt. Das prüft man nur mit Messpunkten, die das Netz beim Lernen nie gesehen hat.
Mitnehmen
Mitnehmen aus Teil 3
- Für jedes Gewicht fragt das Netz: Wird der Fehler kleiner, wenn ich es erhöhe? Dann ein Schritt bergab – die Lernrate bestimmt, wie weit.
- Backpropagation verteilt den Fehler vom Ausgang rückwärts. Wer nicht beteiligt war, bekommt keine Schuld.
- Der Fehler sinkt nur auf den gesehenen Daten. Ob das Netz etwas kann, zeigt nur ein Testsatz, den es nie gesehen hat.
Teil 4
Das Sprachmodell
Ein Federpaket mit Milliarden Federn, das nichts anderes tut, als das nächste Wortstück zu raten. Wie aus Wörtern Zahlen werden – und warum ein Modell so überzeugend danebenliegen kann.
Vom Federweg zum Wort
Drei Teile lang hatten wir eine Zahl am Eingang und eine am Ausgang. Ein Sprachmodell ist dasselbe Netz mit zwei Änderungen: Am Eingang stehen viele Zahlen, die einen Text beschreiben. Am Ausgang stehen viele Zahlen, eine für jedes mögliche nächste Wortstück. Dazwischen: Schichten aus Knick-Neuronen, gelernt mit Schuldverteilung.
Wie wird ein Wort zur Zahl? Der Text wird in Token zerlegt – Wörter oder Wortteile, ein Vorrat von rund hunderttausend – und jedes Token bekommt eine Nummer. Hinter jeder Nummer steht eine Liste von einigen tausend Zahlen, die das Modell beim Training selbst gelernt hat. Tokens mit ähnlicher Bedeutung bekommen ähnliche Listen: „Bestellung" liegt nahe bei „Auftrag", weit weg von „Montag". Diese Listen sind der Federweg des Sprachmodells – mit einigen tausend Dimensionen.
Das nächste Wortstück als Messwert
In Teil 3 war der Messwert die gemessene Kraft. Beim Sprachmodell ist er das Token, das in einem echten Text tatsächlich als nächstes kam. Das Modell gibt für alle Kandidaten eine Wahrscheinlichkeit aus; der Fehler ist, wie wenig davon auf das richtige Token entfiel. Dann Schuldverteilung, ein Schritt bergab, nächster Text. Über Billionen Token.
Was in den verdeckten Schichten entsteht, hat niemand vorgegeben – wie die Knickstellen an der Blockgrenze. Nur dass es jetzt Grammatik ist, Fachvokabular, und wie eine Auftragsbestätigung aufgebaut ist. Das Modell hat Sprache nicht gelernt, weil jemand das wollte. Es hat sie gelernt, weil es ohne sie schlechter rät.
Interaktiv · Token für Token
Wahrscheinlichkeiten illustrativ. Das Modell wählt, hängt an und rechnet von vorn – mit dem neuen Token als Teil des Eingangs.
Aufmerksamkeit
Welches der bisherigen Token für das nächste wichtig ist, hängt vom Satz ab. In „Die Bestellung vom 3. Mai wurde …" entscheidet „Bestellung" über das nächste Wort, nicht „Mai". Die Lösung heißt Attention. Im Federbild: ein Federpaket, das seine Federraten für jeden Satz neu einstellt – je nachdem, welche Wörter darin stehen. Hier zieht die Feder zu „Bestellung" kräftig, die zu „Mai" kaum. Ganz so einfach ist es nicht, aber das Prinzip stimmt: Das Modell entscheidet bei jedem Satz neu, worauf es hört. Das T in GPT steht für Transformer: viele Schichten aus Aufmerksamkeit und Knick-Neuronen im Wechsel.
Interaktiv · Worauf das Modell hört
Tippen Sie ein Wort an, um zu sehen, welche Vorgänger für es gewichtet werden:
Gewichte illustrativ. In einem echten Modell gibt es Dutzende solcher Gewichtungen pro Schicht, jede auf etwas anderes trainiert – Satzbau, Bezüge, Zahlen.
Wie viele Federn?
Vergleich · Gewichte, logarithmisch
Jeder Schritt nach rechts ist das Zehnfache. Ein Modell für den eigenen Serverraum liegt zehn Größenordnungen über dem Neuron aus Teil 1.
Und trotzdem gilt: Jedes dieser 24 Milliarden Gewichte ist auf dieselbe Weise entstanden wie die Federraten in Teil 1 – Fehler messen, Schuld verteilen, ein Schritt bergab. Ein Modell dieser Größe passt als Datei von einigen Dutzend Gigabyte auf eine Festplatte, und ein Gerät in Buchgröße rechnet es durch. Die Gewichte sind eine Datei, die man besitzt.
Warum es überzeugend danebenliegt
Erinnern Sie sich an das Netz aus Teil 3, das nur bis 12 mm gemessen hatte. Fragen Sie es nach der Kraft bei 18 mm, antwortet es sofort und ohne Zögern – mit einer Zahl, die es nie gemessen hat. „Weiß ich nicht" ist als Ausgabe gar nicht vorgesehen. Ein Sprachmodell ist genauso gebaut. Gefragt nach einer Bestellnummer, die nicht im Text steht, gibt es die aus, die am wahrscheinlichsten aussieht: richtige Länge, richtiges Format, plausible Ziffern. Ob sie stimmt, war nie Teil der Aufgabe. Das ist kein Defekt, es ist die Aufgabe „nächstes Token raten", korrekt ausgeführt.
Daraus folgt alles, was man beim Einsatz tun muss: Jede Zahl, die ein Modell liefert, wird im Originaldokument gesucht, bevor sie ein Folgesystem erreicht. Formate und Wertebereiche werden mit Regeln geprüft, nicht mit dem Modell. Und die Qualität wird an einem Testsatz gemessen, den das Modell nie gesehen hat.
Der Feinschliff für genau eine Aufgabe
Zurück zum Federpaket. In Teil 2 haben acht Federn gelernt, wo unsere Feder auf Block geht – Hunderte Schritte, weil alles zufällig gewürfelt anfing. Jetzt kommt eine zweite Feder aus derselben Baureihe: etwas andere Vorspannung, Block einen Millimeter später. Muss das Netz von vorn anfangen?
Nein. Die Federn sind schon richtig gestaffelt, die Knicke liegen fast da, wo sie hingehören. Ein paar Federraten um ein paar Zehntel nachstellen, ein Spiel um einen Millimeter – nach einer Handvoll Schritten passt die Kurve. Das ist Nachtrainieren, und es funktioniert aus dem Grund, den die ersten drei Teile gezeigt haben: Lernen verschiebt Gewichte schrittweise, und wer nah am Ziel startet, braucht wenige Schritte.
Genau so beim Sprachmodell. Ein Modell mit 24 Milliarden Gewichten ist ein Federpaket, das jemand anderes mit Billionen Token gestaffelt hat – Sprache im Allgemeinen sitzt. Nachtrainieren auf die eigenen Belege heißt: ein paar tausend Beispiele, wenige Durchläufe, die Gewichte werden nur ein kleines Stück nachgestellt. Grammatik bleibt, Fachvokabular bleibt; was sich ändert, ist die Kennlinie für genau eine Aufgabe.
In der Praxis zeigt sich, was ohne dieses Bild schwer zu glauben ist: Ein nachgestelltes Modell mittlerer Größe liegt auf dieser einen Kennlinie oft genauer als ein Modell mit der vierzigfachen Zahl an Federn, das sie nur nebenbei kennt. Die Aufgabe „Positionen aus einem Beleg ziehen" hat wenige Knicke. Dafür braucht es nicht das Paket, das jede denkbare Kennlinie abdecken kann. Es braucht die Federn, die in diesem Bereich arbeiten – sauber nachgestellt, mit einer Abnahmemessung auf Belegen, die das Modell nie gesehen hat.
Interaktiv · Neue Feder, altes Netz
Grau gestrichelt: die alte Feder aus Teil 2. Weiß: Messpunkte der neuen Feder. Beachten Sie, wie wenig die Knickstriche wandern, wenn das Netz nur nachgestellt wird.
Mitnehmen
Mitnehmen aus Teil 4
- Ein Sprachmodell ist das Netz aus Teil 2 mit Milliarden Gewichten und der Aufgabe, das nächste Wortstück zu raten.
- Alles, was wie Wissen aussieht – und jeder überzeugende Fehler –, folgt aus dieser Aufgabe.
- Nachtrainieren stellt ein fertiges Federpaket auf eine Aufgabe nach. Deshalb reicht oft ein mittleres Modell, wenn die Aufgabe eng umrissen ist.
Zum Schluss
Was daraus folgt
Vier Teile, ein Bauteil. Wer bis hier gelesen hat, kann jetzt drei Dinge, die in den meisten KI-Gesprächen fehlen.
Sie können nachfragen. Wenn jemand sagt, sein Modell „versteht" Ihre Belege, wissen Sie, was tatsächlich passiert: Gewichte, die auf Beispielen eingestellt wurden. Die richtige Frage ist dann nicht „wie intelligent ist es", sondern: Auf welchen Beispielen? Und wie wurde gemessen, auf Daten, die es nie gesehen hat?
Sie können einordnen. Milliarden Gewichte klingen nach Magie. Sie wissen jetzt, dass es Federraten und Spiel sind, sehr viele davon, und dass die Zahl allein nichts über die Eignung für Ihre Aufgabe sagt. Eine Kennlinie mit wenigen Knicken braucht kein Paket, das jede Kennlinie kann.
Sie können entscheiden. Ein Modell, dessen Gewichte als Datei im eigenen Haus liegen, ist ein Betriebsmittel. Es wird einmal eingestellt, einmal abgenommen, und bleibt dann, bis Sie es ändern – kein Anbieter stellt es um, schaltet es ab oder verteuert es. Für den Maschinenbauer sind das vertraute Begriffe: das Federpaket vom Hersteller, das Einstellen auf die eigene Maschine, die Abnahmemessung.
Und wenn Sie es ausprobieren wollen
Schildern Sie uns einen Vorgang – einen, der heute von Hand zwischen zwei Systemen wandert. Wir sagen Ihnen in einem Gespräch, ob er sich automatisieren lässt, mit welchem Modell, wo es laufen sollte und was es kostet. Ohne Folie, ohne Demo, mit den Begriffen aus diesem Beitrag.
Schildern Sie uns einen Vorgang.
Ein Anruf genügt für eine belastbare Einschätzung: ob er sich automatisieren lässt, was das kostet – und ob er sich überhaupt trägt.