Parameter bezeichnen im KI-Kontext trainierte Zahlenwerte eines Modells. Im KI-Kontext tauchen sie vor allem als sichtbare Größenangabe auf: 2B, 7B, 70B oder 405B stehen für Milliarden Parameter. Diese Zahl hilft, Modelle einzuordnen, ist aber kein alleiniger Qualitätsnachweis, weil Architektur, Daten, Training, Hardwarebedarf, Kontextfenster und Sicherheitsmechanismen ebenfalls eine Rolle spielen.

Definition

Parameter sind trainierte Zahlenwerte eines KI-Modells, die nach dem Training mitbestimmen, wie das Modell auf Eingaben reagiert. In der Praxis werden sie oft als Kurzform für die Modellgröße verwendet: Wenn ein Modell als 7B, 70B oder 405B beschrieben wird, steht das "B" für "billion" im Englischen, also Milliarden Parameter im Deutschen.

Im KI-Kontext wird der Begriff vor allem bei großen Sprachmodellen genutzt. Beispiele sind Gemma mit 2B und 7B, Falcon 180B mit 180 Milliarden Parametern, Grok-1 mit 314 Milliarden Parametern und Llama 3.1 mit 405 Milliarden Parametern.

Warum Parameterzahlen wichtig sind

Parameterzahlen sind nützlich, weil sie eine schnelle Größenordnung liefern. Der Newsletter nutzt sie wiederholt, um Modelle miteinander einzuordnen: Llama 3 mit 70 Milliarden Parametern, ein angekündigtes Llama-Modell mit 400 Milliarden Parametern, MAI-1 mit 500 Milliarden Parametern oder NVLM-D-72B mit 72 Milliarden Parametern.

Diese Zahlen sind auch ein Signal für Entwicklungs- und Betriebsaufwand. Beim Open-Source-Modell Grok-1 weist der Newsletter neben den 314 Milliarden Parametern ausdrücklich darauf hin, dass die benötigte Hardware teuer ist. Parameterzahlen sind deshalb nicht nur technische Kennzahlen, sondern auch Hinweise auf Infrastruktur, Kosten und Zugänglichkeit.

Größer ist nicht automatisch besser

Eine hohe Parameterzahl kann mit Leistungsfähigkeit verbunden sein, sie beweist aber nicht allein, dass ein Modell für jeden Zweck besser ist. Der AI-Breakdown zeigt diese Spannung an mehreren Beispielen: Llama 3.1 mit 405 Milliarden Parametern wird als starkes Open-Source-Modell beschrieben, während Microsofts Phi-3-mini mit nur 3,8 Milliarden Parametern in Tests gegen deutlich größere Modelle gut abschneidet und für günstigere Hardware sowie Offline-Nutzung interessant ist.

Auch Hermes 3 zeigt, dass Modellgröße nicht jede Eigenschaft erklärt: Das Modell wird in Größen mit 8, 70 und 405 Milliarden Parametern beschrieben; beim größten Modell wird ein auffälliges Identitätsverhalten erwähnt, dessen Ursache in der Meldung noch erforscht wird. Parameter sind daher eine wichtige Kennzahl, aber kein vollständiger Qualitäts-, Sicherheits- oder Verlässlichkeitsnachweis.

Abgrenzung zu Architektur, Training und Benchmarks

Parameter beschreiben trainierte Zahlenwerte beziehungsweise die Größe eines Modells, aber nicht die gesamte Bauweise. Grok-1 wird im Newsletter zum Beispiel als Expertenmodell beschrieben: Es besteht aus acht Expertenmodellen, von denen jeweils zwei pro Token-Anfrage antworten. Das ist ein Hinweis darauf, dass Architektur und aktive Rechenlast anders zu bewerten sind als die reine Gesamtzahl der Parameter.

Auch Benchmarks sind eine andere Kategorie: Sie sollen Modellleistung in bestimmten Tests sichtbar machen. Parameterzahlen können bei der Einordnung helfen, ersetzen solche Tests aber nicht. Der Newsletter nennt beispielsweise Llama 3.1 mit 405 Milliarden Parametern und ordnet es zugleich über Benchmark-Tests gegenüber führenden Modellen ein.

Praxisbeispiele aus dem AI-Breakdown

Kleine Modelle: Gemma wird in 2B- und 7B-Varianten beschrieben; Phi-3-mini hat 3,8 Milliarden Parameter und wird als Beispiel für kleinere Modelle genannt, die auf günstigerer Hardware oder offline laufen können.

Große offene Modelle: Falcon 180B, Grok-1 mit 314 Milliarden Parametern und Llama 3.1 mit 405 Milliarden Parametern zeigen, wie Parameterzahlen im Newsletter zur Einordnung von Open-Source- beziehungsweise offen verfügbaren Modellen genutzt werden.

Modellfamilien: Qwen 2.5 wird im Newsletter als Familie mit über 100 Sprachmodellen beschrieben, die sich unter anderem in Parameterzahl und Sprachunterstützung unterscheiden. Das zeigt, dass Parameter oft nicht nur ein einzelnes Modell beschreiben, sondern Varianten innerhalb einer Modellfamilie strukturieren.

Weitere Seiten

Quellen und Belege

AI-Breakdown-Ausgaben

Externe Quellen