Parameter bezeichnen im KI-Kontext trainierte Zahlenwerte eines Modells. Im KI-Kontext tauchen sie vor allem als sichtbare Größenangabe auf: 2B, 7B, 70B oder 405B stehen für Milliarden Parameter. Diese Zahl hilft, Modelle einzuordnen, ist aber kein alleiniger Qualitätsnachweis, weil Architektur, Daten, Training, Hardwarebedarf, Kontextfenster und Sicherheitsmechanismen ebenfalls eine Rolle spielen.
Definition
Parameter sind trainierte Zahlenwerte eines KI-Modells, die nach dem Training mitbestimmen, wie das Modell auf Eingaben reagiert. In der Praxis werden sie oft als Kurzform für die Modellgröße verwendet: Wenn ein Modell als 7B, 70B oder 405B beschrieben wird, steht das "B" für "billion" im Englischen, also Milliarden Parameter im Deutschen.
Im KI-Kontext wird der Begriff vor allem bei großen Sprachmodellen genutzt. Beispiele sind Gemma mit 2B und 7B, Falcon 180B mit 180 Milliarden Parametern, Grok-1 mit 314 Milliarden Parametern und Llama 3.1 mit 405 Milliarden Parametern.
Warum Parameterzahlen wichtig sind
Parameterzahlen sind nützlich, weil sie eine schnelle Größenordnung liefern. Der Newsletter nutzt sie wiederholt, um Modelle miteinander einzuordnen: Llama 3 mit 70 Milliarden Parametern, ein angekündigtes Llama-Modell mit 400 Milliarden Parametern, MAI-1 mit 500 Milliarden Parametern oder NVLM-D-72B mit 72 Milliarden Parametern.
Diese Zahlen sind auch ein Signal für Entwicklungs- und Betriebsaufwand. Beim Open-Source-Modell Grok-1 weist der Newsletter neben den 314 Milliarden Parametern ausdrücklich darauf hin, dass die benötigte Hardware teuer ist. Parameterzahlen sind deshalb nicht nur technische Kennzahlen, sondern auch Hinweise auf Infrastruktur, Kosten und Zugänglichkeit.
Größer ist nicht automatisch besser
Eine hohe Parameterzahl kann mit Leistungsfähigkeit verbunden sein, sie beweist aber nicht allein, dass ein Modell für jeden Zweck besser ist. Der AI-Breakdown zeigt diese Spannung an mehreren Beispielen: Llama 3.1 mit 405 Milliarden Parametern wird als starkes Open-Source-Modell beschrieben, während Microsofts Phi-3-mini mit nur 3,8 Milliarden Parametern in Tests gegen deutlich größere Modelle gut abschneidet und für günstigere Hardware sowie Offline-Nutzung interessant ist.
Auch Hermes 3 zeigt, dass Modellgröße nicht jede Eigenschaft erklärt: Das Modell wird in Größen mit 8, 70 und 405 Milliarden Parametern beschrieben; beim größten Modell wird ein auffälliges Identitätsverhalten erwähnt, dessen Ursache in der Meldung noch erforscht wird. Parameter sind daher eine wichtige Kennzahl, aber kein vollständiger Qualitäts-, Sicherheits- oder Verlässlichkeitsnachweis.
Abgrenzung zu Architektur, Training und Benchmarks
Parameter beschreiben trainierte Zahlenwerte beziehungsweise die Größe eines Modells, aber nicht die gesamte Bauweise. Grok-1 wird im Newsletter zum Beispiel als Expertenmodell beschrieben: Es besteht aus acht Expertenmodellen, von denen jeweils zwei pro Token-Anfrage antworten. Das ist ein Hinweis darauf, dass Architektur und aktive Rechenlast anders zu bewerten sind als die reine Gesamtzahl der Parameter.
Auch Benchmarks sind eine andere Kategorie: Sie sollen Modellleistung in bestimmten Tests sichtbar machen. Parameterzahlen können bei der Einordnung helfen, ersetzen solche Tests aber nicht. Der Newsletter nennt beispielsweise Llama 3.1 mit 405 Milliarden Parametern und ordnet es zugleich über Benchmark-Tests gegenüber führenden Modellen ein.
Praxisbeispiele aus dem AI-Breakdown
Kleine Modelle: Gemma wird in 2B- und 7B-Varianten beschrieben; Phi-3-mini hat 3,8 Milliarden Parameter und wird als Beispiel für kleinere Modelle genannt, die auf günstigerer Hardware oder offline laufen können.
Große offene Modelle: Falcon 180B, Grok-1 mit 314 Milliarden Parametern und Llama 3.1 mit 405 Milliarden Parametern zeigen, wie Parameterzahlen im Newsletter zur Einordnung von Open-Source- beziehungsweise offen verfügbaren Modellen genutzt werden.
Modellfamilien: Qwen 2.5 wird im Newsletter als Familie mit über 100 Sprachmodellen beschrieben, die sich unter anderem in Parameterzahl und Sprachunterstützung unterscheiden. Das zeigt, dass Parameter oft nicht nur ein einzelnes Modell beschreiben, sondern Varianten innerhalb einer Modellfamilie strukturieren.
Weitere Seiten
Quellen und Belege
AI-Breakdown-Ausgaben
- AI-Breakdown KW 37/2023: 1. Mit Falcon 180b wurde das bislang größte öffentlich zugängliche Sprachmodell veröffentlicht. Es übertrifft mit seinen 180 Milliarden Parametern sogar GPT-3.5. Demo
- AI-Breakdown KW 09/2024: Google stellt Gemma als Open Source LLM vor. Mit Gemma wächst die Anzahl an frei verfügbaren Sprachmodellen immer weiter. Gemma gibt es als 2B und 7B Variante (gemeint ist die Anzahl der Parameter). Erste Tests legen nahe, dass es nicht der Heilige Grahl ist, aber ein wichtiger Schritt hin zu freien Modellen.
- AI-Breakdown KW 12/2024: Grok wird Open Source: Mit Grok-1 hat X das aktuell das größte Open-Source LLM veröffentlicht. Es wurde mit 314 Milliarden Parametern trainiert. Es ist ein Expertenmodell, d.h. es besteht aus 8 Experten Modellen von denen jeweils 2 pro Token Anfrage antworten. Das System stellt nicht nur eine positive Bereicherung der Szene dar. Das System verfügt über keine Filter und kann dadurch auch einfach missbräuchlich eingesetzt werden. Die benötigte Hardware kostet zwar tausende Euro, trotzdem stellt sich die Frage, ob solche Modelle ohne Sicherheitsfeatures veröffentlicht werden sollten.
- AI-Breakdown KW 17/2024: Meta's neues Spielzeug: Llama 3 🦙 hat die Bühne betreten, mit zwei Modellen, die echt was draufhaben. Aber alle warten gespannt auf das Mega-Modell mit 400 Milliarden Parametern! Im Vergleich zu Claude 3 und anderen bekannten Modellen steht Llama 3 mit 70 Milliarden Parametern schon relativ gut da.
- AI-Breakdown KW 18/2024: Klein aber OHO: Es gibt gerade mehrere Strömungen innerhalb der KI-Entwicklungen bezogen auf die LLMs. Zum einen immer größere Modelle mit mehr Parametern zu erstellen, die dann auch komplexere Aufgaben bewältigen können. Zum anderen kleinere Modelle, die auf günstiger Hardware laufen können und somit z.B. auch ohne eine Internetverbindung eingesetzt werden können. Wir hatten schon über Modelle von Apple gesprochen und jetzt hat Microsoft mit Phi-3-mini ebenfalls ein solches Modell vorgestellt. Mit "nur" 3,8 Milliarden Parametern schlägt es sich in den Tests auch gegen deutlich größere Modelle hervorragend. Wirklich interessant finde ich den Ansatz, der hier gewählt wurde. Der Lernprozess der KI gleicht dabei dem, wie Kinder von Gute-Nacht-Geschichten bzw. Kinderbüchern lernen. Einfache Strukturen, einfache Sprache. Ein Problem, es gibt nicht genug Kinderbücher. Also wurde auf synthetische Daten zurückgegriffen. Heißt, eine andere KI hat Kinderbücher zu über 3.000 Begriffen erstellt und damit das System trainiert.
- AI-Breakdown KW 20/2024: Microsofts KI-Entwicklungen: MAI-1 Mustafa Suleyman hat zu Microsoft AI gewechselt und arbeitet dort an MAI-1, einem LLM mit 500 Milliarden Parametern. 🤖 Microsoft spielt auf Nummer sicher und setzt auf Vielfalt in der KI-Entwicklung.
- AI-Breakdown KW 31/2024: Llama 3.1: Meta hat die neueste Version ihres Open Source Models vorgestellt. Mit 405 Milliarden Parametern ist es das größte Open Source Modell. In den Benchmark Test liegt es nahezu gleich auf mit den aktuell besten Modellen von OpenAI und Anthropic. Das Modell bietet sich gerade für ein Unternehmensumfeld an.
- AI-Breakdown KW 34/2024: Amnesie: Das neue LLM Hermes 3, welches auf Metas Llama-Modell basiert, gibt es in drei Größen, 8, 70 und 405 Milliarden Parameter. Das Besondere an dem Open Source Modell ist, dass das größte Modell auf die Frage: Who are you? Keine Antwort weiß. Es gibt vor, alles vergessen zu haben und in einem leeren Raum zu sitzen. Warum das so ist und bei den kleineren Modelle nicht passiert, wird noch erforscht.
- AI-Breakdown KW 39/2024: 100 Open-Source-Modelle: Alibaba hat über 100 neue Sprachmodelle, basierend auf Qwen 2.5 veröffentlicht. Diese unterscheiden sich in der Anzahl der verwendeten Parameter und welche Sprachen diese unterstützen. Das größte Model mit 72 Milliarden Parametern nimmt auch gerade den Platz als bestes Open-Source-Model ein.
- AI-Breakdown KW 41/2024: NVLM-D-72B: Kryptischer Name bzw. Abkürzung, schauen wir es uns an, NVidia Language Model und 72 Milliarden (engl. Billion) Parameter lassen sich dann doch einfach entschlüsseln. Das neue Open Source Modell soll es mit ChatGPT-4o aufnehmen können. Für ein Open Source Modell ist das wirklich ein großer Sprung.
Externe Quellen
- Text generation: Offizielle OpenAI-Dokumentation als Kontext für Texteingaben, Modellnutzung und Ausgaben bei Sprachmodellen.
- Transformers documentation: Offizielle Transformers-Dokumentation als technischer Kontext für Modellarchitekturen, Training und Inferenz.
- Attention Is All You Need: Primärquelle zur Transformer-Architektur, die den technischen Hintergrund vieler moderner Sprachmodelle bildet.