Notizen
Offene Modelle in der Praxis.
Drei Fragen entscheiden, ob ein Modell im eigenen Haus läuft: Wie weit ist es von der Spitze entfernt, wie viel Speicher braucht es, und dürfen Sie es überhaupt kommerziell einsetzen?
Rückstand auf die Spitze
3–4 Monate
So weit lagen offen verfügbare Modelle zuletzt hinter den besten geschlossenen Modellen, gemessen am Epoch Capabilities Index. Es handelt sich um zwei getrennte Schätzungen (rund 3 Monate für den Zeitraum bis Oktober 2025, 4 Monate für das erste Halbjahr 2026), deren Unsicherheitsbereiche sich überlappen. Daraus lässt sich kein Trend ablesen, in keine Richtung. Epoch weist zudem darauf hin, dass der Abstand eher unterschätzt wird. Für die meisten Aufgaben in der Prozessautomatisierung ist ein Quartal Rückstand ohne Bedeutung.
Quelle: Epoch AI, Epoch Capabilities IndexStand 2026-07-22
Speicherbedarf der Gewichte bei 4-Bit-Quantisierung (Q4_K_M)
Parameter × 4,8944 Bit ÷ 8 ergibt Gigabyte. Q4_K_M belegt entgegen dem Namen nicht 4, sondern rund 4,9 Bit pro Gewicht. Gezeigt sind nur die Gewichte. Kontext (KV-Cache) und Betriebssystem belegen zusätzlich Speicher, die Balken sind also Untergrenzen. Die Linien zeigen gewöhnlichen Arbeitsspeicher, keinen Grafikspeicher: iPhone 17 Pro (12 GB), iPad Pro M5 (16 GB), MacBook Pro M5 Pro im Vollausbau (64 GB) und ein CPU-Server mit 128 GB DDR5. Bei den ersten dreien teilt sich das Modell den Speicher mit dem Betriebssystem. Passen heißt nicht schnell sein: Auf der CPU begrenzt die Speicherbandbreite das Tempo, nicht der Platz.
Quelle: llama.cpp (Bits pro Gewicht), Apple (Gerätespeicher), eigene BerechnungStand 2026-07-22
Offene Gewichte heißt nicht kommerziell nutzbar
Die Farbe fasst verwandte Aufgaben zusammen, die Kugelgröße zeigt die Parameterzahl der größten veröffentlichten Variante. Die Modelle umfassen fünf Größenordnungen (22 Mio. bis 1,6 Bio. Parameter), deshalb ist die Skala logarithmisch. Doppelter Durchmesser bedeutet nicht doppelt so viele Parameter. Schraffierte Kugeln dürfen nicht kommerziell genutzt werden. Jede Lizenz wurde am 22. Juli 2026 direkt in den Metadaten der offiziellen Modellkarte nachgelesen; Spiegelungen Dritter tragen häufig falsche Angaben.
- Text & Code
- Bild & Text
- Audio
- Embeddings
Kimi K2.6
- Anbieter
- Moonshot AI
- Größen
- 1T-A32B
- Lizenz
- Modified MIT
- Kommerziell
- Mit Namensnennung
Namensnennung erst ab 100 Mio. Nutzern oder 20 Mio. USD Monatsumsatz.
GLM-5.2
- Anbieter
- Z.ai
- Größen
- ~753B
- Lizenz
- MIT
- Kommerziell
- Ja
MiniMax-M3
- Anbieter
- MiniMax
- Größen
- 428B-A23B
- Lizenz
- MiniMax Community
- Kommerziell
- Mit Auflagen
Meldepflicht per E-Mail; ab 20 Mio. USD Jahresumsatz ist eine schriftliche Genehmigung erforderlich.
Llama 4 Maverick
- Anbieter
- Meta
- Größen
- 402B-A17B · 109B-A17B
- Lizenz
- Llama 4 Community
- Kommerziell
- Mit Auflagen
Ab 700 Mio. monatlich aktiven Nutzern ist eine gesonderte Lizenz nötig. „Built with Llama" muss angezeigt werden.
DeepSeek-V4-Flash
- Anbieter
- DeepSeek
- Größen
- 284B-A13B
- Lizenz
- MIT
- Kommerziell
- Ja
Nemotron 3 Super
- Anbieter
- NVIDIA
- Größen
- 120B-A12B · 30B-A3B
- Lizenz
- NVIDIA Open Model
- Kommerziell
- Mit Namensnennung
Mistral Small 4
- Anbieter
- Mistral AI
- Größen
- 119B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
gpt-oss
- Anbieter
- OpenAI
- Größen
- 117B-A5,1B · 21B-A3,6B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Qwen3.6
- Anbieter
- Alibaba
- Größen
- 35B-A3B · 27B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Gemma 4
- Anbieter
- Größen
- 31B · 26B-A4B · 12B · E4B · E2B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Erst ab Gemma 4. Gemma 3 und älter stehen weiter unter den Gemma Terms.
Phi-4
- Anbieter
- Microsoft
- Größen
- 14B · 5,6B · 3,8B
- Lizenz
- MIT
- Kommerziell
- Ja
SmolLM3
- Anbieter
- Hugging Face
- Größen
- 3B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Qwen3-Coder
- Anbieter
- Alibaba
- Größen
- 480B-A35B · 80B-A3B · 30B-A3B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
DeepSeek-Coder-V2
- Anbieter
- DeepSeek
- Größen
- 236B-A21B · 16B-A2,4B
- Lizenz
- DeepSeek License
- Kommerziell
- Mit Auflagen
Nutzungsbeschränkungen, anders als DeepSeek V3, R1 und V4, die unter MIT stehen.
Devstral 2
- Anbieter
- Mistral AI
- Größen
- 123B
- Lizenz
- Modified MIT
- Kommerziell
- Mit Auflagen
Ab 20 Mio. USD Monatsumsatz nicht mehr lizenziert. Das kleinere Devstral Small 2 ist dagegen Apache 2.0.
Devstral Small 2
- Anbieter
- Mistral AI
- Größen
- 24B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Codestral 22B
- Anbieter
- Mistral AI
- Größen
- 22B
- Lizenz
- MNPL
- Kommerziell
- Nein
Mistral Non-Production License: kein Produktivbetrieb, trotz Apache-2.0-Geschwistern im selben Konto.
InternVL3.5
- Anbieter
- OpenGVLab
- Größen
- 241B-A28B · 38B · 8B · 1B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Qwen3-VL
- Anbieter
- Alibaba
- Größen
- 235B-A22B · 32B · 8B · 2B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Molmo 2
- Anbieter
- Ai2
- Größen
- 8B · 7B · 4B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
SmolVLM2
- Anbieter
- Hugging Face
- Größen
- 2,2B · 500M · 256M
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Voxtral Small
- Anbieter
- Mistral AI
- Größen
- 24B · 4,4B · 3B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Whisper large-v3
- Anbieter
- OpenAI
- Größen
- 1,55B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Canary 1B
- Anbieter
- NVIDIA
- Größen
- 1B
- Lizenz
- CC-BY-NC-4.0
- Kommerziell
- Nein
Nur die ursprüngliche Version. Canary 1B v2 und Canary-Qwen stehen unter CC-BY-4.0.
Whisper large-v3-turbo
- Anbieter
- OpenAI
- Größen
- 809M
- Lizenz
- MIT
- Kommerziell
- Ja
Parakeet TDT v3
- Anbieter
- NVIDIA
- Größen
- 627M
- Lizenz
- CC-BY-4.0
- Kommerziell
- Mit Namensnennung
Voxtral 4B TTS
- Anbieter
- Mistral AI
- Größen
- 4B
- Lizenz
- CC-BY-NC-4.0
- Kommerziell
- Nein
Das einzige Voxtral-Modell ohne Apache-2.0-Lizenz: gleicher Name, anderes Ergebnis.
Orpheus
- Anbieter
- Canopy Labs
- Größen
- 3,8B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Chatterbox
- Anbieter
- Resemble AI
- Größen
- ~500M
- Lizenz
- MIT
- Kommerziell
- Ja
F5-TTS
- Anbieter
- SWivid
- Größen
- ~330M
- Lizenz
- CC-BY-NC-4.0
- Kommerziell
- Nein
Sehr verbreitet und dennoch nicht kommerziell nutzbar. Abgeleitete Feintunings erben die Einschränkung.
Kokoro
- Anbieter
- hexgrad
- Größen
- 82M
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Qwen3-Embedding
- Anbieter
- Alibaba
- Größen
- 8B · 4B · 0,6B
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Jina Embeddings v3
- Anbieter
- Jina AI
- Größen
- 572M
- Lizenz
- CC-BY-NC-4.0
- Kommerziell
- Nein
Die gesamte aktuelle Jina-Reihe (v3, v5, Reranker) ist nicht kommerziell nutzbar. Nur die alten v2-Modelle sind Apache 2.0.
BGE-M3
- Anbieter
- BAAI
- Größen
- 568M
- Lizenz
- MIT
- Kommerziell
- Ja
Nomic Embed v2
- Anbieter
- Nomic AI
- Größen
- 475M MoE · 137M
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
ModernBERT
- Anbieter
- Answer.AI
- Größen
- 396M · 150M
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
EmbeddingGemma
- Anbieter
- Größen
- 308M
- Lizenz
- Gemma Terms
- Kommerziell
- Mit Auflagen
Nicht auf Apache 2.0 umgestellt, anders als Gemma 4. Zustimmung zur Lizenz erforderlich.
all-MiniLM-L6-v2
- Anbieter
- SBERT
- Größen
- 22M
- Lizenz
- Apache 2.0
- Kommerziell
- Ja
Das meistgeladene Modell auf Hugging Face überhaupt.
Werte als Tabelle
| Modell | Anbieter | Aufgabe | Größen | Lizenz | Kommerziell |
|---|---|---|---|---|---|
| Gemma 4 | Text | 31B · 26B-A4B · 12B · E4B · E2B | Apache 2.0 | Ja | |
| gpt-oss | OpenAI | Text | 117B-A5,1B · 21B-A3,6B | Apache 2.0 | Ja |
| Qwen3.6 | Alibaba | Text | 35B-A3B · 27B | Apache 2.0 | Ja |
| DeepSeek-V4-Flash | DeepSeek | Text | 284B-A13B | MIT | Ja |
| GLM-5.2 | Z.ai | Text | ~753B | MIT | Ja |
| Kimi K2.6 | Moonshot AI | Text | 1T-A32B | Modified MIT | Mit Namensnennung |
| Llama 4 Maverick | Meta | Text | 402B-A17B · 109B-A17B | Llama 4 Community | Mit Auflagen |
| Mistral Small 4 | Mistral AI | Text | 119B | Apache 2.0 | Ja |
| Phi-4 | Microsoft | Text | 14B · 5,6B · 3,8B | MIT | Ja |
| SmolLM3 | Hugging Face | Text | 3B | Apache 2.0 | Ja |
| MiniMax-M3 | MiniMax | Text | 428B-A23B | MiniMax Community | Mit Auflagen |
| Nemotron 3 Super | NVIDIA | Text | 120B-A12B · 30B-A3B | NVIDIA Open Model | Mit Namensnennung |
| Qwen3-VL | Alibaba | Bild & Text | 235B-A22B · 32B · 8B · 2B | Apache 2.0 | Ja |
| InternVL3.5 | OpenGVLab | Bild & Text | 241B-A28B · 38B · 8B · 1B | Apache 2.0 | Ja |
| Molmo 2 | Ai2 | Bild & Text | 8B · 7B · 4B | Apache 2.0 | Ja |
| SmolVLM2 | Hugging Face | Bild & Text | 2,2B · 500M · 256M | Apache 2.0 | Ja |
| Whisper large-v3 | OpenAI | Spracherkennung | 1,55B | Apache 2.0 | Ja |
| Whisper large-v3-turbo | OpenAI | Spracherkennung | 809M | MIT | Ja |
| Parakeet TDT v3 | NVIDIA | Spracherkennung | 627M | CC-BY-4.0 | Mit Namensnennung |
| Canary 1B | NVIDIA | Spracherkennung | 1B | CC-BY-NC-4.0 | Nein |
| Voxtral Small | Mistral AI | Spracherkennung | 24B · 4,4B · 3B | Apache 2.0 | Ja |
| Kokoro | hexgrad | Sprachsynthese | 82M | Apache 2.0 | Ja |
| Chatterbox | Resemble AI | Sprachsynthese | ~500M | MIT | Ja |
| Orpheus | Canopy Labs | Sprachsynthese | 3,8B | Apache 2.0 | Ja |
| F5-TTS | SWivid | Sprachsynthese | ~330M | CC-BY-NC-4.0 | Nein |
| Voxtral 4B TTS | Mistral AI | Sprachsynthese | 4B | CC-BY-NC-4.0 | Nein |
| Qwen3-Embedding | Alibaba | Embeddings | 8B · 4B · 0,6B | Apache 2.0 | Ja |
| BGE-M3 | BAAI | Embeddings | 568M | MIT | Ja |
| Nomic Embed v2 | Nomic AI | Embeddings | 475M MoE · 137M | Apache 2.0 | Ja |
| ModernBERT | Answer.AI | Embeddings | 396M · 150M | Apache 2.0 | Ja |
| all-MiniLM-L6-v2 | SBERT | Embeddings | 22M | Apache 2.0 | Ja |
| EmbeddingGemma | Embeddings | 308M | Gemma Terms | Mit Auflagen | |
| Jina Embeddings v3 | Jina AI | Embeddings | 572M | CC-BY-NC-4.0 | Nein |
| Qwen3-Coder | Alibaba | Code | 480B-A35B · 80B-A3B · 30B-A3B | Apache 2.0 | Ja |
| Devstral Small 2 | Mistral AI | Code | 24B | Apache 2.0 | Ja |
| Devstral 2 | Mistral AI | Code | 123B | Modified MIT | Mit Auflagen |
| Codestral 22B | Mistral AI | Code | 22B | MNPL | Nein |
| DeepSeek-Coder-V2 | DeepSeek | Code | 236B-A21B · 16B-A2,4B | DeepSeek License | Mit Auflagen |
Quelle: Offizielle Modellkarten und RepositoriesStand 2026-07-22
Kurz gesagt
Ein Modell mit 70 Milliarden Parametern passt 4-Bit-quantisiert auf einen Laptop mit 64 GB, und alles bis 120 Milliarden auf einen gewöhnlichen Server mit 128 GB. Arbeitsspeicher ist selten das Problem. Die Frage ist, wie schnell es sein muss.
Gespräch vereinbaren