Kimi K3 ist da: 2,8 Billionen Parameter, offen — und die Kampfpreis-Ära ist vorbei
Moonshot veröffentlicht Kimi K3 mit 2,8 Billionen Parametern als Open Weight. Warum die Schlagzeile 'China schlägt USA' die falsche Story ist — und was in der Preisliste steht, das strategische Entscheidungen bewegt.
Kimi K3 ist da. 2,8 Billionen Parameter, offen, in zwei Wochen zum Download.
Die Schlagzeilen schreiben “China schlägt USA”. Interessanter ist, was in der Preisliste steht.
Moonshot selbst sagt es nüchtern: K3 liegt hinter Fable 5 und GPT-5.6 Sol, schlägt aber alles andere im eigenen Test — auch Opus 4.8. Unabhängige Messungen (Artificial Analysis) bestätigen das: 57 Punkte, drei hinter der Spitze.
| Kategorie | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Parameter | 2,8 Billionen (open weight) | proprietär | proprietär | proprietär |
| Kontextfenster | 1 Mio. Token | – | – | – |
| Terminal-Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 |
| BrowseComp (Agenten) | 91,2 | 88,0 | 90,4 | 84,3 |
| GPQA-Diamond | 93,5 | 92,6 | 94,1 | 91,0 |
| HLE-Full | 43,5 | 53,3 | 44,5 | 49,8 |
| AA Intelligence Index (unabh.) | 57 | ~60 | 59 (Sol) / 55 (Terra) | ~56 |
| Preis Input (Cache-Hit / Miss) | 0,30 $ / 3,00 $ pro MTok | 1 $ / 10 $ pro MTok | 0,50 $ / 5 $ pro MTok | – |
| Preis Output | 15 $ pro MTok | 50 $ pro MTok | 30 $ pro MTok | – |
| Lizenz | Open Weight (ab 27.07.) | proprietär | proprietär | proprietär |
Moonshot-eigene Benchmarks, max reasoning effort. Kurz zusammengefasst: K3 gewinnt einzelne Kategorien (FrontierSWE, SWE Marathon, BrowseComp), verliert andere klar (HLE-Full, Reasoning ohne Tools) — insgesamt knapp, aber konsistent hinter Fable 5 und GPT-5.6 Sol, deutlich vor Opus 4.8 in mehreren agentenlastigen Benchmarks.
Der eigentliche Bruch ist der Preis. Bisher hieß die Regel: China liefert 80 % der Leistung zu 20 % der Kosten. K3 kostet für Output 15 $ pro Million Token — das ist teurer als GPT-5.6 Sol und liegt auf dem Niveau westlicher Mittelklassemodelle. Die Ära der Kampfpreise ist vorbei, sobald man auf Frontier-Niveau mitspielen will. Auch in China kostet Intelligenz jetzt Geld.
Für alle, die gerade Build-vs-Buy-Entscheidungen treffen: Open Weight heißt nicht mehr automatisch “billig”. Es heißt: volle Kontrolle über Deployment, Datenhaltung und Anpassung — zu einem Preis, der näher an den geschlossenen Modellen liegt als viele erwarten.
Moonshot nennt selbst zwei Einschränkungen, die ich spannender finde als jeden Benchmark: K3 neigt zu “excessive proactiveness” bei unklaren Aufgaben und braucht explizite Leitplanken im System-Prompt. Und die User Experience liegt spürbar hinter den geschlossenen Modellen. Genau die Punkte, an denen in der Praxis Piloten scheitern — nicht an der Rohleistung.
Was zählt in euren Projekten mehr: der Benchmark-Punkt oder die Kontrollierbarkeit im Betrieb?