Moonshot AI hat am 16. Juli 2026 ein Modell mit 2,8 Billionen Parametern veröffentlicht. Offene Gewichte. 1 Million Token Kontext. Integrierte Bild- und Videoerkennung. Preis: $3 pro Million Input-Tokens (ca. 2,70 €). Die vollständigen Gewichte (Modified MIT Lizenz) kommen am 27. Juli.
Meine ehrliche Meinung: Das ist der Moment, an dem Open-Source-KI aufgehört hat, die “günstige Alternative” zu sein — und zu einem echten Architektur-Wettbewerb geworden ist. Kimi Delta Attention und Attention Residuals sind kein Marketing-Geschwätz. Das sind echte Engineering-Entscheidungen für Effizienz, nicht nur für rohe Größe. Das ist wichtiger als die Billionen-Parameter-Schlagzeile.
Was mich als Ingenieur begeistert
2,8B Parameter, aber nur ein Teil wird pro Anfrage aktiviert. Das ist clever. Rohle-Skalierung ist eine Sackgasse — Bandbreite und Strom gewinnen am Ende immer. Moonshot hat das verstanden.
Was ich noch nicht kaufe
“Zweitbeste nach den Top-Proprietary-Modellen” ist Moonshots eigener Benchmark, nicht unabhängig. Ausführlichkeit-Probleme und Aufgaben-Fehler tauchen schon in der echten Nutzung auf. Ich kenne diesen Film — großer Launch, große Behauptungen, leise Korrektur drei Wochen später.
Meine Prognose
Dieses Modell wird richtig gut sein für agentisches Coden und lange Kontexte — und für alles andere ziemlich überhypt. Die Veröffentlichung der Gewichte am 27. Juli ist der echte Test. Bis dahin ist es Marketing mit sehr gutem Engineering drunter.
Was das für lokale Inferenz bedeutet
Für alle, die lokal laufen lassen — wie ich auf meinem Mac mini — ist das bei 2,8B Parametern noch außer Reichweite. Aber es bestätigt die Richtung: sparse MoE, effiziente Attention, offene Gewichte. Das ist das Playbook, das kleinere Labs in den nächsten zwei Jahren kopieren werden.
Einen Blick wert. Aber noch nicht den Stack umstellen.