Wichtige Erkenntnisse
- xAI lieferte Grok 4.5 am 8. Juli zu einem Preis von 2/6 US-Dollar pro Million Token aus und unterbot damit die Preise für Opus 4.8 um über 60 %.
- Anthropic veröffentlichte am 24. Juli Claude Opus 5 als neues Standardmodell für Claude Max-Abonnements.
- Moonshot AI veröffentlichte Kimi K3, sein größtes Modell mit 2,8 Billionen Parametern.
Grok 4.5 von xAI, Claude Opus 5 von Anthropic, die GPT-5.6-Familie von OpenAI und Kimi K3 von Moonshot AI zielen jeweils auf dasselbe Problem: ein KI-System dazu zu bringen, eine mehrstündige Aufgabe zu bewältigen, von der Recherche über die Codierung bis hin zur strukturierten Berichterstattung, ohne den Überblick über den Plan zu verlieren.
Grok 4.5 trainiert in echten Entwicklersitzungen
xAI hat Grok 4.5 am 8. Juli veröffentlicht. Das Modell läuft auf einer Parameterbasis von 1,5 Billionen und wurde teilweise anhand realer Nutzungsdaten von Cursor trainiert, der Codierungsplattform, die SpaceXAI Anfang des Jahres erworben hat. Der Preis beträgt 2 US-Dollar pro Million Input-Tokens und 6 US-Dollar pro Million Output-Tokens bei einem Kontextfenster von 500.000 Tokens.
Elon Musk beschrieb Grok 4.5 als Modell der Opus-Klasse, das schneller und kostengünstiger läuft. Unabhängige Tracker belegen im Artificial Analysis Intelligence Index den vierten Platz, vor allen Modellen mit offenem Gewicht, bei einem Preis, der mehr als 60 % darunter liegt Claude Opus 4.8 und GPT-5.5. Beim Terminal-Bench 2.1, einem Test, der bewertet, wie gut ein Modell Befehlszeilen-Engineering-Aufgaben erledigt, erreichte Grok 4.5 83,3 %.
Die größere Veränderung ist die Token-Effizienz. Laut xAI benötigt das Modell etwa ein Fünftel der Ausgabetokens, die Opus 4.8 für vergleichbare Aufgaben benötigt, was die Kosten für die Ausführung langer Agentensitzungen senkt.
Claude Opus 5 hält die Preislinie
Anthropic veröffentlichte Claude Opus 5 am 24. Juli und positioniert es als ein Modell, das der Leistung von Claude Fable 5, der leistungsstärksten Veröffentlichung des Unternehmens, zum halben Preis von 10 $ Input und 50 $ Output von Fable nahe kommt. Für Opus 5 selbst gelten die gleichen 5 US-Dollar Input- und 25 US-Dollar Output-Preise wie sein Vorgänger Opus 4.8.

Das Modell wird mit einem 1-Millionen-Token-Kontextfenster, 128.000 maximalen Ausgabetokens und einer anpassbaren Einstellung für den Argumentationsaufwand geliefert, die von niedrig bis zu einem neuen xhohen Modus reicht. Laut Anthropic setzt Opus 5 neue Maßstäbe bei Frontier-Bench und GDPval-AA, zwei Codierungs- und Wissensarbeitstests, obwohl es bei Cybersicherheitsaufgaben hinter dem eingeschränkten Claude Mythos 5-Modell zurückbleibt. Opus 5 ist jetzt das Standardmodell bei Claude Max und die stärkste Option bei Claude Pro.
OpenAI teilt GPT-5.6 in drei Stufen auf
OpenAI hat GPT-5.6 auf allgemeine Verfügbarkeit umgestellt am 9. Juli nach einer zweiwöchigen Vorschau, die auf etwa 20 Organisationen beschränkt war, die von der US-Regierung im Anschluss an eine Durchführungsverordnung im Zusammenhang mit der Sicherheitsüberprüfung des Grenzmodells überprüft wurden. Die Familie wird in drei Stufen ausgeliefert: Sol, das Flaggschiff, mit einem Preis von 5 $ Input und 30 $ Output pro Million Token; Terra, ein Mittelklassemodell für 2,50 und 15 US-Dollar, das laut OpenAI zum halben Preis mit GPT-5.5 übereinstimmt; und Luna, eine schnelle, kostengünstige Stufe für 1 $ und 6 $.

OpenAI berichtet, dass Sol den Artificial Analysis Coding Agent Index anführt und auf Terminal-Bench 2.1 88,8 % erreicht. Dieser Wert steigt auf 91,9 %, wenn das Modell im neuen Ultra-Modus vier Subagenten parallel ausführt. Alle drei Stufen verfügen über OpenAIs höchste interne Risikobewertung für Cyber- und biologisches Missbrauchspotenzial, was während der regierungsbehördlichen Vorschau eine zusätzliche Überprüfung auslöste.
Kimi K3 treibt Modelle mit offenem Gewicht an die Grenze
Moonshot-KI veröffentlichte Kimi K3 am 16. Juliein 2,8 Billionen Parameter umfassendes Expertenmodell mit insgesamt 896 Experten und 16 aktiven Experten pro Aufgabe. Das Modell verfügt über ein 1-Millionen-Token-Kontextfenster und eine native multimodale Eingabe, wobei die API-Preise bei 3 US-Dollar Eingabe und 15 US-Dollar Ausgabe pro Million Token liegen. Moonshot hat sich verpflichtet, bis zum 27. Juli die vollständigen offenen Gewichtungen zu veröffentlichen.

K3 ist das bisher größte offene Modell, etwa 75 % größer als das bisher größte, weit verbreitete offene Modell. Unabhängige Tracker platzieren K3 auf Platz vier unter den aktuellen Grenzsystemen, hinter Claude Fable 5 und GPT-5.6 Sol, aber vor Claude Opus 4.8.
Warum die Kluft zu älteren Models wichtig ist
Kontextfenster unter 200.000 Token zwangen Entwickler einst dazu, große Codebasen aufzubrechen oder Pakete in Fragmente zu durchsuchen. Jedes Modell in dieser Gruppe läuft jetzt mit 500.000 Token oder mehr, drei der vier mit 1 Million, sodass eine einzelne Sitzung ein vollständiges Repository oder einen Stapel primärer Quelldokumente enthalten kann.
Auch die Zuverlässigkeit der Agenten hat sich verändert. Systeme aus den Jahren 2023 und 2024 verloren oft nach wenigen Tool-Aufrufen ihren Plan. Die in diesem Monat veröffentlichten Modelle sind darauf ausgelegt, Dutzende koordinierter Schritte zu unterstützen und sich wiederherzustellen, wenn ein Tool-Aufruf fehlerhafte Daten zurückgibt, anstatt abzustürzen.
Für Entwickler besteht der praktische Effekt in niedrigeren Kosten pro abgeschlossener Aufgabe und nicht in einer höheren Obergrenze für einen einzelnen Benchmark. Aufwandskontrollen in Opus 5, gestaffelte Preise in GPT-5.6 und die Effizienzansprüche hinter Grok 4.5 deuten auf das gleiche Ziel hin: Teams entscheiden zu lassen, wie viel Rechenleistung eine Aufgabe verdient, anstatt für jede Anfrage Spitzenpreise zu zahlen.
Für Unternehmen und politische Entscheidungsträger bedeutet die staatlich vorgeschriebene Einführung von GPT-5.6, dass die Aufsicht nun in die Veröffentlichungspläne für die größten Modelle integriert ist und nicht nachträglich hinzugefügt wird. Anthropics Auftrag, Von der Regierung angeordnete Aussetzung von Fable and Mythos Der Zugriff im Juni war eine frühere Version desselben Musters.

