Gemini 4 Argon: Googles Frontier-Modell mit 1M Output-Tokens
Gemini 4 Argon setzt laut Google neue Maßstäbe bei Ausgabelänge und langen agentischen Aufgaben. Der Artikel sortiert Ankündigung, Preise, Benchmarks und erste Demos und trennt Belegtes von Gerüchten.
Inhalt
Google hat am 30. September 2026 mit Gemini 4 Argon ein neues Frontier-Modell angekündigt. Die auffälligsten Kennzahlen: Das Ausgabelimit steigt von 64.000 auf eine Million Token, die Einführungspreise liegen bei 2 US-Dollar pro Million Input-Token und 10 US-Dollar pro Million Output-Token, und in Googles eigenen Benchmarks erreicht Argon beim Software-Engineering-Test DeepSWE v1.1 77,9 Prozent und damit einen neuen Spitzenwert. Der öffentliche Zugang startet erst schrittweise.
Was ist Gemini 4 Argon und wer bekommt Zugang?
Google kündigte das Modell in einem Blogbeitrag mit dem Titel „Gemini 4 Argon: our next era of frontier intelligence" an. Autor des Beitrags ist Koray Kavukcuoglu, SVP bei Google DeepMind. Der Rollout läuft zunächst über das Fairwind-Programm: Eine erste Kohorte aus Cyber-Verteidigern erhält Zugang, damit sie die Cybersicherheits-Fähigkeiten des Modells einsetzen können. Google arbeitet parallel am freiwilligen US-Regierungs-Prozess für Pre-Release-Modellzugang.

Danach folgt laut Google eine gestufte Freigabe: zuerst zahlende API-Kunden und Google-AI-Ultra-Abonnenten, dann Entwickler, Unternehmen und Nutzer. Ein Datum für den breiten Rollout nennt Google nicht. Die im Umlauf befindliche Einschätzung, die Veröffentlichung für die breite Öffentlichkeit könne Mitte Oktober erfolgen, ist ein Gerücht ohne Bestätigung.
Über die Modellgröße selbst ist wenig bekannt. Ein Reuters-Bericht, der über X-Posts zitiert wurde, beschreibt Argon auf Angabe eines Unternehmenssprechers als größer als Googles bisherige Reihe der Top-Pro-Modelle. Eine Parameterzahl nennt niemand; kursierende Schätzungen im Billionen-Bereich sind reine Spekulation.

Was kostet Gemini 4 Argon?
Die Einführungspreise liegen laut Google-Ankündigung bei 2 US-Dollar pro Million Input-Token und 10 US-Dollar pro Million Output-Token. Cached Input kostet mit 0,10 US-Dollar 95 Prozent weniger. Nach der Einführungsphase steigen die Preise auf 4 US-Dollar beziehungsweise 20 US-Dollar pro Million Token.
Die Einordnung über reine Token-Preise hinaus liefert die Analyseplattform Artificial Analysis. Dort kostet ein Intelligence-Index-Task mit Argon 1,99 US-Dollar. Das liegt unter GPT-6 Astra (3,26 US-Dollar), Claude Opus 5.5 (5,98 US-Dollar) und Claude Fable 5.1 (7,63 US-Dollar), deutlich über GPT-6.1 Sol, das mit 0,72 US-Dollar den günstigsten Wert dieser Modellgruppe hat. Argon liegt also im Preis-Leistungs-Verhältnis vorn, ist aber nicht das billigste Frontier-Modell.

Was kann das Modell laut Google?
Eine Million Output-Tokens
Die größte technische Neuerung betrifft die Ausgabelänge: Google erhöht das maximale Output-Limit von 64.000 auf eine Million Token. Das Ziel sind lange, agentische Aufgaben, in denen das Modell über hunderttausende Token hinweg in einer einzigen Trajektorie arbeitet, also ohne dass der Kontext zwischenzeitlich verworfen wird.

Benchmarks
Die von Google veröffentlichten Benchmarks zeigen Argon vor allem bei langen agentischen Aufgaben vorn. Die Methodik und alle Werte stammen von Google beziehungsweise Google DeepMind, eine unabhängige Reproduktion steht bislang aus.
- DeepSWE v1.1: Gemini 4 Argon 77,9 %; GPT-6 Astra 74,1 %; Claude Fable 5.1 67,4 %; Claude Opus 5.5 74,2 %
- Vals Index: Gemini 4 Argon 68,9 %; GPT-6 Astra 63,1 %; Claude Fable 5.1 65,8 %; Claude Opus 5.5 67,0 %
- Vals Finance Agent v2: Gemini 4 Argon 65,4 %; GPT-6 Astra 53,5 %; Claude Fable 5.1 58,9 %; Claude Opus 5.5 58,6 %
- Harvey's Legal Agent Benchmark: Gemini 4 Argon 19,6 %; GPT-6 Astra 5,4 %; Claude Fable 5.1 6,7 %; Claude Opus 5.5 3,8 %
- AutomationBench: Gemini 4 Argon 51,3 %; GPT-6 Astra 41,4 %; Claude Fable 5.1 31,4 %; Claude Opus 5.5 42,5 %
- LVBench: Gemini 4 Argon 91,7 %; GPT-6 Astra 87,5 %; Claude Fable 5.1 79,7 %; Claude Opus 5.5 83,7 %
- Terminal-bench 4.0: Gemini 4 Argon 57,4 %; GPT-6 Astra 58,2 %; Claude Fable 5.1 57,9 %; Claude Opus 5.5 66,4 %
- FrontierSWE v2: Gemini 4 Argon 55,0 %; GPT-6 Astra 65,5 %; Claude Fable 5.1 56,3 %; Claude Opus 5.5 62,3 %
Der auffälligste Einzelwert steht beim Software-Engineering: Beim Benchmark DeepSWE v1.1 für langfristige Softwareentwicklung erreicht Argon 77,9 Prozent und liegt damit vor Claude Opus 5.5 (74,2 Prozent), GPT-6 Astra (74,1 Prozent) und Claude Fable 5.1 (67,4 Prozent). Google bezeichnet das als neuen State of the Art in diesem Bereich.

Bei der Wissensarbeit führt Argon laut Google den Vals Index mit 68,9 Prozent, den Vals Finance Agent v2 mit 65,4 Prozent und den Harvey's Legal Agent Benchmark mit 19,6 Prozent. Bei AutomationBench, einem Test für End-zu-End-Geschäftsabläufe, nennt Google 51,3 Prozent und Rang eins. Im Multimodalen erreicht Argon beim Video-Verständnistest LVBench 91,7 Prozent, ebenfalls ein neuer Spitzenwert laut Google.
Der unabhängige Vergleich durch Artificial Analysis ordnet das Modell im Intelligence Index v4.3.2 (zusammengesetzt aus zehn Evals) mit 53 Punkten ein. GPT-6.1 Sol liegt im selben Chart bei 52 Punkten. Dabei kostet ein Argon-Task nur rund 60 Prozent dessen, was GPT-6 Astra veranschlagt.
Wo liegen die Schwächen?
Bei klassischem Coding führt Argon nicht. Beim Terminal-bench 4.0 liegt Claude Opus 5.5 mit 66,4 Prozent klar vor Argon (57,4), beim FrontierSWE v2 führt GPT-6 Astra mit 65,5 Prozent (Argon: 55,0), und beim Computer-Use-Test OSWorld-2.0 liegt Astra mit 72,6 vor Argon mit 69,2. Auch beim Preis wird Argon von GPT-6.1 Sol unterboten.
Umlaufende Angaben zu einer Halluzinationsrate von 15 Prozent für Argon, der niedrigsten, die Artificial Analysis je gemessen habe, lassen sich anhand des vorliegenden Materials nicht bestätigen. Sie tauchen auf keiner Folie und in keinem verlinkten Diagramm auf. Auch die Einschätzung, Argon sei kein Spitzen-Coding-Modell, aber ein guter Alltags-Begleiter, ist Meinung, kein Fakt. Die Position im Vergleich der Frontier-Modelle kann sich zudem ändern, sobald unabhängige Tests vorliegen.
Was zeigen die ersten Community-Tests?
Eine Reihe von Demos aus Arena und Community-Accounts kursiert bereits. Wichtig vorab: Das Material stammt von Dritten, ist als von Nutzern erzeugt und unverifiziert gekennzeichnet und zeigt teils ältere Gemini-4-Checkpoints, nicht Argon selbst. Es vermittelt also einen Eindruck des Ausgabestils, liefert aber keinen belastbaren Leistungsbeleg. So zeigt etwa eine Voxel-Demo eine Pagode mit dem Titel „Sakura Pagoda Sanctuary", für die über 106.000 Voxels genannt werden, bei der die Tageszeit dynamisch wechselt.
Ein weiteres Beispiel ist eine SVG-Generierung: Auf Anfrage erzeugte Gemini 4 den Code für einen PlayStation-5-Controller, der wie ein fotorealistisches Produktbild wirkt. Sichtbar sind die typischen Symbole, die Analogsticks und das PlayStation-Logo mit weichen Schatten und Farbverläufen.

Auffällig sind die interaktiven 3D-Welten. Eine Demo zeigt das römische Kolosseum als drehbare 3D-Szene mit simulierten Tag-und-Nacht-Zyklen. Die Beleuchtung und die Perspektive lassen sich dabei dynamisch verändern.

In einem Direktvergleich mit identischem Prompt bauen GPT-6 Astra und Gemini 4 jeweils eine spielbare 3D-Welt über den Wolken, die sich in der Ausführung deutlich unterscheiden. Die geteilte Ansicht zeigt zwei Interpretationen derselben Aufgabe.

Hilft Argon Google bei der nächsten Modellgeneration?
Der Google-Blog beschreibt eine interne Nutzung des Modells: Argon treibt laut Google interne Workflows, tausende Mitarbeitende setzen es ein, etwa Quantenforscher bei der Optimierung von Algorithmen. Ob sich daraus eine beschleunigende Rückkopplungsschleife für künftige Modelle ergibt, ist Spekulation. Ein Beleg für rekursive Selbstverbesserung liegt nicht vor.
Fazit
Gesichert sind die Ankündigung selbst, die Einführungspreise, das Ausgabelimit von einer Million Token und die von Google veröffentlichten Benchmarks mit Rekorden bei DeepSWE v1.1, Vals Index und LVBench. Offen bleiben der Zeitpunkt des öffentlichen Zugangs, die Reproduzierbarkeit der Werte durch unabhängige Stellen und die kolportierten Halluzinationszahlen. Die ersten Community-Demos wirken beeindruckend, sind aber kein Test. Wer das Modell produktiv einsetzen will, sollte auf die Freigabe für API-Kunden und unabhängige Messungen warten.
Quellen
- Gemini 4 Argon Is Google's Most Powerful AI Model + Early Tests! (WorldofAI, YouTube): https://www.youtube.com/watch?v=RMTWayrwYkQ
- Gemini 4 Argon: our next era of frontier intelligence (Google-Blog): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- Post von @AiBattle_ zu Gemini 4 Argon (Ausgabelimit und Reuters-Meldung zur Modellgröße): https://x.com/AiBattle_/status/2105402134313242980
- Post von @LuminaBench (Vier-Modelle-Vergleich der Pagoden-Szene): https://x.com/LuminaBench/status/2104951294842544206
- Post von @YouWareAI (Gemini-4-Demo, deployed on YouWare): https://x.com/YouWareAI/status/2100838090210431302
- Post von @thtbee_ (Community-Demo zu Gemini 4): https://x.com/thtbee_/status/2105320019920080921
- Post von @abhinavflac (Community-Demo zu Gemini 4): https://x.com/abhinavflac/status/2105157825194590477
Autor
Weiterlesen
Claude Opus 5.5 Test: Das neue Top-Modell mit 40% günstigeren Kosten
Claude Opus 5.5 erreicht die Leistung von Claude Fable 5.1 zu 40% niedrigeren Kosten. Benchmark-Ergebnisse, Preisvergleich und Praxiseinsatz im Überblick.
Jev TypeSafe AI: Das System-One-Modell für typisierte Entscheidungen
Jev von TypeSafe AI liefert typisierte Entscheidungen mit kalibrierten Wahrscheinlichkeiten in 70–500 ms. Für Entwickler ein Router für Agenten-Workflows.
Claude Commerce Agents: So verbessern KI-Agenten deinen E-Commerce-Shop
Verständlicher Leitfaden zu Claude Commerce Agents für deutsche Shop-Betreiber: Was sie können, wie die Architektur funktioniert und welche Vorteile sie für Conversion und Kundenservice bieten.
Erstgespräch vereinbaren
Wähle unten einfach einen Termin, der passt: 30 Minuten, in denen wir schauen, wo bei dir Zeit liegen bleibt. Kostenlos und unverbindlich – danach weißt du, ob sich Automatisierung für dich lohnt.
Welcher Prozess kostet dich jede Woche Zeit?
Im kostenlosen Erstgespräch finden wir heraus, welcher Prozess bei dir zuerst automatisiert werden sollte – unverbindlich und ohne Vorbereitung.
Oder direkt schreiben: hallo@kiprozess.com
Lieber erst weiterlesen? Neue Artikel gibt es im Newsletter.