Skip to content
Fundamentals8 min

Gemini 4 Argon: Googles Frontier-Modell mit 1M Output-Tokens

Gemini 4 Argon setzt laut Google neue Maßstäbe bei Ausgabelänge und langen agentischen Aufgaben. Der Artikel sortiert Ankündigung, Preise, Benchmarks und erste Demos und trennt Belegtes von Gerüchten.

Contents

Google hat am 30. September 2026 mit Gemini 4 Argon ein neues Frontier-Modell angekündigt. Die auffälligsten Kennzahlen: Das Ausgabelimit steigt von 64.000 auf eine Million Token, die Einführungspreise liegen bei 2 US-Dollar pro Million Input-Token und 10 US-Dollar pro Million Output-Token, und in Googles eigenen Benchmarks erreicht Argon beim Software-Engineering-Test DeepSWE v1.1 77,9 Prozent und damit einen neuen Spitzenwert. Der öffentliche Zugang startet erst schrittweise.

Was ist Gemini 4 Argon und wer bekommt Zugang?

Google kündigte das Modell in einem Blogbeitrag mit dem Titel „Gemini 4 Argon: our next era of frontier intelligence" an. Autor des Beitrags ist Koray Kavukcuoglu, SVP bei Google DeepMind. Der Rollout läuft zunächst über das Fairwind-Programm: Eine erste Kohorte aus Cyber-Verteidigern erhält Zugang, damit sie die Cybersicherheits-Fähigkeiten des Modells einsetzen können. Google arbeitet parallel am freiwilligen US-Regierungs-Prozess für Pre-Release-Modellzugang.

Screenshot eines Posts von Google auf X. Der Text erklärt den Rollout von Gemini 4 Argon an eine erste Kohorte von Cyber-Defendern über das Fairwind-Programm, bevor Entwickler, Unternehmen und Nutzer folgen. Darunter liegt ein Vorschaubild mit der Aufschrift Gemini 4 Argon und der Überschrift unser nächstes Zeitalter frontier intelligence.
Post des Google-Accounts auf X: Gemini 4 Argon wird zunächst über das Fairwind-Programm an eine erste Gruppe von Cyber-Defendern ausgerollt; ein eingebettetes Vorschaubild verlinkt auf den Blogbeitrag „Gemini 4 Argon: our next era of frontier intelligence“.

Danach folgt laut Google eine gestufte Freigabe: zuerst zahlende API-Kunden und Google-AI-Ultra-Abonnenten, dann Entwickler, Unternehmen und Nutzer. Ein Datum für den breiten Rollout nennt Google nicht. Die im Umlauf befindliche Einschätzung, die Veröffentlichung für die breite Öffentlichkeit könne Mitte Oktober erfolgen, ist ein Gerücht ohne Bestätigung.

Über die Modellgröße selbst ist wenig bekannt. Ein Reuters-Bericht, der über X-Posts zitiert wurde, beschreibt Argon auf Angabe eines Unternehmenssprechers als größer als Googles bisherige Reihe der Top-Pro-Modelle. Eine Parameterzahl nennt niemand; kursierende Schätzungen im Billionen-Bereich sind reine Spekulation.

Screenshot eines Posts von AiBattle auf X: Gemini 4 Argon ist größer als frühere Google-Gemini-Pro-Modelle, Quelle Reuters. Darunter ein Zitat mit gelb markierter Stelle, dass das neue Argon-Modell größer ist als Googles bisherige Reihe der Top-Pro-Modelle, so ein Unternehmenssprecher.
Post des Accounts AiBattle auf X mit Verweis auf Reuters: Das Zitat nennt einen Unternehmenssprecher mit der Aussage, das neue Argon-Modell sei größer als Googles bisherige Reihe der Top-Pro-Modelle. Die Angabe ist eine Agenturmeldung, kein geprüftes Faktum.

Was kostet Gemini 4 Argon?

Die Einführungspreise liegen laut Google-Ankündigung bei 2 US-Dollar pro Million Input-Token und 10 US-Dollar pro Million Output-Token. Cached Input kostet mit 0,10 US-Dollar 95 Prozent weniger. Nach der Einführungsphase steigen die Preise auf 4 US-Dollar beziehungsweise 20 US-Dollar pro Million Token.

Die Einordnung über reine Token-Preise hinaus liefert die Analyseplattform Artificial Analysis. Dort kostet ein Intelligence-Index-Task mit Argon 1,99 US-Dollar. Das liegt unter GPT-6 Astra (3,26 US-Dollar), Claude Opus 5.5 (5,98 US-Dollar) und Claude Fable 5.1 (7,63 US-Dollar), deutlich über GPT-6.1 Sol, das mit 0,72 US-Dollar den günstigsten Wert dieser Modellgruppe hat. Argon liegt also im Preis-Leistungs-Verhältnis vorn, ist aber nicht das billigste Frontier-Modell.

Balkendiagramm von Artificial Analysis mit gestapelten Balken und Dollar-Beträgen pro Task über jedem Balken. Sichtbar sind Werte von 0,60 bis 7,63 US-Dollar, darunter Gemini 4 Argon mit 1,99, GPT-6 Astra mit 3,26, Claude Opus 5.5 mit 5,98 und Claude Fable 5.1 mit 7,63 US-Dollar.
Preisvergleich von Artificial Analysis: Kosten pro Intelligence-Index-Task für verschiedene Modelle, darunter Gemini 4 Argon mit 1,99 US-Dollar, GPT-6 Astra mit 3,26 und GPT-6.1 Sol mit 0,72 US-Dollar.

Was kann das Modell laut Google?

Eine Million Output-Tokens

Die größte technische Neuerung betrifft die Ausgabelänge: Google erhöht das maximale Output-Limit von 64.000 auf eine Million Token. Das Ziel sind lange, agentische Aufgaben, in denen das Modell über hunderttausende Token hinweg in einer einzigen Trajektorie arbeitet, also ohne dass der Kontext zwischenzeitlich verworfen wird.

Screenshot eines Posts von AiBattle auf X mit dem Text: Gemini 4 Argon hat ein Ausgabelimit von einer Million Token, zuvor 64.000. Darunter ein Zitat mit gelb markierten Passagen zur Erweiterung des Ausgabelimits auf eine Million Token.
Post des Accounts AiBattle auf X zum Ausgabelimit: Ein Zitat mit gelber Markierung nennt die Erweiterung auf eine industrieführende Million Token, gegenüber zuvor 64.000 Token.

Benchmarks

Die von Google veröffentlichten Benchmarks zeigen Argon vor allem bei langen agentischen Aufgaben vorn. Die Methodik und alle Werte stammen von Google beziehungsweise Google DeepMind, eine unabhängige Reproduktion steht bislang aus.

  • DeepSWE v1.1: Gemini 4 Argon 77,9 %; GPT-6 Astra 74,1 %; Claude Fable 5.1 67,4 %; Claude Opus 5.5 74,2 %
  • Vals Index: Gemini 4 Argon 68,9 %; GPT-6 Astra 63,1 %; Claude Fable 5.1 65,8 %; Claude Opus 5.5 67,0 %
  • Vals Finance Agent v2: Gemini 4 Argon 65,4 %; GPT-6 Astra 53,5 %; Claude Fable 5.1 58,9 %; Claude Opus 5.5 58,6 %
  • Harvey's Legal Agent Benchmark: Gemini 4 Argon 19,6 %; GPT-6 Astra 5,4 %; Claude Fable 5.1 6,7 %; Claude Opus 5.5 3,8 %
  • AutomationBench: Gemini 4 Argon 51,3 %; GPT-6 Astra 41,4 %; Claude Fable 5.1 31,4 %; Claude Opus 5.5 42,5 %
  • LVBench: Gemini 4 Argon 91,7 %; GPT-6 Astra 87,5 %; Claude Fable 5.1 79,7 %; Claude Opus 5.5 83,7 %
  • Terminal-bench 4.0: Gemini 4 Argon 57,4 %; GPT-6 Astra 58,2 %; Claude Fable 5.1 57,9 %; Claude Opus 5.5 66,4 %
  • FrontierSWE v2: Gemini 4 Argon 55,0 %; GPT-6 Astra 65,5 %; Claude Fable 5.1 56,3 %; Claude Opus 5.5 62,3 %

Der auffälligste Einzelwert steht beim Software-Engineering: Beim Benchmark DeepSWE v1.1 für langfristige Softwareentwicklung erreicht Argon 77,9 Prozent und liegt damit vor Claude Opus 5.5 (74,2 Prozent), GPT-6 Astra (74,1 Prozent) und Claude Fable 5.1 (67,4 Prozent). Google bezeichnet das als neuen State of the Art in diesem Bereich.

Balkendiagramm mit dem Titel DeepSWE v1.1, Untertitel langfristige Softwareentwicklung, höher ist besser. Vier Balken: Gemini 4 Argon 77,9 Prozent, Claude Opus 5.5 74,2 Prozent, GPT-6 Astra 74,1 Prozent, Claude Fable 5.1 67,4 Prozent.
Balkendiagramm DeepSWE v1.1 mit Fußzeile auf deepmind.google: Gemini 4 Argon liegt mit 77,9 Prozent vor Claude Opus 5.5 (74,2), GPT-6 Astra (74,1) und Claude Fable 5.1 (67,4).

Bei der Wissensarbeit führt Argon laut Google den Vals Index mit 68,9 Prozent, den Vals Finance Agent v2 mit 65,4 Prozent und den Harvey's Legal Agent Benchmark mit 19,6 Prozent. Bei AutomationBench, einem Test für End-zu-End-Geschäftsabläufe, nennt Google 51,3 Prozent und Rang eins. Im Multimodalen erreicht Argon beim Video-Verständnistest LVBench 91,7 Prozent, ebenfalls ein neuer Spitzenwert laut Google.

Der unabhängige Vergleich durch Artificial Analysis ordnet das Modell im Intelligence Index v4.3.2 (zusammengesetzt aus zehn Evals) mit 53 Punkten ein. GPT-6.1 Sol liegt im selben Chart bei 52 Punkten. Dabei kostet ein Argon-Task nur rund 60 Prozent dessen, was GPT-6 Astra veranschlagt.

Wo liegen die Schwächen?

Bei klassischem Coding führt Argon nicht. Beim Terminal-bench 4.0 liegt Claude Opus 5.5 mit 66,4 Prozent klar vor Argon (57,4), beim FrontierSWE v2 führt GPT-6 Astra mit 65,5 Prozent (Argon: 55,0), und beim Computer-Use-Test OSWorld-2.0 liegt Astra mit 72,6 vor Argon mit 69,2. Auch beim Preis wird Argon von GPT-6.1 Sol unterboten.

Umlaufende Angaben zu einer Halluzinationsrate von 15 Prozent für Argon, der niedrigsten, die Artificial Analysis je gemessen habe, lassen sich anhand des vorliegenden Materials nicht bestätigen. Sie tauchen auf keiner Folie und in keinem verlinkten Diagramm auf. Auch die Einschätzung, Argon sei kein Spitzen-Coding-Modell, aber ein guter Alltags-Begleiter, ist Meinung, kein Fakt. Die Position im Vergleich der Frontier-Modelle kann sich zudem ändern, sobald unabhängige Tests vorliegen.

Was zeigen die ersten Community-Tests?

Eine Reihe von Demos aus Arena und Community-Accounts kursiert bereits. Wichtig vorab: Das Material stammt von Dritten, ist als von Nutzern erzeugt und unverifiziert gekennzeichnet und zeigt teils ältere Gemini-4-Checkpoints, nicht Argon selbst. Es vermittelt also einen Eindruck des Ausgabestils, liefert aber keinen belastbaren Leistungsbeleg. So zeigt etwa eine Voxel-Demo eine Pagode mit dem Titel „Sakura Pagoda Sanctuary", für die über 106.000 Voxels genannt werden, bei der die Tageszeit dynamisch wechselt.

Ein weiteres Beispiel ist eine SVG-Generierung: Auf Anfrage erzeugte Gemini 4 den Code für einen PlayStation-5-Controller, der wie ein fotorealistisches Produktbild wirkt. Sichtbar sind die typischen Symbole, die Analogsticks und das PlayStation-Logo mit weichen Schatten und Farbverläufen.

Frontalansicht eines weiß-schwarzen Gamecontrollers mit PlayStation-Symbolen: Steuerkreuz links, vier Symboltasten rechts, zwei Analogsticks in der Mitte und das PlayStation-Logo, auf weißem Hintergrund mit weichem Schatten.
Generierte Darstellung eines PlayStation-5-Controllers: Das als SVG erzeugte Bild zeigt die typischen Symbole, Analogsticks und das PlayStation-Logo mit weichen Schatten und Farbverläufen.

Auffällig sind die interaktiven 3D-Welten. Eine Demo zeigt das römische Kolosseum als drehbare 3D-Szene mit simulierten Tag-und-Nacht-Zyklen. Die Beleuchtung und die Perspektive lassen sich dabei dynamisch verändern.

Animation einer 3D-Visualisierung des römischen Kolosseums aus der Vogelperspektive mit mehreren Infoboxen über dem Modell. Der Titel The Roman Colosseum ist oben links eingeblendet.
Interaktive 3D-Ansicht des römischen Kolosseums: Die Animation zeigt den Innenraum mit Rängen und Arena aus wechselnden Perspektiven; eingeblendete Infoboxen tragen den Titel The Roman Colosseum. Der Clip stammt von einem früheren Gemini-4-Checkpoint und nicht von Argon selbst.

In einem Direktvergleich mit identischem Prompt bauen GPT-6 Astra und Gemini 4 jeweils eine spielbare 3D-Welt über den Wolken, die sich in der Ausführung deutlich unterscheiden. Die geteilte Ansicht zeigt zwei Interpretationen derselben Aufgabe.

Vergleichsmontage mit zwei Browserfenstern auf gelbem Grund. Überschrift GPT-6 Astra gegen Gemini 4, darunter links die Astra-Ausgabe und rechts die Gemini-4-Ausgabe einer 3D-Szene mit schwebenden Inseln; unten der Untertitel zwei Interpretationen einer spielbaren Welt über den Wolken.
Gegenüberstellung zweier Ausgaben zum selben Prompt: Links das Ergebnis von GPT-6 Astra, rechts das von Gemini 4, jeweils als spielbare Szene mit schwebenden Inseln über den Wolken. Die Demo zeigt den Ausgabestil eines Checkpoints, keine Messung gegen Argon.

Hilft Argon Google bei der nächsten Modellgeneration?

Der Google-Blog beschreibt eine interne Nutzung des Modells: Argon treibt laut Google interne Workflows, tausende Mitarbeitende setzen es ein, etwa Quantenforscher bei der Optimierung von Algorithmen. Ob sich daraus eine beschleunigende Rückkopplungsschleife für künftige Modelle ergibt, ist Spekulation. Ein Beleg für rekursive Selbstverbesserung liegt nicht vor.

Fazit

Gesichert sind die Ankündigung selbst, die Einführungspreise, das Ausgabelimit von einer Million Token und die von Google veröffentlichten Benchmarks mit Rekorden bei DeepSWE v1.1, Vals Index und LVBench. Offen bleiben der Zeitpunkt des öffentlichen Zugangs, die Reproduzierbarkeit der Werte durch unabhängige Stellen und die kolportierten Halluzinationszahlen. Die ersten Community-Demos wirken beeindruckend, sind aber kein Test. Wer das Modell produktiv einsetzen will, sollte auf die Freigabe für API-Kunden und unabhängige Messungen warten.

Quellen

  • Gemini 4 Argon Is Google's Most Powerful AI Model + Early Tests! (WorldofAI, YouTube): https://www.youtube.com/watch?v=RMTWayrwYkQ
  • Gemini 4 Argon: our next era of frontier intelligence (Google-Blog): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
  • Post von @AiBattle_ zu Gemini 4 Argon (Ausgabelimit und Reuters-Meldung zur Modellgröße): https://x.com/AiBattle_/status/2105402134313242980
  • Post von @LuminaBench (Vier-Modelle-Vergleich der Pagoden-Szene): https://x.com/LuminaBench/status/2104951294842544206
  • Post von @YouWareAI (Gemini-4-Demo, deployed on YouWare): https://x.com/YouWareAI/status/2100838090210431302
  • Post von @thtbee_ (Community-Demo zu Gemini 4): https://x.com/thtbee_/status/2105320019920080921
  • Post von @abhinavflac (Community-Demo zu Gemini 4): https://x.com/abhinavflac/status/2105157825194590477

Author

Florian AlbertFounder & editor

Has spent over a decade at the intersection of performance marketing and automation, building AI systems for mid-market companies and agencies.

FA

Keep reading

Book an intro call

Simply pick a slot below: 30 minutes where we look at where your time is going. Free and without obligation – afterwards you will know whether automation is worth it for you.

Which process costs you time every week?

In a free intro call we figure out which of your processes should be automated first – no commitment, no preparation needed.

Or write directly: hallo@kiprozess.com

Rather keep reading? New articles land in the newsletter.