Strategie6 Min.Redaktion

OpenAI bringt GPT-6 Astra auf den Markt, spricht von AGI und verlangt 10 USD pro Million Eingabetokens

Corredor de data center à noite com um único engenheiro em frente a um notebook, luz âmbar de alerta ao fundo.

Das Modell wurde am 3. September mit gestaffelter Freigabe, einem Preisplan ähnlich dem von Claude Fable 5.1 und einem Rekord bei Benchmarks gestartet, den Brockman selbst als generationsübergreifenden Sprung bezeichnete.

OpenAI hat am 3. September GPT-6 Astra mit einem Versprechen gestartet, das seit der Einführung von GPT-4 nicht mehr gemacht wurde: dass das Modell irgendwann als Meilenstein in der Entwicklung der allgemeinen künstlichen Intelligenz angesehen werden könnte. Greg Brockman, Präsident des Unternehmens, bezeichnete die Einführung als "generationsübergreifenden Sprung" und erklärte, dass Astra das Ergebnis von "Jahren der Forschung und großen Wetten" sei. Die Freigabe begann mit einer begrenzten Gruppe von Organisationen im Cybersecurity-Programm des Unternehmens und wird in den kommenden Tagen auf ChatGPT Plus, Pro, Business und Enterprise-Kunden sowie auf die API und AWS ausgeweitet.


Der öffentliche Preis für die API liegt bei 10 USD pro Million Eingabetokens und 50 USD pro Million Ausgabetokens im Standardmodus, mit einem Schnellmodus, der die Geschwindigkeit verdoppelt und den Preis ebenfalls erhöht. Es ist derselbe Preisrahmen, den Anthropic für Claude Fable 5.1, das zwei Tage zuvor eingeführt wurde, verlangt, und etwa 2,5-mal so hoch wie der Aktionspreis von GPT-5 Sol. Die Preiskonvergenz zwischen den beiden größten Laboren beendet praktisch den aggressiven Dumpingzyklus, der das erste Halbjahr dominiert hat.


Gesättigte Benchmarks und der Vorbehalt des Prüfers


OpenAI beansprucht 97,6 % in FrontierMath Tier 4, 99,9 % in ARC-AGI-3 und 100 % in ExploitBench. Diese Zahlen sind entscheidend, da beide Tests so konzipiert wurden, dass sie die Fähigkeiten von Frontlinemodellen übertreffen: sie zu sättigen, signalisiert etwas qualitativ anderes als die Überwindung einer konventionellen Rangliste. Allerdings kommt diese Bewertung mit einem Sternchen. Epoch AI, das FrontierMath verwaltet, hat berichtet, dass OpenAI die Entwicklung des Tests finanziert hat und exklusiven Zugang zu Teilen der Probleme hat. Und die 99,9 % im ARC-AGI-3 hängen von einem teuren staatlichen System ab; stateless Aufrufe über die API liefern niedrigere Werte, bei etwa 98,6 % laut verschiedenen Konfigurationen.


Ohne diese Nuancen liest sich das Release wie ein gewonnener Wettlauf. Mit ihnen ist das Bild ein anderes: Astra belegt die Spitzenplätze im Denken, bei Softwareengineering, Computeranwendung und Cybersecurity, aber das "fast Perfekte" muss im Rahmen der Grenzen gelesen werden, die die Prüfer selbst setzen. Al Jazeera beurteilte die Einführung als Ereignis "vor dem Hintergrund wachsender Überprüfungen", in Anspielung auf die jüngsten Warnungen europäischer und amerikanischer Regulierungsbehörden.


Daybreak tritt ebenfalls in Erscheinung


Am selben Tag hat OpenAI das Programm Daybreak for Frontline Defenders gestartet, mit 1 Milliarde USD an subventionierten Zugangskrediten für die Cybersecurity-Modelle von Daybreak, Schulungen und Partnerschaften für Betreiber grundlegender Dienstleistungen. Die gleichzeitige Ankündigung ist kein Zufall: Astra wird als hochmodern in der Cybersecurity beschrieben, und das Unternehmen weiß, dass es, wenn es ein Modell in die Hände eines zahlenden Kunden gibt, das in der Lage ist, Zero-Days zu finden, sofortige regulatorische Überprüfungen einlädt. Die Anbindung des Releases an eine defensive Initiative ist die strukturierte Antwort.


Überlegungen für Unternehmens-Kunden in den USA und im Vereinigten Königreich


Für den CIO in den USA besteht die praktische Entscheidung darin, zu wissen, ob er Claude Fable 5.1 durch Astra in Code-Pipelines ersetzt, da der Preis gleich ist. Die Antwort hängt vom relativen Gewicht des mathematischen Denkens (wo Astra vorne liegt) gegenüber der Agent-zu-Agent-Latenz und der Nutzung von Tools (wo Anthropic mehr Erfahrung hat) ab. Im Vereinigten Königreich hat die Financial Conduct Authority bereits signalisiert, dass sie unabhängige Bewertungsnachweise verlangen wird, bevor sie Deployments von Frontlinemodellen in regulierten Banken genehmigt, und die teilweise Exklusivität von OpenAI in FrontierMath könnte als Munition für Compliance-Beauftragte dienen, um die Auslagerung von Benchmarks zu fordern.


Es gibt eine unmittelbare sekundäre Wirkung: das Gemini 3.1 Pro von Google, das im Februar mit einem Kontext von 1 Million Tokens eingeführt wurde, hat aufgehört, das Modell mit dem besten Agentenappeal in verschiedenen Bewertungen zu sein. Das Zeitfenster, in dem Sundar Pichai die Führungsansprüche bei Denkbenchmarks argumentieren konnte, hat sich geschlossen. Der nächste Schritt von Google, der vor Ende des Quartals erwartet wird, wird entscheiden, ob die dreifache Parität zwischen OpenAI, Anthropic und Google sich verfestigt oder ob einer der drei wieder bei den Preisen und nicht bei den Fähigkeiten heraussticht.

Die Analyse der Woche, per E-Mail

Eine wöchentliche Ausgabe mit dem, was für Entscheider zählt. Keine Werbung, kein Sponsoring.

Jederzeit mit einem Klick kündbar.

Strategie