Strategie6 Min.Redaktion

StepFun: Step 5 Preview, 600B Modell für 1 US$ pro Mio.

Prédio de data center visto da via de perímetro de um parque industrial nos arredores de Xangai, com unidades de refrigeração no telhado e cerca de tela em primeiro plano.

MoE-Modell mit 600 Milliarden Parametern und 1 Mio. Kontext erzielt 33,3% im Terminal-Bench 4.0 und kostet 1,00 US$ pro Million Tokens.

StepFun hat die API des Step 5 Preview am 20. September eröffnet, am selben Tag, an dem das Modell angekündigt wurde. Es sind 600 Milliarden Parameter in sparsamer MoE-Architektur, 27 Milliarden aktiv pro Token und ein Kontextfenster von 1 Million, mit Eingaben für Text, Bild und Video. Der Preis in der hauseigenen API des Unternehmens beträgt 1,00 US$ pro Million Eingabetokens bei Cache Miss, 0,05 US$ bei Cache Hit und 2,70 US$ pro Million Ausgabetokens, wobei Denk-Tokens als Ausgabe abgerechnet werden, so das veröffentlichte Material des Unternehmens.


Die Artificial Analysis bewertete das Modell mit 44 im Intelligence Index v4.3, dieselbe Punktzahl wie der Kimi K3 und einen Punkt unter GLM-5.3 sowie Claude Opus 5. Das DeepSeek V4.1 Flash, veröffentlicht zehn Tage zuvor, erreichte 40. Der relevante Unterschied liegt nicht im aggregierten Index. Im Terminal-Bench 4.0, der Terminalaufgaben in mehreren Phasen misst, erzielte der Step 5 Preview 33,3% im Vergleich zu etwa 12,6% beim Kimi K3 und 26,8% beim DeepSeek V4.1 Flash. Im SciCode liegen die beiden Ersten bei 59% gleichauf. Die gemessene Ausgabegeschwindigkeit betrug 99,8 Tokens pro Sekunde, im Vergleich zur Median von 64,6 unter den von derselben Firma verfolgten Modellen.


Der Preis ist das Argument


Ein Modell, das im aggregierten IQ mit dem Kimi K3 gleichzieht und 1,00 US$ für die Eingabe verlangt, verändert die Kalkulation für Betreiber von Produktionsagenten. Laut der Messung von Artificial Analysis beträgt der Preis für den Step 5 Preview etwa ein Siebtel des GPT-5.6 Sol-Preises. Für ein Team, das einen Ingenieure-Agenten über ein großes Repository betreibt, ist jedoch eine andere Zahl entscheidend: 0,05 US$ pro Million Tokens bei Cache Hit. Ein agentenbasierter Loop liest denselben Kontext dutzende Male pro Aufgabe, und in diesem Wiederholungseffekt summiert sich die Rechnung.


StepFun hat mitgeteilt, dass die vollständigen Gewichte am 15. Oktober veröffentlicht werden. Das ist der Punkt, der einen Launch von einer Preisankündigung unterscheidet. Ein europäisches oder brasilianisches Unternehmen, das keine Daten an einen in China gehosteten Endpunkt senden kann, bleibt weiterhin ausgeschlossen von der Nutzung der API, kann jedoch die Gewichte herunterladen und das Modell in der eigenen Infrastruktur betreiben, im Rahmen der Daten, die es bereits besitzt. Auf diesem Weg und nicht über die API haben DeepSeek und Qwen 2026 in Westliche Unternehmenskonzeptionen aufgenommen.


Es gibt einen Vorbehalt, den das Benchmark-Blatt nicht abdeckt. Step 5 Preview ist, wie der Name schon sagt, eine Vorschau: StepFun hat keine Daten zur Verfügbarkeit, zu den Anforderungsgrenzen pro Minute oder zu Versionen in einem stabilen Zustand veröffentlicht. Für eine Bank, die einen Agenten mit vertraglichem SLA in Betrieb nimmt, wiegt das mehr als ein Punkt im Intelligence Index.


Wo die Rechnung sich ändert, von Bangalore bis São Paulo


In den Vereinigten Staaten hat der sofortige Effekt Auswirkungen auf die Marge derjenigen, die Tokens verkaufen. OpenAI und Anthropic bewerten Grenzkapazitäten, und ein offenes Modell, das 33,3% im Terminal-Bench für 1,00 US$ bei der Eingabe liefert, ersetzt nicht die Spitzenleistung. Es zieht den amerikanischen Laboren den Bereich der repetitiven Agentenarbeit ab, der das größte Volumen darstellt und den kontinuierlichen Tokenverbrauch über den Monat aufrecht erhält.


In Indien, wo TCS, Infosys und Wipro die Lieferung rund um agentenbasierte Pipelines neu gestalten, ist die Kosten pro Token eine direkte Kostenlinie des Vertrags. Ein Rückgang um eine Größenordnung bei den Inferenzkosten zeigt sich in der Bruttomarge des folgenden Quartals oder im Preis, der dem Kunden berechnet wird. Die Branchengeschichte zeigt, dass sich dies in beiden Fällen mit einer Verzögerung von ein oder zwei Quartalen zwischen den beiden bemerkbar macht.


In Brasilien ist das Nadelöhr bei Agentenprojekten in Banken und Versicherungen selten die Modellqualität. Es sind die Kosten pro Interaktion in Operationen mit zig Millionen von Kunden, kombiniert mit der Anforderung, sensible Daten im Land zu halten. Offene Gewichte, die in der lokalen Cloud betrieben werden, lösen beide Probleme auf einmal. Daher ist der 15. Oktober für den CIO, der den Fahrplan für 2027 hier erstellt, wichtiger als der 20. September.


StepFun hat Software-Engineering, langfristige agentenbasierte Aufgaben, Fachwissen und Finanzen als deklarierte Zielbereiche des Modells aufgeführt. Keiner der vier ist ein Chatbot. Was die chinesischen Labore in diesem Moment anstreben, ist nicht die Konversation, sondern die Ausführung im Hintergrund, die nach Token abgerechnet und in Arbeitsstunden gemessen wird, die nicht mehr von Menschen geleistet werden. Das Unentschieden bei 44 Punkten wird irrelevant, wenn eine der beiden Seiten drei Wochen später die Gewichte veröffentlicht.

Die Analyse der Woche, per E-Mail

Eine wöchentliche Ausgabe mit dem, was für Entscheider zählt. Keine Werbung, kein Sponsoring.

Jederzeit mit einem Klick kündbar.

Strategie