Strategie5 Min.Redaktion

DeepSeek V4.1 Flash: 1 Mio Tokens bei 0,60 USD pro Mio

Analista jovem em pé diante de duas telas em consultoria paulistana pela manhã, comparando planilha de custo por token e console da API da DeepSeek, com caderno aberto e setas desenhadas a mão.

DeepSeek stellt am 10. September V4.1 Flash vor. 552B MoE-Architektur, 1M Kontext-Tokens, automatisches Routing am 14. September.

Neuer Flash, neue Preisschwelle


DeepSeek hat am Dienstag, dem 9. September, das Modell V4.1 Flash angekündigt, das ab 12 Uhr Pekinger Zeit am 10. September (04:00 UTC) verfügbar ist. Der Preistarif trat zur gleichen Zeit in Kraft. Außerhalb der Spitzenzeiten kostet der V4.1 Flash 0,15 USD pro Million uncacheder Eingabetokens, 0,003 USD pro Million gecachter Eingabetokens und 0,60 USD pro Million Ausgabetokens. In Spitzenzeiten, zwischen 1 und 4 Uhr sowie zwischen 6 und 10 Uhr UTC an Werktagen, verdoppeln sich die Werte. Ab dem 14. September wird jeder an deepseek-v4-pro gerichtete Aufruf automatisch zum Flash umgeleitet, wobei die günstigste Gebühr gilt.


Wie es innen aussieht


Asymmetrische Causal Encoder-Decoder-Architektur mit insgesamt 552 Milliarden Parametern, davon sind lediglich 8 Milliarden beim Verarbeiten von Eingaben aktiv und 16 Milliarden bei der Generierung von Ausgaben. Kontextfenster von bis zu 1 Million Tokens. Natives multimodales Verständnis von Text und Bild. Es ist das kleinste Modell der neuen Architektur von DeepSeek, das für kostengünstigere Inferenzen und eine spätere Skalierung ausgelegt ist. Laut einer öffentlichen Bewertung von AlphaSignal übertrifft der V4.1 Flash das vorherige Flaggschiff des Unternehmens bei nur einem Viertel der Speicherkosten.


In durch Dritte zusammengetragenen Benchmarks liegt der Flash gleichauf oder in Schlagdistanz zu GPT-5.6 Sol und Claude Opus 5 in Programmier- und Agentennutzungstests. In wissensintensiven Bewertungen wie HLE und in einigen Terminal- und Programmierprüfungen haben die beiden westlichen Modelle weiterhin einen klaren Vorteil. DeepSeek hat bisher keinen offiziellen technischen Bericht oder Benchmark-Tabellen veröffentlicht, sodass ein Teil der Informationen auf die nächste Welle von unabhängigen Replikationen warten muss.


Was sich für KI-Käufer in den nächsten zwei Wochen ändert


Der Preisdruck für das Grenzmodell mit 1 Million Kontext-Tokens und multimodalen Fähigkeiten ging auf 0,60 USD pro Million Ausgabetokens zurück. Anthropic verlangt 10 USD pro Million Eingaben und 50 USD pro Million Ausgaben im Fable 5.1. OpenAI verlangt ähnliche Preise im Astra. Der Unterschied beträgt eine Größenordnung.


Die sofortige Auswirkung zielt auf drei Gespräche. Das erste betrifft die massenhafte Agentenarbeit. Mittelständische Beratungsunternehmen, die ihre Orchestrierungsschicht auf Sonnet oder Fable aufgebaut haben, werden in der nächsten Woche die Kalkulation in drei Szenarien überarbeiten. Ein Betrieb, der 20% des Volumens für DeepSeek in weniger risikobehafteten Aufgaben (Zusammenfassungen, Extraktionen, Texttransformationen) umleitet, verändert die monatlichen Infrastrukturkosten erheblich. Ein großer Teil der Unternehmensarbeit mit LLM erfordert nicht die oberste Reihe westlicher Anbieter, und der V4.1 Flash ist für dieses Segment konzipiert.


Das zweite betrifft Souveränität und Beschaffung. Europäische Banken, die unter dem AI Act und dem Datenschutzrecht GDPR operieren, benötigen eine vertragliche Garantie vom Anbieter, die heute schwerer von DeepSeek zu erhalten ist. Enterprise-Käufer in den USA prüfen zuständigkeitsspezifische Einschränkungen für Modelle chinesischer Herkunft in Pipelines, die mit sensiblen Daten verbunden sind, eine Diskussion, die an Bedeutung gewonnen hat nach dem Paket der Biden-Administration zur fortschrittlichen Berechnung und den Exportbeschränkungen für Chips. Brasilianische Multis, die in den drei Märkten agieren, müssen mehrere Modelle in Produktion betreiben, mit einer Routing-Politik basierend auf Datentyp und Jurisdiktion.


Das dritte Thema ist der Fahrplan. Das automatische Routing von deepseek-v4-pro zum Flash ab dem 14. September ist das Format, das Anthropic und OpenAI bisher vermieden haben. Transparente Abwertung aufgrund der Kostensenkung, während die Kundenverträge zum neuen Tarif eingehalten werden. Wenn dies funktioniert, wird es die Markterwartungen darüber verändern, was Enterprise-Käufer von einer Kontinuität erwarten können, wenn ein Anbieter eine günstigere Generation seiner eigenen Produktlinie auf den Markt bringt.


Was der Vorstand hören muss


Der Preisverfall pro Token ist nicht unbegrenzt. Die Schulungskosten steigen weiter, und jede neue Infrastrukturrunde gedrückt die Kosten für die Inferenzen am Ende, nicht zu Beginn des Zyklus. Verschiedene Analysten betrachten einen Teil des Capex für Schulungen als vorübergehend, aber Anthropic und Google operieren weiterhin mit Marge, was die Lesart von derjenigen trennt, die für Labore gilt, die Risikokapital verbrennen. Was der Flash 4.1 zeigt, ist, dass die Preisschwelle für multimodale Arbeiten mit 1 Million Tokens in einer Woche gefallen ist. Wer im Oktober einen mehrjährigen Vertrag unterschreiben möchte, sollte eine automatische Anpassungsklausel bei fallenden Referenzpreisen verlangen. Es ist dieselbe Klausel, die Käufer von Commodities in den 1990er Jahren gefordert haben. Es ergibt jetzt wieder Sinn für KI.

Die Analyse der Woche, per E-Mail

Eine wöchentliche Ausgabe mit dem, was für Entscheider zählt. Keine Werbung, kein Sponsoring.

Jederzeit mit einem Klick kündbar.

Strategie