DeepSeek lanceert tweedaagse bètatest voor V4.1 Flash: nieuwe architectuur met native multimodale ondersteuning

Het Chinese AI-bedrijf DeepSeek opende op de middag van 8 september stilletjes een beperkte bètatest voor zijn tussentijdse testversie V4.1 Flash. Ontwikkelaars hoeven alleen de model-ID te wijzigen naar deepseek-v4.1-flash-expires-on-0910 om API-aanroepen te starten. Zoals de naam al aangeeft, gaat deze testversie op 10 september automatisch offline: een testvenster van slechts twee dagen.

Het meest opvallende aan deze bèta is niet dat DeepSeek “weer een model heeft uitgebracht”, maar de “volledig nieuwe modelarchitectuur” die in de officiële documentatie wordt benadrukt. De V4-serie gebruikt de bestaande architectuur, terwijl V4.1 Flash een herstructurering op architectuurniveau heeft ondergaan. Tegelijkertijd worden multimodale mogelijkheden nu natief ondersteund: tekst-, beeld- en audio-invoer worden op uniforme wijze verwerkt, in plaats van te leunen op een los toegevoegd Vision-uitbreidingspakket, zoals V4 Flash doet voor beeld- en tekstinvoer. Daarmee is deze upgrade een architectuurvernieuwing, en niet alleen een aanpassing van parameters.

Voor ontwikkelaars is de drempel extreem laag: de base_url blijft ongewijzigd en alleen de modelnaam hoeft te worden vervangen. De prijs is identiek aan die van V4 Flash, zonder extra kosten voor de bèta. Volgens de officiële prijslijst bedragen de tarieven per miljoen tokens tijdens daluren $0,007 voor cache-hits en $0,22 voor cache-misses, met $0,66 voor output. Tijdens piekuren worden de tarieven overal verdubbeld. De officiële prijs in RMB wordt overeenkomstig vermeld als ¥0,05, ¥1,5 en ¥4,5.

De onderstaande tabel vat de vier opties samen die momenteel op de officiële prijslijst van de V4-serie staan, met prijzen in USD per miljoen tokens tijdens daluren:

ModelParameters (totaal / actief per token)GelijktijdigheidslimietInput · Cache-hitInput · Cache-missOutput
V4.1 Flash (bèta, offline op 9/10)Niet bekendgemaakt20$0,007$0,22$0,66
V4 Flash284B / 13B2.500$0,007$0,22$0,66
V4 Flash Vision ExpNiet afzonderlijk bekendgemaakt2.500$0,007$0,22$0,66
V4 Pro1,6T / 49B500$0,022$0,66$1,98

Opmerking: alle vier de modellen hebben een contextlengte van 1 miljoen tokens en een maximale output van 384.000 tokens; de aantallen parameters komen overeen met de cijfers uit de preview-release van 24 april.

Indrukwekkende snelheidsbenchmarks, maar de gelijktijdigheidslimiet verraadt de positionering

De meest direct merkbare verandering voor ontwikkelaars is de uitvoersnelheid. Meerdere gebruikers op X hebben benchmarkgegevens gedeeld, waarbij de hoogste gemeten uitvoersnelheid uitkwam op 507 tokens per seconde. Eén ontwikkelaar noteerde 328 tokens per seconde terwijl het model een SVG-animatie genereerde van een pelikaan op een fiets. Andere meldingen geven aan dat de gemiddelde uitvoersnelheid doorgaans boven de 300 tokens per seconde ligt. V4 Flash stond al bekend om zijn snelheid, en V4.1 Flash vergroot dat voordeel nog verder.

Een beperking die gemakkelijk over het hoofd wordt gezien, is echter de concurrency-cap. De bètaversie biedt slechts 20 gelijktijdige verzoeken per account, tegenover 2.500 voor de productieversie van V4 Flash en 500 voor V4 Pro. Dat maakt duidelijk dat DeepSeek niet wil dat ontwikkelaars productiewerk op de bèta draaien. Twintig gelijktijdige verzoeken zijn voldoende voor functionele validatie en prestatie-evaluatie, maar niet voor stresstests of verkeer op schaal.

Halftarieven hangen af van iemands werktijden

DeepSeek definieert piekuren als maandag tot en met vrijdag in Beijing-tijd van 09:00 tot 12:00 en van 14:00 tot 18:00. Omgerekend is dat 01:00 tot 04:00 en 06:00 tot 10:00 UTC. Alle andere tijden — inclusief het hele weekend — worden tegen de helft van de prijs gefactureerd. Eenzelfde werklast op een ander tijdstip kan dus resulteren in een rekening die twee keer zo hoog of juist half zo hoog uitvalt. Voor teams in verschillende tijdzones heeft dit heel uiteenlopende gevolgen:

RegioPiekuren (lokale tijd, ma-vr)Gevolg voor ontwikkelteams
Taipei09:00–12:00, 14:00–18:00Bijna volledige overlap met werktijden
Tokio10:00–13:00, 15:00–19:00Dekt ook vrijwel de hele werkdag
Noord-AmerikaValt tussen lokale avond en vroege ochtendNormale kantooruren vallen volledig binnen daluurtarief

Met andere woorden: teams in de VS krijgen tijdens kantooruren al de helft van de prijs wanneer ze de API gebruiken, terwijl teams in Taiwan en Japan batchtaken laat in de nacht of in het weekend moeten plannen om van hetzelfde tarief te profiteren. Voor agentgebaseerde producten met langlopende geplande taken is dit geen voetnoot op de prijslijst, maar een parameter die direct van invloed is op de planning.

Het echte doel van de bèta: testen of V4 Pro vervangbaar is

Het analysebureau AGI Zhilu wijst erop dat V4 Pro sterke redeneercapaciteiten biedt, maar tegen een hoge prijs, waardoor het minder geschikt is voor scenario’s met veel verkeer. De oudere Flash-variant is goedkoop en snel, maar schiet tekort op het gebied van complexe redenering en native multimodaliteit. Als de productieversie van V4.1 Flash “bijna-Pro-prestaties tegen Flash-prijzen” kan leveren, dan zouden veel consumentgerichte applicaties en agentproducten mogelijk kunnen overstappen van het dure vlaggenschipmodel.

De prijslijst zelf laat de omvang van dat verschil duidelijk zien: de outputprijs van V4 Pro is drie keer zo hoog als die van Flash, terwijl de gelijktijdigheidslimiet slechts een vijfde bedraagt. Voor producten met veel verkeer bepaalt het vermogen om workloads van Pro naar Flash te verplaatsen rechtstreeks de kostenstructuur per eenheid.

DeepSeek heeft tegelijk een anonieme feedbackenquête gelanceerd, waarvan één van de vier onderdelen specifiek gaat over “het testen van de vervangbaarheid van V4 Pro”. Dat laat zien wat de kernvraag is die DeepSeek wil beantwoorden: zijn ontwikkelaars die nu Pro gebruiken bereid om over te stappen op de goedkopere Flash-serie?

  • Eater

    vraag en ik antwoord

    Related Posts

    DeepSeek lanceert tweedaagse bètatest voor V4.1 Flash: nieuwe architectuur met native multimodale ondersteuning

    Het Chinese AI-bedrijf DeepSeek opende op de middag van 8 september stilletjes een beperkte bètatest voor zijn tussentijdse testversie V4.1 Flash. Ontwikkelaars hoeven alleen de model-ID te wijzigen naar deepseek-v4.1-flash-expires-on-0910…

    Kling AI-review: deze AI-video’s zijn verontrustend levensecht

    Deze uitleg komt via Unite.AI Heb je je ooit afgevraagd hoe je een idee kunt omzetten in een filmische video, zonder camera’s, acteurs of montagesoftware? Dankzij AI wordt die fantasie…

    Geef een reactie