Le 10 septembre 2026, DeepSeek a officiellement lancé le modèle DeepSeek V4.1 Flash. Il s’agit du modèle le plus compact de la nouvelle génération, tout en offrant une capacité native de compréhension des images et en surpassant les modèles phares, notamment V4 Pro, dans plusieurs tests clés.

Une nouvelle architecture asymétrique : coûts réduits et haut niveau d’intelligence

V4.1 Flash repose sur une architecture MoE de 552 milliards de paramètres, dotée d’une toute nouvelle structure Causal-Encoder-Decoder. Sa principale particularité réside dans l’asymétrie entre l’entrée et la sortie : lors de la lecture des données d’entrée, seuls 8 milliards de paramètres sont activés, contre 16 milliards lors de la génération de la réponse, ce qui réduit considérablement les coûts par rapport aux modèles de taille comparable.

Le modèle se compose de 40 couches Transformer : les 20 premières constituent l’encodeur causal et les 20 dernières le décodeur. Le cache KV global du décodeur est directement projeté depuis la dernière couche de l’encodeur, ce qui réduit fortement la charge de calcul lors de l’étape de préremplissage.

Un cache compressé au maximum et des coûts nettement réduits

Cette nouvelle génération réalise une avancée majeure en matière d’efficacité du cache KV : par rapport au précédent V4 Flash, les besoins en HBM sont réduits de 4 fois et ceux en SSD de 8 fois. Selon le développeur, par rapport à la toute première génération V1, le volume du cache KV a été réduit de 437 fois.

C’est particulièrement important pour les scénarios agentiques, où les coûts liés aux accès au cache représentent une part importante des dépenses et où sa compression permet donc de réduire directement le coût d’utilisation.

Des performances supérieures à celles du modèle phare

Dans les benchmarks, V4.1 Flash a dépassé V4 Pro en matière de performances. Dans le test Terminal-Bench 2.1, le nouveau modèle a obtenu 90.6 points, contre 87.9 pour V4 Pro et 82.7 pour l’ancien V4-Flash. Dans le test plus complexe Terminal-Bench 3.0, l’écart devient spectaculaire : 30.0 contre 11.8 et 7.6 respectivement.

Dans DeepSWE v1.1 (développement logiciel), le résultat atteint 74.2, contre 62.7 pour V4 Pro. Au classement Codeforces, le modèle atteint 3471 points, dépassant les 3348 points de V4 Pro. Dans le domaine de la cybersécurité (CyberGym), il obtient 88.1 contre 83.3.

Ainsi, dans l’utilisation du terminal, la génération de code et la cybersécurité — des scénarios clés pour les agents — V4.1 Flash devance nettement ses prédécesseurs.

API et tarifs

V4.1 Flash est déjà disponible via l’API DeepSeek : il suffit d’indiquer le nom du modèle deepseek-flash. Les tarifs ont également été réduits : pendant les heures creuses, l’entrée (accès au cache) coûte environ 0,0026 euro, une absence dans le cache environ 0,13 euro et la sortie environ 0,51 euro. Pendant les heures de pointe, le tarif est deux fois plus élevé, tandis qu’il est deux fois plus bas durant les heures creuses.

Les anciens modèles V4 Flash et V4 Flash Vision Exp ont été désactivés, mais, pour assurer la compatibilité, les anciens noms de modèles sont temporairement redirigés vers V4.1 Flash.

Qu’en est-il de V4 Pro ?

Selon les dernières informations, en réponse aux demandes des utilisateurs, DeepSeek a décidé de continuer à proposer l’API V4 Pro après le 14 septembre, avec une tarification inchangée. Il était auparavant prévu de rediriger automatiquement les requêtes adressées à V4 Pro vers V4.1 Flash.

Pour les lecteurs qui suivent les évolutions dans le domaine de la construction et de l’impression 3D, la capacité multimodale native de V4.1 Flash est particulièrement intéressante : le modèle peut reconnaître directement des plans de construction, des photos d’équipements ou des images montrant l’avancement des travaux, ouvrant ainsi de nouvelles possibilités pour le traitement de la documentation technique.

Source :deepseek.com