DeepSeek V4 Flash 0731 ne bouleverse pas l’architecture du modèle : sa progression vient surtout d’un post-entraînement pensé pour les agents IA. La vidéo examine ses résultats, son prix et son intérêt face à des modèles plus coûteux pour le développement agentique.
Un entraînement tourné vers les tâches complètes
Le modèle a été entraîné à enchaîner des actions complexes plutôt qu’à simplement produire une fonction isolée. Il doit analyser une base de code, identifier la cause de tests en échec, modifier les bons fichiers, relancer les commandes et corriger les erreurs restantes.
Cette approche l’aide à conserver le fil sur plusieurs étapes, à exploiter un contexte important et à mieux utiliser les outils. DeepSeek propose aussi plusieurs niveaux de raisonnement — low, high et max — afin d’adapter la quantité de calcul à la difficulté de la tâche.
Des résultats prometteurs pour les agents
DeepSeek V4 Flash atteint 54,4 sur SWE-bench, où l’agent doit résoudre un problème dans un véritable dépôt. Il obtient également 82,7 sur Terminal-Bench 2, qui évalue 89 tâches réalisées en ligne de commande, puis 70,3 sur Toolathlon, un benchmark consacré aux longues séquences d’utilisation d’outils.
Ces évaluations se rapprochent des usages de Claude Code ou Codex : comprendre une demande, choisir les bonnes actions et poursuivre jusqu’à obtenir un résultat fonctionnel.
Un coût qui change la donne
Le tarif présenté est de 0,14 dollar par million de tokens en entrée et 0,28 dollar en sortie. Dans la démonstration, la création puis l’amélioration d’un clone minimaliste de Gemini Notebook coûtent seulement quelques dizaines de centimes. Le résultat reste perfectible, notamment faute de consignes visuelles précises, mais l’application fonctionne.
Pour découvrir le test complet et juger le potentiel de DeepSeek V4 Flash 0731, regardez la vidéo.