```html

La société chinoise DeepSeek a présenté une version mise à jour de son modèle DeepSeek-V4-Flash-0731, qui montre que l'augmentation des performances de l'intelligence artificielle n'est pas nécessairement liée à des modèles toujours plus grands. La nouveauté, tout en conservant l'architecture et la taille, a été considérablement améliorée grâce à un nouveau post-entraînement et a surpassé même le modèle plus grand DeepSeek-V4-Pro lors de tests indépendants.

DeepSeek-V4-Flash-0731 est basé sur une version préliminaire du modèle V4-Flash datant d'avril. Selon la documentation de l'entreprise, l'architecture et la taille du modèle n'ont pas été modifiées, mais un nouveau réglage fin après l'entraînement initial a été effectué. Cette étape a permis une augmentation significative des capacités, ce qui montre à quel point les méthodes de post-entraînement sont importantes aujourd'hui, en plus du simple nombre de paramètres.

Le modèle utilise une architecture Mixture-of-Experts (MoE) et n'active qu'une partie de ses paramètres pour chaque token. Le checkpoint officiel publié par DeepSeek comprend environ 304 milliards de paramètres, y compris le module de décodage spéculatif. Le modèle est également disponible en tant que solution open-weight via la plateforme Hugging Face.

L'une des caractéristiques les plus remarquables est son contexte extrêmement long. DeepSeek indique une prise en charge allant jusqu'à un million de tokens en entrée et une longueur maximale de sortie de 384 000 tokens. Le modèle prend également en charge le mode de raisonnement, le mode standard, l'appel d'outils et d'autres fonctionnalités nécessaires, par exemple, pour la création d'agents IA plus autonomes.

Un modèle plus petit a surpassé son grand frère

Les résultats de l'entreprise indépendante Artificial Analysis sont parmi les aspects les plus intéressants de cette mise à jour. DeepSeek-V4-Flash-0731 a obtenu 50 points dans l'Artificial Analysis Intelligence Index en mode de raisonnement maximal. Ce résultat le place parmi les modèles les plus performants actuellement disponibles, et selon l'évaluateur, il est également nettement supérieur à la version précédente V4-Flash.

Ainsi, d'après les tests, le modèle Flash mis à jour a également surpassé le plus grand DeepSeek-V4-Pro, ce qui est particulièrement important du point de vue de l'efficacité. Le développement de l'IA se déplace de plus en plus de la question "comment créer le plus grand modèle" à la question "comment obtenir la plus grande intelligence possible avec une puissance de calcul disponible".

De plus, DeepSeek exerce une pression sur la concurrence grâce à ses prix. Artificial Analysis indique un prix de l'API d'environ 0,14 dollar par million de tokens en entrée et 0,28 dollar par million de tokens en sortie. Dans un scénario combiné incluant l'utilisation du cache, le coût est nettement inférieur à celui de nombreux modèles concurrents.

C'est le rapport entre les performances et le prix qui a permis à DeepSeek-V4-Flash-0731 d'atteindre ce qu'on appelle la frontière de Pareto chez Artificial Analysis, c'est-à-dire parmi les modèles pour lesquels il n'est pas possible de trouver une alternative simultanément plus intelligente et moins chère selon les métriques observées.

Long contexte et génération plus rapide

Une partie importante du modèle est également l'optimisation du traitement des contextes longs. L'architecture de la famille V4 utilise des mécanismes qui réduisent la quantité de calculs et de mémoire nécessaires lors du traitement d'entrées volumineuses. C'est essentiel, par exemple, lors du travail avec de grands documents, des bases de données, de longues conversations ou dans les tâches autonomes où le modèle collecte progressivement une grande quantité d'informations.

La version publiée comprend également la technologie de décodage spéculatif. Un petit module auxiliaire propose à l'avance plusieurs tokens suivants, que le modèle principal peut ensuite vérifier simultanément. Le résultat est une génération plus rapide sans avoir besoin de modifier fondamentalement le modèle de base lui-même. Hugging Face indique pour cette version un checkpoint d'environ 304 milliards de paramètres.

``````html

Artificial Analysis a mesuré que plus de cent tokens de sortie par seconde pour ce modèle, ce qui le classe parmi les modèles de raisonnement rapides de cette catégorie de performance.

La compétition se déplace de la taille à l'efficacité

DeepSeek-V4-Flash-0731 illustre une tendance plus large qui gagne en importance dans le secteur de l'IA générative. Les développeurs ne sont plus seulement en concurrence sur les performances absolues des plus grands modèles, mais aussi sur la quantité d'intelligence qu'ils peuvent offrir pour un dollar et avec quelles exigences matérielles.

Ceci est particulièrement important pour les agents IA. Ceux-ci peuvent consommer des millions de tokens lorsqu'ils traitent des tâches à long terme, en travaillant avec des documents, la programmation, les demandes des clients ou les bases de données d'entreprise. Même une petite différence dans le coût d'un million de tokens peut donc entraîner des différences significatives dans les coûts d'exploitation lors du déploiement à grande échelle.

De plus, DeepSeek a un autre avantage grâce aux poids du modèle disponibles. Les entreprises ne sont pas uniquement limitées aux API cloud et peuvent déployer le modèle sur leur propre infrastructure, ce qui peut être intéressant, par exemple, là où il est important de conserver les données sensibles au sein de l'organisation. DeepSeek a publié le modèle dans le cadre de sa collection V4 sur Hugging Face.

La mise à jour V4-Flash n'est donc intéressante pas seulement pour un autre progrès dans les tableaux de référence. Elle montre que une formation et une optimisation de meilleure qualité peuvent avoir un impact plus important qu'une simple augmentation du nombre de paramètres. Et c'est précisément la combinaison d'une haute performance, de la rapidité, d'un long contexte, de poids ouverts et d'un faible coût qui peut être plus importante pour le développement futur du marché de l'IA que la course au modèle le plus grand.

gnews.cz - tk

```