Les Data Processing Units (DPU) déchargent le CPU des tâches d'infrastructure dans les data centers modernes. Découvrez leur rôle clé dans la gestion du réseau, du stockage et de la sécurité, ainsi que leur impact sur l'optimisation des ressources serveur.
Les processeurs de traitement de données (DPU, Data Processing Unit) sont des puces spécialisées qui prennent en charge une partie des tâches d'infrastructure au sein des serveurs modernes. Plutôt que de solliciter le processeur central (CPU) pour exécuter à la fois les applications, gérer le trafic réseau, accéder aux systèmes de stockage et assurer le chiffrement, certaines de ces opérations peuvent être déléguées à un DPU dédié.
Cette approche est particulièrement cruciale dans les centres de données, où chaque serveur traite constamment d'énormes volumes d'informations. À mesure que les réseaux gagnent en rapidité et que le nombre de machines virtuelles augmente, les opérations d'infrastructure commencent à accaparer une part significative des ressources du CPU. Le DPU permet d'exécuter nombre de ces tâches de façon autonome, laissant ainsi plus de puissance de calcul au CPU pour les applications et workloads métiers.
Le DPU n'est pas un simple équivalent du CPU ou du GPU. Sa mission se situe beaucoup plus près de l'infrastructure du serveur : transfert de données entre réseau, mémoire et stockage, traitement des paquets réseau, virtualisation et sécurité.
Un DPU (Data Processing Unit) est un processeur programmable, conçu principalement pour gérer les flux de données et exécuter les tâches d'infrastructure du serveur. Il est généralement relié à une interface réseau haut débit et peut accomplir de manière autonome des opérations qui seraient autrement traitées par le processeur central.
Par exemple, un DPU peut gérer les réseaux virtuels, filtrer les paquets, effectuer des opérations de chiffrement, prendre en charge le stockage et contrôler l'accès à l'infrastructure. Les solutions modernes intègrent des accélérateurs matériels pour certaines de ces fonctions, éliminant le recours systématique aux cœurs de calcul généralistes.
On peut voir le DPU comme un petit ordinateur spécialisé intégré au serveur, doté de ses propres cœurs de processeur, mémoire, contrôleur réseau et accélérateurs matériels. Cela permet à une partie de l'infrastructure logicielle de fonctionner presque indépendamment du système d'exploitation principal du serveur.
Le CPU est conçu pour être aussi polyvalent que possible : il exécute le système d'exploitation, les bases de données, les applications serveur, les machines virtuelles et bien d'autres programmes, sans pouvoir anticiper la nature exacte des calculs à effectuer.
Le DPU, lui, répond à un ensemble de tâches beaucoup plus restreint. Placé directement sur le trajet des données, il est optimisé pour les opérations répétitives de l'infrastructure serveur : gestion des paquets réseau, réseaux virtuels, transferts vers le stockage, chiffrement et filtrage du trafic.
Ainsi, le CPU consacre moins de temps aux tâches d'infrastructure. Les applications continuent de tourner sur le processeur central, tandis qu'une part significative du traitement de données est déléguée à du matériel spécialisé. Cette répartition permet de mieux exploiter les précieux cœurs du serveur.
L'architecture exacte varie selon les constructeurs, mais un DPU moderne regroupe généralement plusieurs éléments : cœurs de calcul programmables, interface réseau haut débit, accélérateurs matériels dédiés au réseau, au stockage et à la sécurité.
Par exemple, les solutions NVIDIA BlueField combinent un contrôleur réseau ConnectX, des cœurs Arm et des accélérateurs matériels pour les opérations réseau, disque et cryptographie. AMD Pensando propose son propre pipeline programmable, des cœurs Arm et des blocs dédiés au chiffrement et au stockage. Malgré des différences de mise en œuvre, le principe reste le même : rapprocher au maximum le traitement des données d'infrastructure du point où elles transitent.
Le DPU doit donc être considéré comme une véritable sous-système de calcul, capable d'exécuter non seulement la transmission de paquets mais aussi d'autres fonctions programmables d'infrastructure serveur.
Dans un serveur classique, les données réseau arrivent via un adaptateur, puis la majorité du traitement incombe au CPU : gestion des réseaux virtuels, protocoles réseau, opérations de stockage, chiffrement et autres fonctions d'infrastructure, en parallèle de l'exécution des applications principales.
Avec l'augmentation du débit réseau, le nombre de paquets à traiter croît, et le temps CPU consacré à leur gestion devient de plus en plus important. Dans les infrastructures virtualisées, cela s'ajoute à la gestion des commutateurs virtuels, du trafic entre machines virtuelles et conteneurs, au contrôle d'accès et à l'accès aux stockages distants. Intel classe explicitement ces fonctions (réseau, stockage, sécurité) parmi celles qu'un processeur d'infrastructure spécialisé peut décharger du CPU principal.
Le DPU change cette dynamique : les données passent d'abord par le processeur spécialisé, qui accomplit les tâches d'infrastructure de manière autonome. Le CPU reçoit alors un flux déjà traité, réduisant ainsi la charge de service de l'infrastructure.
Ce phénomène s'inscrit dans une tendance plus large : le passage du calcul universel à des blocs spécialisés. Pour approfondir ce sujet, consultez l'article L'ère des processeurs universels touche à sa fin : pourquoi le CPU cède la place au GPU, NPU et ASIC.
Une mission clé du DPU est la gestion des paquets réseau. Plutôt que de transmettre chaque étape de traitement au CPU, la puce peut réaliser elle-même le routage, le filtrage, la commutation virtuelle et d'autres opérations directement sur le trajet des données.
Cela s'avère particulièrement utile dans les infrastructures cloud, où un serveur physique héberge simultanément des dizaines ou centaines de machines virtuelles et de conteneurs, chacun avec ses propres réseaux virtuels et règles d'accès. Si toutes ces opérations sont gérées par le CPU, l'infrastructure entre en concurrence avec les applications métiers pour du temps processeur.
En déléguant une partie de la logique réseau à un DPU, comme le NVIDIA BlueField, les services réseau, stockage et sécurité sont pris en charge hors du CPU principal, rendant davantage de ressources disponibles pour les workloads essentiels.
L'intérêt du DPU ne se limite pas à " accélérer l'internet " au sein du serveur : le traitement du trafic devient une tâche matérielle indépendante, moins dépendante de la charge du CPU. Même si une application sollicite fortement le processeur, les fonctions d'infrastructure continuent d'être assurées par la puce spécialisée.
Sur un ordinateur personnel, quelques pourcents de charge supplémentaire sur le CPU passent souvent inaperçus. Mais dans un data center, où les mêmes opérations d'infrastructure se répètent sur des milliers de serveurs, chaque gain de temps processeur se multiplie à l'échelle du cluster.
En outre, les serveurs modernes sont de plus en plus dédiés à des charges lourdes : bases de données, analytics, virtualisation, intelligence artificielle. Employer de coûteux cœurs CPU universels pour traiter en permanence des paquets réseau ou du trafic de service n'est pas optimal si ces tâches peuvent être déléguées à du matériel spécialisé.
Le DPU permet de séparer la partie calcul de la partie infrastructure du serveur. Le CPU gère les applications, le GPU s'occupe des traitements parallèles massifs, et le DPU traite les flux de données et leur gestion périphérique. Cette répartition est fondamentale dans les grands data centers, où le réseau et le stockage font partie intégrante de l'architecture de calcul.
Le DPU a l'avantage de pouvoir prendre en charge plusieurs types d'opérations d'infrastructure à la fois. Plutôt que d'utiliser des mécanismes logiciels séparés sur le CPU pour le réseau, le stockage et la sécurité, le serveur transfère une partie de ce travail vers un processeur spécialisé.
La gestion du réseau est une fonction clé du DPU : analyse des paquets, application de règles de filtrage, gestion des réseaux virtuels, exécution du routage en temps réel lors du passage du trafic.
Dans les environnements virtualisés, le DPU gère aussi les commutateurs virtuels et les fonctions réseau reliant machines virtuelles et conteneurs, libérant ainsi le CPU pour la charge de calcul principale.
Un domaine particulier concerne les technologies de transfert direct de données entre mémoires système, comme RDMA, qui permet à l'adaptateur réseau d'écrire directement en mémoire sur un autre serveur, presque sans intervention du CPU. Pour en savoir plus, découvrez RDMA : révolutionner les transferts de données dans les serveurs modernes.
De tels mécanismes sont essentiels pour le calcul haute performance et les clusters IA, où d'énormes volumes de données transitent en permanence entre serveurs et accélérateurs. Si chaque transfert sollicite le CPU, le réseau finit par monopoliser des ressources précieuses.
Le DPU accélère aussi les opérations d'entrée/sortie. Dans les data centers modernes, le stockage ne se trouve plus toujours dans un serveur précis, mais fait partie d'un système distribué accessible via le réseau.
Dans cette architecture, chaque requête de lecture ou d'écriture doit passer par le stack réseau, la virtualisation, le protocole de stockage et les mécanismes de contrôle d'accès. Si tout est traité par le CPU, cela ajoute une charge supplémentaire.
Le DPU peut gérer les protocoles de stockage, piloter le transfert de données et accélérer matériellement certaines opérations d'E/S. Les données circulent alors plus efficacement entre réseau, mémoire et stockage, sans solliciter excessivement le processeur principal.
C'est particulièrement évident avec les SSD NVMe ultra-rapides et les systèmes de stockage en réseau. La vitesse des SSD modernes est telle que la limitation vient souvent du traitement logiciel ou du transfert interne, plutôt que du support lui-même.
Autre mission essentielle : déplacer une partie des mécanismes de sécurité hors du système d'exploitation principal. Cela permet de vérifier et filtrer les données avant même qu'elles n'atteignent les applications ou machines virtuelles.
Le DPU peut effectuer le chiffrement/déchiffrement du trafic, appliquer les règles, filtrer les paquets et contrôler les accès grâce à des accélérateurs matériels, traitant ainsi de gros volumes de données sans surcharge sur les cœurs généralistes.
L'avantage architectural : si la sécurité fonctionne sur un processeur indépendant, elle dépend moins de l'état du système principal. Même en cas de forte charge CPU ou de problème dans une VM, le niveau d'infrastructure continue de contrôler le trafic et les ressources.
Le DPU accélère donc le traitement des données tout en renforçant l'isolation entre l'infrastructure du data center et les applications serveur.
Le DPU ne remplace pas le CPU ou le GPU : il travaille à leurs côtés. Un serveur moderne réunit plusieurs types de processeurs, chacun optimisé pour un ensemble de tâches : le CPU reste le centre de gestion universel, le GPU accélère les traitements massivement parallèles, et le DPU prend en charge l'infrastructure et le transit des données.
Ce modèle évite de tout confier à un seul type de processeur, ce qui est crucial dans les grandes architectures : il est généralement plus efficace d'utiliser du matériel spécialisé que de faire reposer toutes les opérations réseau, graphiques et d'infrastructure sur les cœurs généralistes du CPU.
On retrouve ce principe dans les systèmes équipés de plusieurs types d'accélérateurs. Pour en savoir plus, lisez l'article Systèmes informatiques hybrides : l'alliance CPU, GPU, NPU et FPGA.
La SmartNIC est une carte réseau programmable, capable d'exécuter certaines opérations sur le trafic de façon autonome. Contrairement à un adaptateur réseau classique qui ne fait que transférer les données, la SmartNIC peut filtrer les paquets, gérer les réseaux virtuels et accélérer des fonctions réseau spécifiques.
La frontière entre SmartNIC et DPU est floue : selon les fabricants, les termes se superposent et les fonctionnalités convergent. En général, le DPU désigne un sous-système de calcul plus autonome : il dispose de cœurs programmables, de mémoire et d'accélérateurs, et gère non seulement le réseau mais aussi le stockage et la sécurité.
On peut donc voir la SmartNIC comme une carte réseau avancée, et le DPU comme un véritable processeur d'infrastructure placé sur le chemin des données. Certains modèles haut de gamme de SmartNIC se rapprochent désormais des DPU, rendant la distinction technique parfois arbitraire.
Le CPU exécute toutes sortes d'applications, systèmes d'exploitation, bases de données, serveurs web, etc. Cette polyvalence a un coût : des opérations répétitives telles que le traitement de millions de paquets réseau ou le chiffrement permanent ne sont pas optimales sur des cœurs généralistes. Des blocs spécialisés peuvent exécuter ce type de tâches plus vite et plus efficacement.
Le DPU ne remplace pas le CPU mais le décharge d'une partie du travail d'infrastructure répétitif, laissant au processeur central plus de temps pour les applications métiers.
Le GPU est aussi un processeur spécialisé, mais dans un tout autre domaine. Il contient de nombreux blocs de calcul capables d'exécuter en parallèle des opérations mathématiques similaires : il est donc utilisé pour le graphisme, l'IA, le calcul scientifique ou la simulation.
Le DPU, à l'inverse, vise à optimiser le mouvement et le traitement des données autour des unités de calcul. Il reçoit des informations du réseau, applique des règles de sécurité, les transfère vers la mémoire ou le stockage, et les dirige vers l'application ou l'accélérateur approprié.
Dans un serveur IA, ces processeurs travaillent ensemble : le CPU pilote le système, le GPU entraîne ou infère le réseau de neurones, le DPU gère l'échange réseau et les opérations d'infrastructure. Plus le cluster est grand, plus la répartition des rôles entre puces devient cruciale.
Les DPU visent en priorité les infrastructures traitant d'importants flux réseau et stockage par serveur. Ils s'emploient donc dans les data centers, plateformes cloud, environnements virtualisés, calcul haute performance et clusters IA, mais rarement sur les PC domestiques.
Dans le cloud, le DPU gère les fonctions réseau et la sécurité des machines virtuelles indépendamment du CPU principal. Dans les systèmes de stockage, il optimise le transfert de données entre serveurs et stockages distants. Dans les clusters IA, le DPU libère les précieux CPU et GPU des tâches non strictement liées au calcul.
Chez AMD, il est prévu d'installer le DPU directement dans les serveurs de data center, où il assure les services réseau, sécurité et stockage pour les applications et environnements virtuels. Ce modèle est très scalable : chaque nouveau serveur apporte ses propres ressources d'infrastructure.
L'une des solutions les plus connues est la famille NVIDIA BlueField, qui combine interface réseau haut débit, cœurs Arm programmables et accélérateurs pour le réseau, le stockage et la sécurité. BlueField constitue en quelque sorte une plateforme de calcul d'infrastructure autonome à l'intérieur du serveur.
Un DPU BlueField peut prendre en charge des fonctions réseau programmables, la gestion du NVMe over Fabrics, RDMA, le chiffrement, l'isolation des charges et l'application de politiques de sécurité, sans intervention directe du CPU à chaque étape.
Cette approche est particulièrement pertinente pour l'IA, où l'entraînement de grands modèles nécessite le transfert constant de volumes massifs de données entre stockages, serveurs et GPU. La performance dépend alors non seulement de la puissance des accélérateurs, mais aussi de la rapidité d'acheminement des données.
Le DPU agit comme un intermédiaire d'infrastructure : il organise le transfert de données, gère le réseau et le stockage, applique les mécanismes de sécurité, tandis que le GPU se concentre sur le calcul et le CPU sur la gestion des applications.
La principale raison d'être du DPU est l'évolution de l'architecture des serveurs. Autrefois, l'adaptateur réseau et les stockages étaient considérés comme des périphériques autour du CPU. Désormais, le réseau fonctionne à des centaines de gigabits par seconde, les données résident dans des systèmes distribués, et chaque serveur héberge simultanément de nombreuses charges isolées.
Le coût des ressources de calcul ne cesse d'augmenter. Si une partie du CPU serveur est constamment mobilisée pour le traitement de paquets, le chiffrement ou la commutation virtuelle, ces cœurs ne sont plus disponibles pour les bases de données, applications ou autres tâches utiles.
Les fonctions d'infrastructure migrent donc progressivement vers des processeurs spécialisés. NVIDIA positionne explicitement BlueField comme plateforme pour externaliser les services réseau, stockage et sécurité du CPU principal, notamment pour les grands centres de données IA.
Le DPU devient un nouveau niveau de spécialisation matérielle : au lieu d'un modèle où le CPU central s'occupe de tout, on passe à une architecture où chaque type de puce gère le domaine qui lui convient le mieux : CPU pour la logique générale, GPU pour le calcul parallèle, DPU pour l'infrastructure et le flux de données.
Les processeurs de traitement de données DPU sont apparus pour répondre à la croissance des charges générées par l'infrastructure autour du calcul pur dans les serveurs modernes. Réseau, virtualisation, stockage, chiffrement et filtrage du trafic exigent de plus en plus de ressources : il devient inefficace de tout traiter sur les cœurs universels du CPU.
Le DPU transfère une part significative de ce travail à un processeur dédié : le CPU reste focalisé sur les applications et la logique générale, le GPU sur le calcul parallèle, tandis que le DPU gère le mouvement, le traitement et la protection des données entre les différents composants du système.
Sur un PC personnel, un DPU distinct est rarement utile. Ses avantages se révèlent dans les data centers, plateformes cloud et grands clusters IA, où chaque économie de ressources CPU se répercute sur des milliers de serveurs. Les DPU comme NVIDIA BlueField illustrent cette tendance : au lieu d'un seul processeur universel, les systèmes modernes privilégient des puces spécialisées, chacune accomplissant sa mission de manière optimale.