Comment laisser une intelligence artificielle manipuler des fichiers, exécuter du code et utiliser des outils lorsqu’il est impossible de garantir qu’elle se comportera correctement ? DeepSeek apporte une réponse très pragmatique : considérer dès le départ que l’agent n’est pas fiable et l’isoler autant que possible du reste du système.
Dans un nouvel article de recherche intitulé DeepSeek Elastic Compute, publié le 19 septembre sur arXiv, l’entreprise chinoise décrit l’infrastructure utilisée pour entraîner ses agents IA à très grande échelle. Une seule unité de production ferait fonctionner environ 3 millions de sandboxes par jour, avec jusqu’à 380 000 environnements simultanément et plus de 5 000 créations de sandboxes par seconde.
Mais le chiffre le plus intéressant se trouve peut-être dans la philosophie qui accompagne cette infrastructure. Pour les chercheurs de DeepSeek, aucun mécanisme de sécurité unique ne peut empêcher tous les mauvais comportements d’un agent ou toutes les défaillances du système.
L’objectif n’est donc plus d’empêcher absolument chaque incident. Il consiste à limiter ce qu’un agent peut endommager lorsqu’il se produit.
3 millions de sandboxes chaque jour
Entraîner un chatbot classique et entraîner un agent autonome posent des problèmes très différents. Un agent ne se contente plus de générer du texte. Il peut écrire et exécuter du code, ouvrir des fichiers, utiliser des outils, modifier son environnement ou enchaîner plusieurs actions pour atteindre un objectif.
Pour entraîner ces systèmes, DeepSeek doit donc leur fournir de véritables environnements d’exécution.
La plateforme décrite dans DeepSeek Elastic Compute atteint une échelle impressionnante : environ 3 millions de sandboxes sont exécutées chaque jour sur une seule unité de production. Jusqu’à 380 000 environnements peuvent fonctionner simultanément. L’infrastructure est capable de créer plus de 5 000 nouvelles sandboxes par seconde.
Environ 130 personnes sont créditées dans l’article, dont le fondateur de DeepSeek, Liang Wenfeng.
Pourquoi autant de sandboxes ?
Une sandbox est un environnement isolé dans lequel un programme peut fonctionner sans disposer d’un accès illimité au reste du système. Cette isolation est particulièrement importante pour les agents IA. Lors d’un entraînement, un agent doit pouvoir expérimenter, écrire des fichiers ou exécuter des commandes.
Mais il ne doit pas pouvoir perturber les autres agents, modifier l’infrastructure qui l’héberge ou accéder à des informations qui ne lui sont pas destinées.
DeepSeek résume directement le problème dans son article : « l’exécution des agents n’est pas fiable ». Les chercheurs expliquent notamment qu’un agent peut corrompre un système de fichiers, épuiser les ressources disponibles ou interférer avec différents composants du système.

Un agent peut aussi casser son propre environnement
Le problème n’est pas nécessairement qu’un agent cherche volontairement à contourner les protections. Il peut simplement produire une séquence d’actions inattendue. DeepSeek mentionne par exemple des agents capables d’obtenir une réponse par des canaux qui n’étaient pas prévus par les concepteurs du test.
D’autres peuvent détériorer leur propre environnement d’exécution. Ces comportements sont particulièrement problématiques pendant l’entraînement. Si un agent découvre accidentellement une méthode lui permettant d’obtenir directement la réponse à un problème, le système d’apprentissage peut interpréter ce résultat comme une réussite. Le modèle apprend alors à exploiter une faille de l’environnement plutôt qu’à résoudre correctement la tâche.
La qualité de la sandbox devient donc directement liée à la qualité de l’entraînement.
Quatre niveaux d’isolation
DeepSeek décrit plusieurs niveaux d’isolation afin d’adapter la protection à la tâche exécutée. Le système propose quatre catégories de sandboxes, allant d’environnements relativement légers pour certains appels de fonctions jusqu’à des machines virtuelles complètes.
Toutes les tâches n’ont en effet pas besoin du même degré d’isolation. Une opération très limitée peut être exécutée dans un environnement léger et rapidement créé. Un agent devant disposer d’un système complet et exécuter du code potentiellement plus risqué peut au contraire nécessiter une machine virtuelle.
Cette approche permet à DeepSeek de concilier deux contraintes contradictoires : isoler fortement les agents tout en étant capable de créer plusieurs milliers d’environnements chaque seconde.
DeepSeek part du principe que la protection finira par échouer
La conclusion des chercheurs est probablement plus importante que l’architecture elle-même. Selon eux, aucun mécanisme unique ne peut empêcher tous les mauvais comportements des agents et toutes les défaillances du système. Autrement dit, une sandbox ne constitue pas une frontière de sécurité absolue. DeepSeek adopte donc une approche reposant sur plusieurs couches de protection, mais également sur une forte capacité d’observation.
Lorsqu’un comportement inattendu apparaît, l’infrastructure doit permettre de comprendre ce qui s’est produit puis d’être renforcée.
Cette stratégie est particulièrement importante parce que les modèles évoluent. Une protection suffisante pour une génération d’agents peut devenir insuffisante lorsqu’un modèle devient meilleur en programmation, en raisonnement ou dans l’utilisation d’outils.
Plus les agents progressent, plus leurs sandboxes doivent évoluer
C’est l’un des problèmes particuliers de la sécurité des agents IA. L’application protégée n’est pas statique. Le modèle placé à l’intérieur devient régulièrement plus performant. Un nouvel agent peut découvrir des interactions avec son environnement auxquelles les modèles précédents n’avaient jamais pensé.
Une infrastructure conçue pour contenir les capacités d’un modèle aujourd’hui peut donc être confrontée demain à un agent beaucoup plus compétent. DeepSeek considère ainsi la sécurisation comme un processus continu plutôt qu’une propriété définitivement acquise. Observer les défaillances devient presque aussi important que tenter de les empêcher.
Une architecture pensée aussi pour économiser le calcul
L’isolation de millions d’agents pose également un problème économique. Réserver en permanence des ressources CPU complètes à chaque sandbox serait extrêmement inefficace. DeepSeek indique qu’environ 90 % des environnements utilisent au maximum 5 % de la capacité processeur qu’ils demandent. Une grande partie du temps d’un agent peut en effet être consacrée à attendre un résultat ou à effectuer des opérations ne sollicitant que très peu le processeur.
La plateforme cherche donc à redistribuer dynamiquement les ressources. La puissance de calcul est attribuée aux agents lorsqu’ils en ont réellement besoin plutôt que d’être immobilisée pendant toute la durée d’existence de leur environnement.
À l’échelle de millions de sandboxes, quelques pourcents d’amélioration de l’utilisation des ressources peuvent représenter des économies considérables.
La sécurité et l’efficacité deviennent le même problème
Cette architecture illustre une contrainte importante du développement des agents IA. Une isolation très forte peut être coûteuse. À l’inverse, mutualiser excessivement les ressources peut augmenter les risques qu’un agent affecte un autre environnement ou l’infrastructure elle-même.
DeepSeek doit donc trouver un équilibre entre isolation, rapidité de création et utilisation efficace du matériel.
C’est précisément ce qui rend les chiffres de la plateforme intéressants. Créer plus de 5 000 environnements isolés par seconde n’est pas uniquement un problème de sécurité. C’est également un problème d’orchestration informatique à très grande échelle.
DeepSeek publie aussi ce qui ne fonctionne pas
Un autre aspect intéressant de DeepSeek Elastic Compute est la publication de certains modes de défaillance rencontrés pendant l’exploitation du système. Les chercheurs ne décrivent pas uniquement une infrastructure idéale. Ils reconnaissent explicitement que des agents trouvent des chemins inattendus, endommagent leurs environnements et provoquent des situations que les mécanismes de protection n’avaient pas nécessairement anticipées.
Cette transparence fournit des informations utiles pour comprendre les difficultés concrètes rencontrées lorsque les agents quittent le simple environnement d’un chatbot pour interagir avec de véritables systèmes informatiques.
Il faut toutefois conserver une limite importante : l’article a été publié sur arXiv et n’a pas encore fait l’objet d’une évaluation par les pairs. Les performances et conclusions présentées proviennent donc pour l’instant des auteurs.
Contenir plutôt que croire à un agent parfaitement fiable
La publication de DeepSeek met finalement en évidence un changement important dans la manière de penser les agents IA. Chercher à construire un modèle qui ne commettra jamais d’action inattendue constitue un objectif très différent de la construction d’une infrastructure capable de résister lorsque cela arrive.
DeepSeek semble clairement privilégier la seconde approche. Les agents sont traités comme des programmes potentiellement imprévisibles auxquels il faut donner suffisamment de liberté pour apprendre et accomplir leurs tâches, sans leur accorder une confiance implicite dans l’infrastructure qui les héberge. C’est une philosophie déjà familière en cybersécurité : ne pas faire reposer la protection sur une seule barrière et considérer qu’une partie du système finira par échouer.
Avec des agents capables d’écrire du code, de manipuler des fichiers et d’utiliser des outils, cette logique devient progressivement indispensable. Et à raison de 3 millions de sandboxes exécutées chaque jour, DeepSeek dispose désormais d’un terrain particulièrement vaste pour découvrir tout ce qui peut mal tourner.