Les données synthétiques peuvent-elles améliorer l’IA ?

Les données synthétiques sont des données générées artificiellement par des algorithmes de ML afin de créer des jeux de données qui ressemblent étroitement aux données d’origine. Voici pourquoi c’est important.

Mar 17, 2022
6 minute read
Can synthetic data improve AI?

Face recognition and personal identification technologies in street surveillance cameras, law enforcement control. crowd of passers-by with graphic elements. Privacy and personal data protection,

Enterprise Networking Planet Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

L’émergence du big data a ouvert de nombreuses possibilités aux entreprises qui souhaitent exploiter cet immense potentiel. Les initiatives d’IA (intelligence artificielle) et de ML (machine learning) fondées sur les données peuvent aider les entreprises à se développer plus rapidement et à accélérer leur mise sur le marché.

Cependant, l’entraînement des modèles d’IA nécessite l’accès à de nombreux jeux de données précis. De plus, l’accès aux données du monde réel présente plusieurs limites.

Ces contraintes vont de la difficulté à obtenir de vastes jeux de données au renforcement des exigences imposées par les lois sur la protection des données et de la vie privée. Face au risque d’enfreindre les lois en matière de conformité et de respect de la vie privée et de se voir infliger de lourdes amendes, les entreprises préfèrent ne pas exploiter les données disponibles et passent ainsi à côté d’opportunités commerciales.

Pour contourner les problèmes de confidentialité et de conformité, les organisations ont commencé à utiliser des données synthétiques.

Que sont les données synthétiques ?

Les données synthétiques sont des données générées artificiellement par des algorithmes de ML afin de créer des jeux de données qui ressemblent étroitement aux données d’origine. Il s’agit d’une méthode économique et peu coûteuse qui permet aux chercheurs de générer sans effort d’immenses jeux de données.

Pour créer des données synthétiques, on utilise souvent des frameworks de machine learning spécifiques, dont le plus courant est les réseaux antagonistes génératifs (GAN).

Dans ce modèle d’apprentissage profond, deux réseaux neuronaux — le générateur et le discriminateur — s’affrontent pour produire des données synthétiques. Les modèles génératifs apprennent à partir de jeux de données réels afin de produire des données synthétiques similaires aux données réelles, mais qui n’entretiennent aucune relation biunivoque avec les faits réels.

Advertisement

Les autres méthodes de génération de données synthétiques reposent sur les autoencodeurs variationnels (VAE) et les modèles autorégressifs. Alors que les VAE utilisent des schémas d’encodage et de décodage, le modèle autorégressif s’appuie sur un ensemble de schémas d’entrée et de sortie pour générer des données synthétiques.

À lire aussi : Les principaux défis et opportunités de la gestion des données auxquels les responsables informatiques sont confrontés en 2022

Pourquoi avons-nous besoin de données synthétiques ?

L’adoption des données synthétiques s’explique par de nombreuses raisons. Tout d’abord, les entreprises consacrent des sommes importantes à la collecte et à l’analyse des données réelles. Grâce aux données synthétiques, elles peuvent réduire considérablement les coûts d’acquisition de l’information. En outre, les données synthétiques jouent un rôle essentiel dans l’entraînement des modèles d’IA, en particulier lorsque les données réelles ne sont pas disponibles.

Une autre raison d’utiliser des données synthétiques est que les jeux de données peuvent contenir des informations personnelles, comme le nom ou le numéro de sécurité sociale d’une personne. Bien que l’on puisse éviter cela en adoptant des techniques telles que les informations permettant d’identifier une personne (non-PII) et l’anonymisation des données, le risque de réidentification est toujours présent.

Pour éviter cela, il est possible de dériver des données synthétiques à partir de données du monde réel à l’aide d’un outil de génération de données artificielles. Cette méthode préserve les propriétés des données réelles et permet d’utiliser les données sans risquer de compromettre les informations personnelles.

Avantages des données synthétiques

Les avantages de l’utilisation des données synthétiques sont notamment les suivants : 

  • Coût : La collecte de données réelles prend du temps et s’avère prohibitive, tandis que la production de données au moyen d’un logiciel de génération de données synthétiques est bien moins coûteuse, plus rapide et plus efficace. 
  • Tests des systèmes : Des données de test de haute qualité sont essentielles pour obtenir des données adaptées à la production ; toutefois, des réglementations contraignantes peuvent limiter les jeux de données complets. Une solution consiste à générer des données synthétiques qui répondent à tous vos besoins en matière d’entraînement des systèmes.
  • Rapidité : Demander l’accès à des jeux de données sensibles peut être un processus long, semé d’obstacles. Avec les données synthétiques, les entreprises n’ont pas à suivre les procédures bureaucratiques nécessaires pour obtenir des données réelles ; elles peuvent au contraire créer des données dès qu’elles en ont besoin, bien plus rapidement.
  • Garantit la confidentialité des données : L’un des principaux avantages des données synthétiques est qu’elles ne font pas appel à des données sensibles. Comme toutes les informations personnelles ont été supprimées, il est impossible de relier les données à une personne réelle.
  • Accès facile : Dans certains cas d’usage, les données du monde réel peuvent ne pas être disponibles ; dans d’autres, il peut ne pas y avoir suffisamment de données pour entraîner correctement les modèles. Dans de telles situations, la seule façon d’obtenir des données consiste à les générer de manière synthétique.

Défis des données synthétiques

Advertisement

Bien que les données synthétiques soient avantageuses à bien des égards, elles comportent aussi leur lot de limites.

  • Utilisation des tendances courantes : Bien que les données synthétiques puissent imiter les données réelles, elles ne peuvent pas entièrement reconstituer les données d’origine. Comme elles se concentrent principalement sur les tendances courantes, elles risquent de passer à côté des cas limites présents dans les données d’origine.
  • Biais des données : Les données synthétiques ne valent que ce que valent les données sources dont elles sont dérivées. Si les données sources comportent des biais, les données synthétiques produiront elles aussi un résultat biaisé.
  • Acceptation par les utilisateurs : Les données synthétiques étant un domaine nouveau, de nombreux utilisateurs expriment des réserves à leur sujet. L’acceptation par les utilisateurs est donc un problème auquel les organisations sont souvent confrontées lorsqu’elles utilisent des données synthétiques.   

À lire aussi : Les meilleurs outils de modélisation des données en 2022

Cas d’usage des données synthétiques

Les données synthétiques sont utilisées dans de nombreux secteurs, notamment la finance, la santé, l’automobile et l’industrie manufacturière.

Véhicules autonomes

Les véhicules autonomes comptent parmi les réussites les plus remarquables des données synthétiques. Pour concevoir correctement des voitures autonomes, les entreprises doivent acquérir et annoter d’immenses volumes de données réelles.

Cependant, rassembler des jeux de données en temps réel montrant des voitures réelles en action est coûteux et chronophage. Grâce aux données synthétiques, les développeurs peuvent tester de manière réaliste des voitures autonomes sur des routes simulées, de façon sûre, rapide et plus efficace.

Advertisement

Industrie manufacturière

Lorsqu’une entreprise fabrique un nouveau produit, il se peut qu’il n’y ait pas suffisamment de jeux de données disponibles pour entraîner les modèles. Les données d’entraînement synthétiques constituent le moyen le plus rapide et le plus efficace de résoudre ce problème. En entraînant leurs modèles sur des jeux de données synthétiques couvrant tous les scénarios possibles, les entreprises peuvent détecter plus tôt les problèmes de qualité.

Services financiers

Les institutions financières disposent d’une grande quantité de données clients qu’elles peuvent utiliser pour obtenir de meilleures informations. Pourtant, elles hésitent à exploiter les données disponibles en raison de lois strictes en matière de conformité et d’exigences rigoureuses en matière de confidentialité. Les données synthétiques permettent à ces institutions de reproduire les propriétés statistiques des jeux de données d’origine sans mettre en danger la vie privée des clients.    

Santé

Les données synthétiques sont couramment utilisées dans le secteur de la santé, car elles permettent aux chercheurs d’utiliser des données issues de dossiers sans se soucier des complications juridiques liées à la violation du secret médical. En outre, les chercheurs peuvent extrapoler les données synthétiques pour mener des études avancées lorsqu’aucune donnée clinique réelle n’existe.

Peuvent-elles contribuer à réduire les biais de l’IA ?

Même si nous souhaitons vivre dans un monde sans biais, la vérité est que les systèmes d’IA sont coupables de propager des biais involontaires. Les données synthétiques offrent la possibilité d’éradiquer les préjugés des algorithmes d’IA et de progresser vers une IA plus équitable, qui représente fidèlement le monde. 

Cependant, le problème ne vient pas du système d’IA, mais des données qui lui sont fournies. Pour le résoudre, les chercheurs devraient étudier les biais présents dans les données existantes. Ils pourraient ensuite réentraîner le système en veillant à ce que les hypothèses et les préjugés ne s’infiltrent pas dans les nouvelles données synthétiques créées. Le nouveau jeu de données ainsi créé sera conforme à la définition prédéterminée d’une IA équitable.  

Advertisement

L’utilisation croissante des données synthétiques

Gartner estime qu’en 2024, 60 % des données utilisées par les projets d’IA seront des données synthétiques. Les données synthétiques constituent un domaine émergent qui se développera à mesure que les politiques de confidentialité deviendront plus strictes.

Les données générées synthétiquement permettent aux entreprises d’obtenir des informations exploitables, de réduire leur délai de mise en production et de gagner en agilité. Au vu des immenses avantages qu’elles offrent, ce n’est qu’une question de temps avant que les données synthétiques ne remplacent les données réelles dans les modèles d’IA.

À lire ensuite : Automatiser le DevOps avec l’IA et le ML

Susnigdha Tripathy

Susnigdha Tripathy is a full-time writer and editor based in Singapore, and a regular contributor to Enterprise Networking Planet. She has over 10 years of experience writing, editing, and delivering exceptional content for a variety of international technology brands such as Virtasant, a cloud technology company, and Krista Software, a provider of intelligent automation solutions. She has also appeared in ServerWatch and other industry publications.

Enterprise Networking Planet Logo

Enterprise Networking Planet aims to educate and assist IT administrators in building strong network infrastructures for their enterprise companies. Enterprise Networking Planet contributors write about relevant and useful topics on the cutting edge of enterprise networking based on years of personal experience in the field.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.