Can Synthetic Data Improve AI?

Synthetische Daten werden mithilfe von ML-Algorithmen künstlich erzeugt, um Datensätze zu erstellen, die den Originaldaten sehr ähnlich sind. Warum das wichtig ist.

Mar 17, 2022
5 minute read
Can synthetic data improve AI?

Face recognition and personal identification technologies in street surveillance cameras, law enforcement control. crowd of passers-by with graphic elements. Privacy and personal data protection,

Enterprise Networking Planet Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Das Aufkommen von Big Data hat Unternehmen zahlreiche Möglichkeiten eröffnet, dieses immense Potenzial zu nutzen. Datenbasierte KI-(künstliche Intelligenz) und ML-(maschinelles Lernen)Initiativen können Unternehmen dabei helfen, schneller zu skalieren und ihre Markteinführungszeit zu verkürzen.

Für das Training von KI-Modellen ist jedoch der Zugriff auf zahlreiche präzise Datensätze erforderlich. Außerdem gibt es beim Zugriff auf Daten aus der realen Welt mehrere Einschränkungen.

Diese Einschränkungen reichen von der Schwierigkeit, große Datensätze zu beschaffen, bis zur zunehmenden Bedeutung von Datenschutz- und Privatsphäregesetzen. Angesichts des Risikos, Compliance- und Datenschutzgesetze zu verletzen und massive Geldstrafen zu kassieren, verzichten Unternehmen lieber auf die Nutzung der verfügbaren Daten – und verpassen dadurch Geschäftschancen.

Um Datenschutz- und Compliance-Probleme zu umgehen, setzen Unternehmen zunehmend synthetische Daten ein.

Was sind synthetische Daten?

Synthetische Daten werden mithilfe von ML-Algorithmen künstlich erzeugt, um Datensätze zu erstellen, die den Originaldaten sehr ähnlich sind. Sie sind eine kostengünstige und effiziente Methode, mit der Forschende mühelos riesige Datensätze erzeugen können.

Für die Erstellung synthetischer Daten kommen häufig spezielle Frameworks für maschinelles Lernen zum Einsatz. Am weitesten verbreitet sind generative gegnerische Netzwerke (GANs).

In diesem Deep-Learning-Modell treten zwei neuronale Netzwerke – der Generator und der Diskriminator – gegeneinander an, um synthetische Daten zu erzeugen. Die generativen Modelle lernen aus realen Datensätzen, um synthetische Daten zu erzeugen, die realen Daten ähneln, jedoch keine Eins-zu-eins-Beziehung zu tatsächlichen Fakten aufweisen.

Weitere Möglichkeiten zur Erzeugung synthetischer Daten sind Variational Autoencoder (VAEs) und autoregressive Modelle. Während VAEs Muster zur Kodierung und Dekodierung verwenden, nutzt das autoregressive Modell eine Reihe von Eingabe- und Ausgabemustern, um synthetische Daten zu erzeugen.

Auch lesenswert: Die wichtigsten Herausforderungen und Chancen des Datenmanagements für IT-Verantwortliche im Jahr 2022

Advertisement

Warum brauchen wir synthetische Daten?

Für die Einführung synthetischer Daten gibt es mehrere Gründe. Erstens geben Unternehmen viel Geld für die Erfassung und Analyse realer Daten aus. Mit synthetischen Daten können sie die Kosten der Informationsbeschaffung drastisch senken. Darüber hinaus spielen synthetische Daten eine wichtige Rolle beim Training von KI-Modellen, insbesondere in Anwendungsfällen, in denen keine echten Daten verfügbar sind.

Ein weiterer Grund für den Einsatz synthetischer Daten liegt darin, dass Datensätze personenbezogene Informationen wie den Namen oder die Sozialversicherungsnummer einer Person enthalten können. Zwar lässt sich dies durch Verfahren wie die Nutzung von nicht personenbezogenen Informationen (Non-PII) und die Anonymisierung von Daten vermeiden, doch es besteht immer das Risiko einer Re-Identifizierung.

Um dies zu verhindern, können Sie mithilfe eines Tools zur Erzeugung künstlicher Daten synthetische Daten aus Daten der realen Welt ableiten. Dadurch bleiben die Eigenschaften der tatsächlichen Daten erhalten, und Sie können Daten nutzen, ohne das Risiko einzugehen, personenbezogene Informationen zu gefährden.

Vorteile synthetischer Daten

Zu den Vorteilen der Nutzung synthetischer Daten gehören: 

  • Kosten: Die Erfassung realer Daten ist zeitaufwendig und kostspielig, während die Erzeugung von Daten mit einer Software zur Generierung synthetischer Daten deutlich günstiger, schneller und effizienter ist. 
  • Systemtests: Hochwertige Testdaten sind für produktionsreife Daten entscheidend. Kostspielige Vorschriften können jedoch umfassende Datensätze einschränken. Eine Alternative besteht darin, synthetische Daten zu erzeugen, die alle Ihre Anforderungen an das Systemtraining erfüllen.
  • Geschwindigkeit: Der Zugriff auf sensible Datensätze zu beantragen, kann ein zeitaufwendiger Prozess sein, der auf zahlreiche Hürden stößt. Mit synthetischen Daten müssen Unternehmen nicht die bürokratischen Prozesse zur Beschaffung realer Daten durchlaufen. Stattdessen können sie Daten bei Bedarf in deutlich kürzerer Zeit erstellen.
  • Gewährleistet Datenschutz: Einer der wichtigsten Vorteile synthetischer Daten besteht darin, dass sie nicht auf die Verwendung von sensiblen Daten zurückgreifen. Da alle personenbezogenen Informationen entfernt wurden, können die Daten keiner realen Person zugeordnet werden.
  • Einfacher Zugriff: In bestimmten Anwendungsfällen sind möglicherweise keine Daten aus der realen Welt verfügbar, während es in anderen Fällen nicht genügend Daten gibt, um Modelle ordnungsgemäß zu trainieren. Die einzige Möglichkeit, in solchen Szenarien Daten zu erhalten, besteht darin, sie synthetisch zu erzeugen.
Advertisement

Herausforderungen synthetischer Daten

Obwohl synthetische Daten in vielerlei Hinsicht Vorteile bieten, bringen sie auch einige Einschränkungen mit sich.

  • Nutzung allgemeiner Trends: Synthetische Daten können zwar reale Daten nachahmen, die Originaldaten aber nicht vollständig rekonstruieren. Da sie sich hauptsächlich auf allgemeine Trends konzentrieren, besteht die Möglichkeit, dass Sonderfälle aus den Originaldaten übersehen werden.
  • Verzerrungen in den Daten: Synthetische Daten sind nur so gut wie die Quelldaten, aus denen sie abgeleitet wurden. Wenn die Quelldaten Verzerrungen enthalten, liefern auch die synthetischen Daten ein verzerrtes Ergebnis.
  • Akzeptanz durch die Nutzer: Da synthetische Daten ein neues Gebiet sind, haben viele Nutzer Bedenken. Daher ist die Akzeptanz durch die Nutzer ein Problem, mit dem sich Unternehmen beim Einsatz synthetischer Daten häufig auseinandersetzen müssen.   

Auch lesenswert: Die wichtigsten Tools zur Datenmodellierung 2022

Anwendungsfälle für synthetische Daten

Synthetische Daten kommen in zahlreichen Branchen zum Einsatz, darunter Finanzwesen, Gesundheitswesen, Automobilindustrie und Fertigung.

Autonome Fahrzeuge

Autonome Fahrzeuge gehören zu den bemerkenswerten Erfolgsgeschichten synthetischer Daten. Für die präzise Entwicklung selbstfahrender Autos müssen Unternehmen riesige Mengen realer Daten beschaffen und kennzeichnen.

Das Zusammenstellen von Live-Datensätzen echter Fahrzeuge im Einsatz ist jedoch teuer und zeitaufwendig. Mithilfe synthetischer Daten können Entwickler selbstfahrende Autos auf simulierten Straßen realitätsnah, sicher, schnell und effizienter testen.

Advertisement

Fertigung

Wenn ein Unternehmen ein neues Produkt herstellt, stehen möglicherweise nicht genügend Datensätze für das Training von Modellen zur Verfügung. Synthetische Trainingsdaten sind der schnellste und effektivste Weg, dieses Problem zu lösen. Indem Unternehmen ihre Modelle mit synthetischen Datensätzen trainieren, die alle möglichen Szenarien abdecken, können sie Qualitätsprobleme früher erkennen.

Finanzdienstleistungen

Finanzinstitute verfügen über eine Fülle von Kundendaten, die sie für bessere Erkenntnisse nutzen können. Aufgrund der strengen Compliance-Gesetze und Datenschutzanforderungen scheuen sie jedoch davor zurück, die verfügbaren Daten zu verwenden. Synthetische Daten ermöglichen es diesen Institutionen, die statistischen Eigenschaften der ursprünglichen Datensätze zu übernehmen, ohne den Datenschutz der Kunden zu gefährden.    

Gesundheitswesen

Synthetische Daten werden im Gesundheitswesen häufig eingesetzt, da Forschende dadurch Aufzeichnungsdaten verwenden können, ohne sich über rechtliche Komplikationen durch eine Verletzung der Vertraulichkeit von Patientendaten Gedanken machen zu müssen. Außerdem können Forschende synthetische Daten extrapolieren, um weiterführende Studien durchzuführen, für die keine realen klinischen Daten existieren.

Können sie dazu beitragen, Verzerrungen in der KI zu verringern?

So sehr wir uns eine vorurteilsfreie Welt wünschen, die Wahrheit ist, dass KI- Systeme dafür verantwortlich sind, unbeabsichtigte Verzerrungen zu verbreiten. Synthetische Daten bieten die Möglichkeit, Vorurteile aus KI-Algorithmen zu beseitigen und den Weg zu einer faireren KI zu ebnen, die die Welt präzise repräsentiert. 

Das Problem liegt jedoch nicht im KI-System, sondern in den Daten, die in das System eingespeist werden. Um dieses Problem zu lösen, müssten Forschende die Verzerrungen in den vorhandenen Daten untersuchen. Anschließend können sie das System neu trainieren und sicherstellen, dass sich Annahmen und Vorurteile nicht in die neu erstellten synthetischen Daten einschleichen. Der nun erstellte neue Datensatz wird der vorab festgelegten Definition einer fairen KI entsprechen.  

Advertisement

Zunehmender Einsatz synthetischer Daten

Gartner schätzt, dass bis 2024 60 % der von KI-Projekten verwendeten Daten synthetische Daten sein werden. Synthetische Daten sind ein aufstrebendes Gebiet, das wachsen wird, je strenger die Datenschutzrichtlinien werden.

Synthetisch erzeugte Daten ermöglichen es Unternehmen, umsetzbare Erkenntnisse zu gewinnen, ihre Zeit bis zur Produktionsreife zu verkürzen und agiler zu werden. Angesichts der immensen Vorteile ist es nur eine Frage der Zeit, bis synthetische Daten tatsächliche Daten in KI-Modellen verdrängen.

Als Nächstes lesen: DevOps mit KI und ML automatisieren

Susnigdha Tripathy

Susnigdha Tripathy is a full-time writer and editor based in Singapore, and a regular contributor to Enterprise Networking Planet. She has over 10 years of experience writing, editing, and delivering exceptional content for a variety of international technology brands such as Virtasant, a cloud technology company, and Krista Software, a provider of intelligent automation solutions. She has also appeared in ServerWatch and other industry publications.

Enterprise Networking Planet Logo

Enterprise Networking Planet aims to educate and assist IT administrators in building strong network infrastructures for their enterprise companies. Enterprise Networking Planet contributors write about relevant and useful topics on the cutting edge of enterprise networking based on years of personal experience in the field.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.