Produktivität und Effizienz im maschinellen Lernen mit synthetischen Daten steigern

Daten sind für viele Unternehmen zur wertvollsten Ressource geworden. Maschinelles Lernen (ML) entwickelt sich von einer Nischentechnologie, die ausschließlich von führenden Innovatoren eingesetzt wird, zu einem festen Bestandteil moderner Unternehmen – und macht Daten zu einem unverzichtbaren Werkzeug. Dennoch schöpfen viele Daten- und Machine-Learning-Projekte ihr volles Potenzial nicht aus. Unternehmen kämpfen mit ML-Projekten, die ungenaue Ergebnisse liefern, […]

Written By
Devin Partida
Devin Partida
Aug 10, 2022
6 minute read
enterprise data

Devops software development operations infinity symbol. Programmer administration system life cycle quality. Coding building testing release monitoring. Data flow vector illustration.

Enterprise Networking Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Daten sind für viele Unternehmen zur wertvollsten Ressource geworden. Maschinelles Lernen (ML) entwickelt sich von einer Nischentechnologie, die ausschließlich von führenden Innovatoren eingesetzt wird, zu einem festen Bestandteil moderner Unternehmen – und macht Daten zu einem unverzichtbaren Werkzeug. Dennoch schöpfen viele Daten- und Machine-Learning-Projekte ihr volles Potenzial nicht aus.

Unternehmen kämpfen mit ML-Projekten, die ungenaue Ergebnisse liefern – hauptsächlich aufgrund von Problemen mit den Daten selbst. Zwar verstehen die meisten Unternehmen heute, dass sie Daten durch maschinelles Lernen nutzen müssen, doch deutlich weniger erkennen, wie ihre Datenpraktiken diese Ergebnisse beeinträchtigen. Der Einsatz synthetischer Daten kann dazu beitragen, viele dieser aktuellen Schwächen zu überwinden.

Siehe auch: 9 Möglichkeiten, wie KI das Cloud-Management verbessern kann

Was sind synthetische Daten?

Wie der Name schon sagt, handelt es sich bei synthetischen Daten um künstlich erzeugte Informationen. Sie folgen denselben Regeln und bilden Konzepte und Trends aus der realen Welt ab, stammen aber nicht aus einer realen Quelle. Wie Originaldaten können sie in verschiedenen Formen vorliegen – von Klartext über tabellarische Informationen bis hin zu visuellen oder akustischen Medien.

Synthetische Daten lassen sich in drei Hauptkategorien einteilen:

  • Vollständig synthetische Daten
  • Teilsynthetische Daten
  • Hybride Daten

Vollständig synthetische Daten beziehen sich auf Datensätze, die zu 100 % künstlich sind. Sie können auf Originaldatensätzen basieren, enthalten aber keinerlei Informationen oder Kontext aus der realen Welt. Teilsynthetische Daten sind Originalinformationen, bei denen einige Felder durch synthetische Ersatzwerte ersetzt wurden – in der Regel, um das Risiko von Datenlecks zu verringern. Wie zu erwarten, beziehen sich hybride Daten auf Datensätze, die eine Mischung aus Originaldaten und synthetischen Daten verwenden.

Siehe auch: Die wichtigsten Managed-Service-Provider

Advertisement

Vorteile synthetischer Daten

Führende Technologieunternehmen wie Google und Amazon verwenden synthetische Daten in ihren ML-Anwendungen, und immer mehr Unternehmen gehen diesen Weg. Allein die Beliebtheit eines Trends ist natürlich kein ausreichender Grund, ihn zu übernehmen. Daher folgen einige Vorteile synthetischer Daten.

Entfernung von Verzerrungen

Auch wenn es kontraintuitiv erscheinen mag: Die Verwendung realer Daten führt manchmal zu weniger genauen Ergebnissen als der Einsatz synthetischer Informationen. Das liegt an einer der größten Herausforderungen des maschinellen Lernens: Verzerrungen.

Originaldatensätze sind anfällig für menschliche Verzerrungen. Historische und tief verwurzelte implizite Vorurteile können durch die Art und Weise, wie Menschen Daten erfassen, aufzeichnen und organisieren, in Informationen aus der realen Welt einfließen, ohne dass Datenwissenschaftler dies bemerken. Das Problem ist so weit verbreitet, dass Studien zufolge bis zu 38,6 % der Daten in beliebten KI-Datenbanken verzerrt sind.

Synthetische Daten bieten eine Möglichkeit, Probleme wie historische Falschdarstellungen zu umgehen, die zu Verzerrungen führen können. Folglich kann ihr Einsatz in ML-Modellen trotz der möglicherweise nicht aus der realen Welt stammenden Informationen genauere Ergebnisse liefern. Dies kann auch zu angemesseneren und faireren KI-Anwendungen für Kunden führen.

Datenmenge

Synthetische Daten können auch den Zugang zu ausreichenden Informationen für das Training effektiver ML-Modelle erleichtern. Zuverlässige ML-Algorithmen benötigen in der Regel umfangreiche Datensätze, doch nicht jedes Unternehmen hat sofort Zugriff auf genügend relevante Daten. Synthetische Daten bieten eine Lösung für dieses Problem, da Unternehmen große Mengen davon erzeugen können, ohne langwierige Datenerhebungsprozesse.

Dies kann auf zwei Arten geschehen. Erstens könnten Teams vollständig synthetische Datensätze verwenden. Alternativ können sie Techniken wie das synthetische Oversampling von Minderheiten nutzen, das auf Basis realer Informationen Dummy-Daten erzeugt um Lücken im ursprünglichen Datensatz zu füllen.

Diese Strategien sind besonders für Unternehmen oder ML-Anwendungen mit begrenzt verfügbaren Daten aus der realen Welt nützlich. Ein Mangel an verfügbaren Informationen muss kein Hindernis für eine effektive ML-Implementierung mehr sein.

Advertisement

Projekteffizienz

Ebenso können synthetische Daten Teams dabei helfen, ML-Projekte in kürzerer Zeit abzuschließen. Laut einer Studie aus dem Jahr 2020 geben ein Drittel der Unternehmen an, dass die Implementierung eines ML-Modells bei ihnen zwischen einem und drei Monaten dauert. Weitere 24 % benötigen noch länger – und diese Zahlen berücksichtigen nicht einmal die Zeit für Training und Datenerfassung.

Bei derart langen durchschnittlichen Bereitstellungszeiten müssen Unternehmen die Datenerfassung und das Training so weit wie möglich optimieren, um die Projektkosten zu minimieren. Synthetische Daten sind eine ideale Lösung, da sie innerhalb eines Bruchteils der Zeit genügend Informationen liefern können.

Durch synthetische Daten müssen Teams deutlich weniger für die Erfassung und Organisation von Daten ausgeben. Je nach Erzeugungsmethode können sie die Daten außerdem bereits in einem standardisierten Format erstellen und so auch die Aufbereitung vereinfachen. Diese Effizienz kann ML-Projekte zu einer kostengünstigeren Investition machen.

Sicherheit

Ein weiterer Vorteil synthetischer Daten im ML-Umfeld ist die Verringerung des Risikos von Datenlecks. Da ML-Projekte typischerweise beträchtliche Datenmengen an einem Ort speichern, können sie erhebliche Cybersicherheitsrisiken bergen. Synthetische Daten reduzieren diese Risiken, indem sie sensible Informationen ersetzen.

Verwendet ein ML-Projekt Daten aus der realen Welt, insbesondere personenbezogene Daten (PII), kann ein Datenleck verheerende Folgen haben. Unternehmen könnten neben den Kosten für die Schadensbehebung mit Umsatzeinbußen und rechtlichen Schadensersatzforderungen konfrontiert werden. Wenn hingegen synthetische Daten nach außen gelangen, ist dies weniger problematisch, da dabei keine personenbezogenen Daten aus der realen Welt offengelegt werden.

Angesichts dessen, dass die Kosten von Datenlecks im Jahr 2022 ein Allzeithoch von 4,34 Millionen US-Dollar erreicht haben, ist dieser Sicherheitsaspekt ein entscheidender Vorteil. Das ist besonders für ML-Anwendungen wichtig, die mit sensiblen Informationen wie PII arbeiten.

Advertisement

So nutzen Sie synthetische Daten im ML-Umfeld optimal

Synthetische Daten bieten ML-Entwicklern zahlreiche Vorteile. Wie bei jeder anderen Ressource hängt ihre Wirksamkeit jedoch davon ab, wie Teams sie einsetzen. Vor diesem Hintergrund folgen einige Best Practices für synthetische Daten.

Verstehen, wann synthetische Daten eingesetzt werden sollten

Die erste und wohl wichtigste Überlegung bei synthetischen Daten ist die Frage, wann sie die geeignetste Wahl darstellen. Synthetische Datensätze bieten gegenüber Originaldaten zwar viele Vorteile, sind aber nicht immer das, was Teams benötigen.

Unternehmen sollten ihre ML-Ziele überprüfen, um festzustellen, ob Informationen aus der realen Welt erforderlich sind. Generell eignen sich synthetische Daten ideal zum Testen von „Was-wäre-wenn“-Szenarien, wenn Daten aus der realen Welt nur begrenzt oder unausgewogen vorhanden sind oder der Datenschutz ein großes Anliegen ist. Originaldaten sind dagegen möglicherweise besser geeignet für digitale Zwillinge, wenn Ausreißer besonders wichtig sind oder Informationen aus der realen Welt problemlos verfügbar sind.

In manchen Fällen kann es am besten sein, hybride Datensätze zu verwenden. Teams müssen ihre Ziele und Einschränkungen bestimmen, um zu verstehen, welche Strategie für ihr spezifisches ML-Projekt am besten geeignet ist.

Daten vor der Erzeugung bereinigen und aufbereiten

Auch bei synthetischen Informationen ist es wichtig, die Datenaufbereitung und -bereinigung nicht zu übersehen. Daten von schlechter Qualität kosten Unternehmen durchschnittlich 15 Millionen US-Dollar pro Jahr, und 60 % der Unternehmen wissen nicht einmal, wie viel sie schlechte Daten kosten. Um diese Kosten zu vermeiden, müssen Teams ihre synthetischen Daten vor der Verwendung aufbereiten.

Synthetische Daten können zwar in bereits standardisierten Formaten erzeugt werden, doch auch dabei können Fehler auftreten. Teams müssen diese Datensätze prüfen, um sicherzustellen, dass sie vor der Verwendung sauber und organisiert sind und die synthetischen Informationen optimal genutzt werden können.

Eine gute Grundlage kann die Verwendung hochwertiger Originalinformationen für die Erzeugung synthetischer Daten sein. Je besser die Quelle, desto besser die Dummy-Daten – und desto geringer der Zeitaufwand für Bereinigung und Aufbereitung.

Advertisement

Die beste Erzeugungsmethode bestimmen

Unternehmen sollten außerdem verstehen, dass verschiedene Methoden zur Datenerzeugung unterschiedliche Stärken und Schwächen haben. Diese zu vergleichen, um die beste Option zu finden, ist ebenso wichtig wie die Entscheidung zwischen synthetischen Daten und Originaldaten.

Variational Autoencoder (VAEs) können komplexe Datensätze effizient erzeugen und sind einfach zu implementieren, haben bei komplexen Originaldatensätzen jedoch Schwierigkeiten, über alle Datentypen hinweg eine gleichbleibende Qualität zu liefern. Generative adversarielle Netzwerke (GANs) funktionieren dagegen gut mit unstrukturierten oder komplexen Originaldatensätzen, sind aber schwieriger zu trainieren und zu implementieren.

Manchmal kann es am besten sein, die Erzeugung synthetischer Datensätze auszulagern. Das Angebot wächst: Mehr als 70 Anbieter stellten 2021 synthetische Daten bereit. Teams sollten ihre internen Kompetenzen, Budgets und Anforderungen prüfen, um den besten weiteren Weg zu bestimmen.

Synthetische Daten können das Potenzial von ML-Projekten freisetzen

Um ML optimal zu nutzen, sind große, zuverlässige und sichere Datensätze erforderlich. In vielen Fällen können synthetische Daten diese bereitstellen und gleichzeitig Komplikationen im Zusammenhang mit Originalinformationen minimieren.

ML-Entwickler sollten prüfen, wie synthetische Daten ihre Projekte verbessern könnten. Die optimale Nutzung dieser Ressource kann erhebliche Vorteile in Bezug auf Genauigkeit, Effizienz, Sicherheit und Finanzen mit sich bringen. Dies wiederum macht ML für viele Unternehmen zu einem lohnenderen Vorhaben.

Siehe auch: 7 Herausforderungen im Enterprise Networking 

Devin Partida

Devin Partida

Content Writer

Devin Partida writes about business technology and innovation. Her work has been featured on Yahoo! Finance, Entrepreneur, Startups Magazine, and other industry publications. She is also the Editor-in-Chief of ReHack.

Enterprise Networking Planet Logo

Enterprise Networking Planet aims to educate and assist IT administrators in building strong network infrastructures for their enterprise companies. Enterprise Networking Planet contributors write about relevant and useful topics on the cutting edge of enterprise networking based on years of personal experience in the field.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.