Die Qualität von Trainingsdaten ist der wesentliche Einflussfaktor für die Leistungsfähigkeit einer KI. Die Generierung der Daten ist aber auch der Hauptkostentreiber. Sowohl die Auswahl geeigneter Rohdaten als auch die manuelle Annotation sind sehr zeitintensiv.
Aufwand und Kosten lassen sich jedoch wesentlich reduzieren: Für viele Anwendungsfälle können Messszenarien mit frei verfügbaren Modellen parametrisch generiert werden, die dann durch die Simulation der Messung künstliche Messdaten erzeugen. Dies kann eine photorealistische Computergrafik (»Rendering«) für eine Bild-KI oder auch eine Punktwolke eines simulierten Laserscanners sein. Der Clou: Da die Szene aus bekannten Modellen zusammengesetzt ist, denen eine Klasse zugewiesen werden kann, lässt sich diese Information auch in die Messdaten übertragen – so können die synthetischen Daten ohne weitere Bearbeitung als Trainingsdaten verwendet werden. Fraunhofer IPM entwickelt Software zur automatischen Erstellung synthetischer Trainingsdaten aus dreidimensionalen Modellen. Beim Rendern der jeweiligen Szene nutzen wir unser umfassendes Know-how in den Bereichen Modellierung und Messtechnik.
Die synthetischen Daten bilden dabei die Realität nie perfekt ab – es bleibt der sog. »Domain Gap«: Das neuronale Netz muss noch lernen, die auf synthetischen Daten gelernten Features auf reale Daten zu übertragen. Dies erreichen wir zum einen durch eine sinnvolle Mischung zwischen synthetischen und realen Trainingsdaten. Zum anderen optimieren wir die Generierung der Trainingsdaten nicht in erster Linie auf eine möglichst detailgetreue, realitätsnahe Szenengenerierung, sondern auf die für den Lernerfolg des Netzes relevanten Parameter (wie z.B. korrekte Simulation des Messrauschens einer Punktwolke).