
Einleitung
Ausgangspunkt nach dem Motto “Tech4Good” war das Problem der Pollenbelastung durch blühende Bäume. Dies brachte uns auf die Idee, ein Modell zu trainieren, dass anhand von Luftbildaufnahmen die Baumart vorhersagt, denn verschiedene Baumarten bringen spezifische und unterschiedliche Belastungen für verschiedene Personen mit sich.

Methodik
Einen großen Teil der Arbeit hat die Auseinandersetzung mit digitalen Orthophotos eingenommen, die als georeferenzierte Luftbildaufnahmen für das Land NRW durch regelmäßige, flächendeckende Befliegungen vorliegen (Daten-Tool: https://www.tim-online.nrw.de/). Diese stellen im Sinne des Modelltrainings die Daten für die zu erkennenden (grafischen) Muster dar. Im Sinne des supervised learnings liegen mit dem Baumkataster der Stadt Münster gelabelte Datenpunkte vor. Das Baumkataster verzeichnet für städtische Bäume im Stadtgebiet Münster die Geokoordinaten sowie den lateinischen Namen der Baumgattung. Wenn damit auch die beiden Input-Datensätze für ein supervised learning vorliegen, so stellte eine große Herausforderung dar, dass das Baumkataster Punktkoordinaten enthält, die grafischen Muster jedoch Flächen sind. Das Modell Faster R-CNN, das unser Mentor empfohlen hat, arbeitet mit sogenannten ‘bounding boxes’. Es galt also, um die Punktkoordinaten Koordinaten für Boxen zu bilden, die ungefähr der Abdeckung durch eine Baumkrone entsprechen. Verkomplizierende Faktoren bei dem Vorhaben sind:
dass im Kataster anstelle einer Gattung auch Überbegriffe wie Baumgruppe oder andere Bezeichnungen vorkamen. Dies konnten wir durch Anfügen weiterer Spalten und einer automatisierten Abfrage über eine offizielle Webseite mit allen vorkommenden Gattungsnamen mit API lösen.
dass Bäume unterschiedliche Ausdehnungen haben, sich z.T. gegenseitig überdecken (sich damit Boxen und Bildinformationen überlagern)
dass die verschiedenen Klassen (Baumgattungen) recht unterschiedlich häufig und unterschiedlich stark konzentriert im Stadtgebiet von Münster vorkommen
dass die aktuellen Luftbilder im Winter aufgenommen wurden und kein Laub trugen. Durch Recherche haben wir Aufnahmen von Sommer 2020 gefunden, allerdings in einem Format, das auch erst umgewandelt werden musste.
dass das Kataster für Bäume innerhalb des Promenadenrings aktueller waren, als außerhalb. Erste Trainings haben sich dehalb zunächst auf die Luftbildkacheln innerhalb des Promenadenrings konzentriert.
dass nur städtische Bäume gelabelt vorliegen, auf den Luftbildern aber auch ein Großteil ungelabelter Bäume in Gärten und Parks vorhanden ist. Um diesem Rechnung zu tragen wurden verschiedene Herangehensweisen geprüft. Eine Herangehensweise war (hier leider nicht dokumentiert) mithilfe des Straßennetzes nur die Luftbildauschnitte zu verwenden, die in der Nähe der Straßen sind, um möglichst viele gelabelte Bäume für das Training zu erhalten.

Ergebnisse
Eine rudimentäre Version des Faster R-CNN wurde trainiert mit:
4 georeferenzierten Luftbildaufnahmen des Zentrums von Münster. Diese 4 tiles wurden mit der Bibliothek rasterio geladen und dann in kleinere Batchen () zerschnitten, da ein vollständiger tile zu groß wäre.
Das Modell wurde mit 5 Epochen trainiert
Die loss curve fällt von über .95 bei der ersten Epoche auf rund .75 bei der zweiten und dann weiter bis auf .65 bei der fünften Epoche.
Unsere Learnings sind:
Die Vorbereitung der Daten ist ein aufwendiger Prozess, insbesondere der Schritts von Punktkoordinaten zur Definition von Bounding Boxes für das Modell Faster R-CNN. Wie haben auf diese Schritte sehr viel Zeit verwendet und es wurden viele Randbedingungen exploriert, die potenziell Einfluss auf das Training des Modells haben. So blieb zum Schluss wenig Zeit, uns mit den eigentlichen Modellläufen auseinander zusetzen. Daher fallen leider viele interessante Ansätze zur qualitäsverbessernden Modellierung im Endergebnis unter den Tisch.
Kleinere Vorvarianten zeigten, dass es vieler guter gelabelter Daten bedarf und dass das Training eines großen Modells viel Rechenkapazität erfordert hätte. Den Workflow von kleinen Ansätzen in andere Arbeitsumgebungen, wie Kaggle, zu transferieren war eine Hürde, die zwar in Arbeit war, aber doch mehr Zeit zur vollständigen Umsetzung gebraucht hätte.
Team
Christian Wolf
Exploration und Check der Luftbild- und Baumkataster-Daten; Programmierung wesentlicher Funktionen und Organisation des Codes; Zwischenpräsentation
Heidi
Initiale Idee; Exploration und Check der Luftbild- und Baumkataster-Daten; alternative Implementierung eines zweistufigen Modelltrainings
Danial Sansui
Recherche Vorbeitung und Test des Modelltrainings; Zwischenpräsentation
Sarah Rinke
Datenmanagement
Moritz Rüller
Exploration des Baumkatasters; Validierungs des Codes; Training eines minimalen, funktionsfähigen Variante des Faster R-CNN Modells; Zwischenpräsentation
Mentor:in
Thomas Viehmann










