Künstliche Intelligenz und Maschinelles Lernen mit Entscheidungsbäumen

Kurzbeschreibung

Die Unterrichtsreihe führt Schülerinnen und Schüler am Beispiel datenbasierter Entscheidungsbäume schrittweise in grundlegende Ideen des maschinellen Lernens ein. Ausgangspunkt ist die Frage, wie Onlineplattformen auf Grundlage vorhandener Daten Vorhersagen über Nutzerinnen und Nutzer treffen und diese beispielsweise für personalisierte Empfehlungen verwenden können. Die Reihe gliedert sich dabei in zwei zentrale Schwerpunkte: Zunächst steht die datenbasierte Konstruktion von Entscheidungsbäumen im Mittelpunkt, bevor der Blick auf deren Evaluation und die Grenzen datenbasierter Klassifikationsmodelle gerichtet wird.

Zunächst erarbeiten die Schülerinnen und Schüler schrittweise einen Algorithmus zur datenbasierten Konstruktion von Entscheidungsbäumen. Ausgangspunkt sind eigene Vorgehensweisen zur Klassifikation neuer Fälle und zur Konstruktion ein- und mehrstufiger Entscheidungsbäume. Diese zunächst intuitiven und teilweise kontextbasierten Vorgehensweisen werden zunehmend systematisiert: Entscheidungen über die Konstruktion eines Baums werden anhand formalisierter Kriterien getroffen und schließlich zu einem Algorithmus zur datenbasierten Konstruktion von Entscheidungsbäumen zusammengeführt.

Im weiteren Verlauf verschiebt sich der Schwerpunkt von der Konstruktion zur Evaluation datenbasierter Modelle. Die Schülerinnen und Schüler untersuchen zunächst, wie gut Entscheidungsbäume auf neuen Daten funktionieren, und setzen sich darauf aufbauend mit Überanpassung an die Trainingsdaten (Overfitting) sowie Möglichkeiten zur Begrenzung der Modellkomplexität auseinander. Anschließend untersuchen sie, wie sich eine verzerrte Zusammensetzung der Trainingsdaten auf den entstehenden Entscheidungsbaum und seine Klassifikationsleistung auswirken kann (Selection Bias). Abschließend erweitern sie die leistungsbezogene Evaluation um eine kontextsensitive Perspektive, indem sie unterschiedliche Fehlklassifikationen, deren mögliche Konsequenzen sowie verschiedene Perspektiven auf den Einsatz eines Klassifikators berücksichtigen.

Begleitend erfolgt ein sukzessiver Wechsel der verwendeten Werkzeuge: von physischen Datenkarten, die einen unmittelbaren Zugang zu den einzelnen Fällen und Konstruktionsschritten ermöglichen, über CODAP, in dem Entscheidungsbäume interaktiv konstruiert und untersucht werden, hin zu einer menübasierten Jupyter-Umgebung mit Treech, in der die zuvor entwickelte Konstruktion automatisiert und unterschiedliche Modelle, Konstruktionsvarianten und Datengrundlagen systematisch untersucht werden können.

Target group

Informatik und Mathematik in Klasse 11 und 12

Empfehlung: Klasse 12

Inhaltsfeld

“Künstliche Intelligenz und maschinelles Lernen” (insbesondere der Schwerpunkt: überwachtes Lernen mit Entscheidungsbäumen)

Time scope

 12 bis 14 Unterrichtsstunden a 45 Minuten

Leitfragen

  • Wie können Onlineplattformen mithilfe von Daten vorhersagen, welche Werbung für Nutzerinnen und Nutzer interessant sein könnte
 
  • Wie können Entscheidungsbäume datenbasiert konstruiert und ihre Konstruktion systematisiert werden
 
  • Wie können wir beurteilen, wie gut ein Entscheidungsbaum funktioniert?
 
  • Welche Limitationen müssen beim Einsatz datenbasierter Entscheidungsbäume berücksichtigt werden – und wie können wir damit umgehen?

Goals

Die folgenden Lernziele beschreiben die übergeordneten Zielsetzungen der gesamten Unterrichtsreihe. Detailliertere Lernziele finden sich in den Beschreibungen der einzelnen Phasen.

Die Schülerinnen und Schüler …

… erläutern Klassifikation als eine Form datenbasierter Vorhersage im maschinellen Lernen und beschreiben am Beispiel personalisierter Empfehlungssysteme grundlegende Bestandteile eines Klassifikationsproblems.

… konstruieren und interpretieren datenbasierte Entscheidungsbäume und erläutern, wie aus Trainingsdaten schrittweise Klassifikationsregeln entstehen.

… erläutern ein algorithmisches Verfahren zur datenbasierten Konstruktion von Entscheidungsbäumen.

… evaluieren Entscheidungsbäume anhand neuer Daten und erläutern die unterschiedlichen Funktionen von Trainings-, Validierungs- und Testdaten.

… erläutern mögliche Grenzen datenbasierter Modelle, insbesondere Überanpassung an die Trainingsdaten (Overfitting) sowie mögliche Auswirkungen einer verzerrten Zusammensetzung von Trainingsdaten (Selection Bias).

… beurteilen Klassifikatoren kontextsensitiv, indem sie neben der Klassifikationsleistung unterschiedliche Fehlklassifikationen und deren mögliche Konsequenzen sowie relevante Perspektiven auf den Anwendungskontext berücksichtigen.

Lesson overview

Phase 1 – Empfehlungssysteme auf Onlineplattformen
Phase Content Material
30 min

1 – Empfehlungssysteme auf Onlineplattformen

Die Phase führt am Beispiel personalisierter Werbung auf Instagram in den Anwendungskontext datenbasierter Vorhersagen auf Onlineplattformen ein. Die Lehrkraft entwickelt dazu gemeinsam mit den SuS schrittweise, wie Plattformen Daten über Profile – etwa zu Interessen oder zum Nutzungsverhalten – erfassen und daraus Annahmen über weitere, nicht bekannte Eigenschaften eines Profils ableiten können. Anhand einer Datentabelle wird anschließend betrachtet, wie Informationen über Profile strukturiert vorliegen können und dass bestimmte Informationen für einzelne Profile fehlen können. Abschließend werden diese Aspekte zusammengeführt und die Idee entwickelt, vorhandene Daten zu nutzen, um solche fehlenden Informationen vorherzusagen. Wie eine solche datenbasierte Vorhersage konkret zustande kommt, bleibt bewusst offen und bildet den Ausgangspunkt für Phase 2.

Phase Content Material

60 min

2 – Konstruktion einstufiger Entscheidungsbäume mit Datenkarten

Ausgehend von der offenen Frage, wie ein neues Profil anhand vorhandener Daten klassifiziert werden kann, entwickeln die SuS mit Datenkarten zunächst eigene Vorgehensweisen und vergleichen ihre unterschiedlichen Begründungen. Daran anknüpfend führt die Lehrkraft schrittweise ein systematisches Vorgehen zur Konstruktion eines einstufigen Entscheidungsbaums ein: Die Trainingsdaten werden anhand eines Merkmals aufgeteilt, in den entstandenen Gruppen werden Mehrheitsentscheidungen getroffen und Fehlklassifikationen bestimmt. Die SuS wenden dieses Vorgehen anschließend selbst auf weitere Merkmale an und vergleichen die entstandenen Entscheidungsbäume. Abschließend wird das Vorgehen gemeinsam gesichert und der Übergang zur digitalen Umsetzung mit CODAP vorbereitet.

Phase Content Material
45 min

3 – Konstruktion einstufiger Entscheidungsbäume mit CODAP

Die SuS übertragen das aus Phase 2 bekannte Vorgehen zur Konstruktion einstufiger Entscheidungsbäume auf die digitale Umgebung CODAP. Die Lehrkraft führt zunächst anhand eines Beispiels in die benötigten Funktionen und Darstellungen ein und stellt dabei jeweils den Bezug zum händischen Vorgehen mit den Datenkarten her; zusätzlich werden die verschiedenen Arten richtiger und falscher Klassifikationen und ihre Darstellung in der Konfusionsmatrix eingeführt. Anschließend erstellen und vergleichen die SuS in Partnerarbeit selbstständig weitere einstufige Entscheidungsbäume in CODAP. Damit wird der Umgang mit dem digitalen Werkzeug vorbereitet, das in Phase 4 für die offenere Konstruktion mehrstufiger Entscheidungsbäume genutzt wird.

Phase Content Material
70 min

4 – Konstruktion mehrstufiger Entscheidungsbäume in CODAP

Die SuS konstruieren in CODAP erstmals selbstständig mehrstufige Entscheidungsbäume. Dabei entscheiden sie selbst, welche Prädiktorvariablen sie für weitere Datensplits verwenden und wann sie die Konstruktion ihres gesamten Entscheidungsbaums beenden. Anschließend präsentieren und vergleichen sie ihre Entscheidungsbäume und die dabei verwendeten Vorgehensweisen. Aus den unterschiedlichen Strategien entwickelt die Lehrkraft gemeinsam mit den SuS zwei zunächst offene Fragen: Wie lassen sich Entscheidungsbäume systematisch und datenbasiert konstruieren und wie lässt sich beurteilen, wie gut unterschiedliche Bäume neue Fälle klassifizieren? Insbesondere wird gefragt, ob typischerweise vergleichsweise große oder kleine Bäume für neue Fälle besser funktionieren. Diese Fragen führen in die Phasen 5 und 6.

Phase Content Material
65 min

5 – Konstruktion wie ein Entscheidungsbaum-Algorithmus: „Maschine spielen“ in CODAP

Die in Phase 4 offengebliebene Frage nach einer systematischen Konstruktion von Entscheidungsbäumen wird aufgegriffen. Nach der Einführung der Fehlklassifikationsrate lernen die SuS die CODAP-Funktion „Daten ausgeben“ kennen und nutzen sie, um mögliche Datensplits systematisch zu dokumentieren und anhand ihrer Fehlklassifikationsrate zu vergleichen. Anschließend „spielt“ die Klasse gemeinsam eine Maschine: Die Lehrkraft moderiert die schrittweise Konstruktion des Entscheidungsbaums und verteilt die jeweils zu untersuchenden Prädiktorvariablen auf die Paare. Diese bestimmen arbeitsteilig die Fehlklassifikationsraten, die Ergebnisse werden im Plenum zusammengeführt und der jeweils beste Split ausgewählt. Für die entstandenen Teildatensätze wird dieses Vorgehen wiederholt bzw. anhand eines festen Kriteriums ein Pfad beendet. Abschließend wird das durchgeführte Vorgehen gemeinsam als Algorithmus zur datenbasierten Konstruktion eines Entscheidungsbaums rekonstruiert und als Flussdiagramm gesichert.

Phase Content Material
45 min

6 – Evaluation von Entscheidungsbäumen mit Testdaten

Die in Phase 4 aufgeworfene Frage, ob kleine oder große Entscheidungsbäume neue Fälle besser klassifizieren, wird anhand zweier konkreter Bäume wieder aufgegriffen: einem großen Baum, der die Trainingsdaten ohne Fehlklassifikation klassifiziert, und einem kleineren Baum mit moderater Fehlklassifikationsrate. Die Lehrkraft führt Testdaten als Möglichkeit ein, die Klassifikationsleistung auf neuen Daten zu überprüfen, und demonstriert deren Verwendung in CODAP. Anschließend untersuchen die SuS beide Bäume in Partnerarbeit auf Trainings- und Testdaten. In der gemeinsamen Besprechung zeigt sich, dass der auf den Trainingsdaten bessere Baum auf den Testdaten schlechter abschneidet. Warum dies geschieht und wie der Konstruktionsalgorithmus darauf reagieren könnte, bleibt als Ausgangspunkt für Phase 7 offen.

Phase Content Material
90 min

7 – Evaluation von Varianten des Konstruktionsalgorithmus (Overfitting und Pruning)

Anknüpfend an die Beobachtung aus Phase 6, dass ein großer Entscheidungsbaum auf den Trainingsdaten besser, auf neuen Daten jedoch schlechter abschneiden kann, führt die Lehrkraft zunächst in die automatisierte Konstruktion von Entscheidungsbäumen mit Treech und die menübasierte Jupyter-Umgebung ein. Die SuS untersuchen anschließend arbeitsteilig drei Möglichkeiten zur Begrenzung der Baumkomplexität: Max_Tiefe, Min_Faelle und nachträgliches Beschneiden. Nach der Präsentation ihrer Ergebnisse wird das beobachtete Phänomen als Overfitting systematisiert, das sich in einer deutlich schlechteren Klassifikationsleistung auf Testdaten als auf Trainingsdaten äußert und mit zunehmender Baumkomplexität, kleinen Teildatensätzen und der Anpassung an einzelne Trainingsfälle in Verbindung gebracht wird. Anschließend werden die drei untersuchten Ansätze hinsichtlich ihrer Vor- und Nachteile verglichen und das nachträgliche Beschneiden als besonders geeigneter Ansatz weiterverfolgt. Die Lehrkraft führt schließlich ein systematisches Verfahren zum Beschneiden von Entscheidungsbäumen ein, das als Erweiterung des bisher bekannten Konstruktionsalgorithmus angewendet werden kann.

Phase Content Material
90 min

8 – Evaluation der Auswirkungen verzerrter Trainingsdaten (Selection Bias)

Ausgehend von einer auffälligen Zusammensetzung des bereits bekannten Datensatzes wird die Frage entwickelt, welche Auswirkungen die Zusammensetzung der Trainingsdaten auf einen Entscheidungsbaum haben kann. Die SuS erzeugen anschließend in Gruppen unterschiedliche Verzerrungen der Trainingsdaten und vergleichen die daraus entstehenden Entscheidungsbäume mit denen aus den ursprünglichen Daten hinsichtlich Baumstruktur sowie gesamter und gruppenspezifischer Klassifikationsleistung auf Testdaten. Die unterschiedlichen Gruppenergebnisse werden zusammengeführt und verglichen. Dabei werden sehr starke bis hin zu praktisch keinen Auswirkungen beobachtet. Es wird herausgearbeitet, dass verzerrte Trainingsdaten den entstehenden Entscheidungsbaum und seine Klassifikationsleistung insgesamt sowie für einzelne Gruppen beeinflussen können, die Auswirkungen jedoch je nach Verzerrung und Vorhersageproblem unterschiedlich stark ausfallen. Abschließend führt die Lehrkraft den Begriff Selection Bias ein und systematisiert gemeinsam mit den SuS die zuvor beobachteten Phänomene.

Phase Content Material
90 min

9 – Kontextsensitive Evaluation von Klassifikatoren

Ausgehend von der bereits bekannten Konfusionsmatrix wird zunächst die Unterscheidung verschiedener Arten korrekter und falscher Klassifikationen vertieft und die Frage aufgeworfen, ob die Fehlklassifikationsrate allein ausreicht, um Klassifikatoren angemessen zu bewerten. Die SuS arbeiten heraus, dass unterschiedliche Fehlklassifikationen unterschiedliche Konsequenzen haben können. Anschließend vergleichen sie dieselben Klassifikationsergebnisse am Beispiel eines Uploadfilters und eines Empfehlungssystems in unterschiedlichen Anwendungskontexten und aus verschiedenen Perspektiven und entwickeln begründete Bewertungen der Klassifikatoren. Dabei wird herausgearbeitet, dass dieselben Klassifikationsergebnisse je nach Anwendungskontext und betrachteter Perspektive unterschiedlich beurteilt werden können. Abschließend werden die gewonnenen Erkenntnisse verallgemeinert und das zuvor praktisch verwendete Vorgehen als Schema zur kontextsensitiven Evaluation systematisiert: Identifizieren – Beurteilen – Entscheiden.

Datensatz

In weiten Teilen der Unterrichtsreihe werden Daten zur Mediennutzung von Jugendlichen verwendet, die 2021 im Rahmen des Projekts ProDaBi bei über 1.287 Jugendlichen erhoben wurden. Die Erhebung orientierte sich am Fragebogen der JIM-Studie; bei den erhobenen Daten handelt es sich um eine Gelegenheitsstichprobe ohne Anspruch auf Repräsentativität. Für die verschiedenen Phasen der Unterrichtsreihe werden didaktisch aufbereitete Ausschnitte und Varianten des Datensatzes verwendet.

YOU-PB Daten: https://www.prodabi.de/unterricht/toolkit/you-pb-daten/

Entscheidungsbäume mit CODAP erstellen

CODAP (Common Online Data Analysis Platform) ist eine kostenlose, browserbasierte Umgebung zur interaktiven Datenanalyse, die sich besonders für den schulischen Einsatz eignet. Sie ermöglicht es, Datensätze intuitiv zu erkunden, grafisch darzustellen und mit Analysewerkzeugen zu bearbeiten – ohne dass Programmierkenntnisse erforderlich sind.

Für das Thema Entscheidungsbäume steht in CODAP das Plug-In Arbor zur Verfügung. Arbor erlaubt es, Klassifikationsbäume sowohl schnell und explorativ zu erstellen als auch systematisch – ähnlich wie ein Algorithmus – zu konstruieren. So können Lernende zunächst einfache, einstufige Bäume erzeugen, die Entscheidungsregeln aus den Daten ableiten, und diese anschließend um weitere Stufen erweitern.

Neben der visuellen Darstellung der Entscheidungsstruktur bietet Arbor wichtige Analysefunktionen:

  • Mehrheitsentscheidungen in Blattknoten setzen

  • Trefferübersichten und Konfusionsmatrizen anzeigen

  • Fehlklassifikationsraten berechnen

  • mit der Funktion „Daten ausgeben“ verschiedene Varianten dokumentieren und vergleichen

Damit unterstützt CODAP/Arbor sowohl das intuitive Erkunden als auch das formalisierte Vorgehen beim Erstellen von Entscheidungsbäumen. Lernende können erleben, wie sich Entscheidungen aus Daten ableiten lassen, und nachvollziehen, wie ein Computer bei der Auswahl optimaler Entscheidungsregeln Schritt für Schritt vorgeht.

Mit Daten zum Medienverhalten von Jugendlichen wird im Unterricht folgende Leitfrage verfolgt:

  • Wie kann man mit Hilfe der Daten ein Empfehlungssystem konstruieren, das das persönliche Interesse von Personen an Onlinespielen vorhersagt, um dann entsprechend Werbung für Onlinespiele zu empfehlen?

Ein solches Empfehlungssystem bezeichnet man als Klassifikator, da einzelne Objekte (hier Personen) basierend auf ihren Merkmalen einer Klasse („spielt häufig Onlinespiele“ oder „spielt selten Onlinespiele“) zugeordnet werden, d. h. sie werden klassifiziert. Man unterscheidet dabei zwischen Zielmerkmal, das vorhergesgt werden soll und Prädiktormerkmalen, die zum vorhersagen genutzt werden.

Such a classifier is developed on the basis of a set of objects for which both the values of the predictor variables and of the target variable are known. These are the so-called training data. The ultimate goal, however, is that the recommendation also works for new objects. First, the system is tested with test data that were not involved in the training process but for which the values of the target variable are known. This makes it possible to estimate the probability with which the system classifies new objects with an unknown value correctly.

Basisfunktionen von CODAP und Arbor

In diesem Video wird gezeigt, wie mit Hilfe von CODAP ganz einfach datenbasierte Entscheidungsbäume per Drag & Drop erstellt werden können.

Mit folgendem Link gelangst du in die im Video genutzte CODAP Umgebung: https://tinyurl.com/CODAPEntscheidungsbaum

In diesem Video wird gezeigt, wie der in den vorherigen Items beschriebene Algorithmus in CODAP umgesetzt werden kann, sodass man gewissermaßen “Maschine spielt”.

Der Ansatz dabei ist, dass der Algorithmus durch Schülerinnen und Schüler semi-autmatisch durchgeführt wird, sodass sie die systematische Vorgehensweise handelnd verinnerlichen können.

Mit folgendem Link gelangst du in die im Video genutzte CODAP Umgebung: https://tinyurl.com/CODAPEntscheidungsbaum

Materials

Download of all materials

Hier können Sie alle Arbeitsblätter, Hilfszettel und Hinweisblätter als komprimierten Ordner herunterladen:

Further information

E-Fortbildung

Zu diesem Unterrichtsmodul bieten wir auch eine E-Fortbildung an. Diese finden sie hier

Kurzübersicht über die Inhalte der Unterrichtsstunden

Citation:

Fleischer, Y., Biehler, R. (2026). Künstliche Intelligenz und Maschinelles Lernen mit Entscheidungsbäumen. https://www.prodabi.de/materialien/kuenstliche-intelligenz-und-maschinelles-lernen-mit-entscheidungsbaeumen-sekii/

Veröffentlicht am 29.09.2026

Version:

License note:

Creative Commons Attribution-ShareAlike (CC BY-SA 4.0)

Nach oben scrollen