Cross-Validation ist ein Verfahren für die Validierung von Modellen aus dem Data Mining- und Machine Learning-Bereich.
Die Daten werden in der Data Preparation nach aktuellen Machine-Learning-Standards vorbereitet (Pre-processing). Normalerweise wird nun der Datensatz einmalig in Trainings- und Testdatensatz geteilt (Split). Auf dem Trainingsdatensatz wird das Modell trainiert und auf dem Testdatensatz mit für das Modell ungesehenen Daten evaluiert. Jedoch kann oftmals ein ungünstiger Split in Trainings- und Testdatensatz das Modell gravierend fehlschätzen. Beispielsweise kann die Verteilung der Zielvariable (Target-Klasse) in beiden Split-Datensätzen ungleich sein oder die Verteilung bestimmter Features sich stark unterscheiden. Bei ausreichend großen Datensätzen ist dies jedoch in der Regel kein Problem. Wann ist der Datensatz jedoch groß genug?

