Level 3 KI im Trading · Teil 7/8

Backtest-Overfitting: die Zahl der Versuche zählt mit

Dies ist der wichtigste Artikel dieser Stufe. Alle bisherigen Verfahren beheben Fehler in der Konstruktion. Dieser behandelt einen Fehler in der Auswertung – und er ist der teuerste.

Das Grundproblem

Angenommen, fünfzig Strategien werden getestet, von denen keine einzige einen echten Vorteil hat. Ihre Sharpe Ratios streuen zufällig um null. Die beste dieser fünfzig wird trotzdem deutlich positiv sein – nicht wegen Können, sondern weil ein Maximum aus fünfzig Ziehungen erwartungsgemäß weit rechts liegt.

123alysly.com
(1) So verteilt sich die Sharpe Ratio EINER Strategie ohne jeden Vorteil — Mittelwert null. (2) So verteilt sich der BESTE Wert aus 50 gleichermaßen wertlosen Versuchen: Er liegt erwartungsgemäß bei etwa 2,8. (3) Ein Backtest mit Sharpe 2,2 sieht gegen die linke Verteilung großartig aus und gegen die rechte unterdurchschnittlich. Deshalb ist die Zahl der ausprobierten Varianten Teil des Ergebnisses — wer sie verschweigt, berichtet ein Maximum und nennt es Leistung.

Der Erwartungswert des Maximums wächst dabei mit der Wurzel des Logarithmus der Versuchszahl. Aus fünfzig wertlosen Versuchen resultiert typischerweise ein Bestwert um 2,8 – eine Zahl, die in jeder Präsentation als exzellent durchgeht.

Daraus folgt der Kernsatz dieses Kapitels: Eine Sharpe Ratio ohne Angabe der Versuchszahl ist keine Information.

Warum die Versuchszahl fast immer unterschätzt wird

Die meisten Anwender würden bestreiten, fünfzig Varianten getestet zu haben. Tatsächlich zählen viel mehr Entscheidungen mit, als bewusst wahrgenommen werden:

Der letzte Punkt ist entscheidend. Auch abgebrochene Versuche zählen. Wer eine Variante nach fünf Sekunden Kurvenbetrachtung verwirft, hat einen Test durchgeführt und dessen Ergebnis verwendet.

Deflated Sharpe Ratio

Das Gegenmittel ist eine Korrektur, die die Versuchszahl explizit einrechnet. Die Deflated Sharpe Ratio fragt: Wie wahrscheinlich ist es, dass die beobachtete Sharpe Ratio bei der gegebenen Zahl von Versuchen allein durch Zufall entsteht?

In die Rechnung gehen ein: die beobachtete Sharpe Ratio, die Länge der Reihe, die Zahl der Versuche sowie Schiefe und Wölbung der Renditeverteilung. Die beiden letzten Größen sind kein Beiwerk – Strategien mit vielen kleinen Gewinnen und seltenen großen Verlusten (etwa Optionsverkäufe) erzeugen Sharpe Ratios, die die klassische Formel systematisch überschätzt.

Das Ergebnis ist keine neue Kennzahl fürs Marketing, sondern eine Wahrscheinlichkeit: Wie sicher ist es, dass hier überhaupt etwas ist?

Overfitting-Wahrscheinlichkeit

Ein zweiter, komplementärer Ansatz. Die Daten werden mehrfach in Trainings- und Testhälften geteilt, jeweils in unterschiedlichen Kombinationen. Für jede Aufteilung wird die auf der Trainingshälfte beste Variante bestimmt und geprüft, wie sie sich auf der Testhälfte schlägt.

Landet die im Training beste Variante im Test regelmäßig unterhalb des Medians, ist die Auswahl überangepasst. Der Anteil solcher Fälle ist die Overfitting-Wahrscheinlichkeit (PBO). Nähert sie sich 50 Prozent, wählt das Verfahren rein zufällig aus.

Der praktische Wert liegt darin, dass hier nicht eine einzelne Strategie geprüft wird, sondern der Auswahlprozess. Genau der ist die Fehlerquelle.

Was das praktisch heißt

Der unbequeme Schluss

Die meisten veröffentlichten Backtests – in Büchern, in sozialen Medien, in Produktbroschüren – nennen keine Versuchszahl. Nach allem, was dieser Artikel beschreibt, sind ihre Kennzahlen damit nicht interpretierbar. Das ist kein Vorwurf an einzelne Autoren, sondern eine strukturelle Eigenschaft: Wer ein Ergebnis präsentiert, hat fast immer aus mehreren ausgewählt.

Weiterlesen

Zum Abschluss: was Modelle über ihre eigenen Merkmale sagen können – und wie aus einer Wahrscheinlichkeit eine Positionsgröße wird.