Level 3 KI im Trading · Teil 7/8
Backtest-Overfitting: die Zahl der Versuche zählt mit
Dies ist der wichtigste Artikel dieser Stufe. Alle bisherigen Verfahren beheben Fehler in der Konstruktion. Dieser behandelt einen Fehler in der Auswertung – und er ist der teuerste.
Das Grundproblem
Angenommen, fünfzig Strategien werden getestet, von denen keine einzige einen echten Vorteil hat. Ihre Sharpe Ratios streuen zufällig um null. Die beste dieser fünfzig wird trotzdem deutlich positiv sein – nicht wegen Können, sondern weil ein Maximum aus fünfzig Ziehungen erwartungsgemäß weit rechts liegt.
Der Erwartungswert des Maximums wächst dabei mit der Wurzel des Logarithmus der Versuchszahl. Aus fünfzig wertlosen Versuchen resultiert typischerweise ein Bestwert um 2,8 – eine Zahl, die in jeder Präsentation als exzellent durchgeht.
Daraus folgt der Kernsatz dieses Kapitels: Eine Sharpe Ratio ohne Angabe der Versuchszahl ist keine Information.
Warum die Versuchszahl fast immer unterschätzt wird
Die meisten Anwender würden bestreiten, fünfzig Varianten getestet zu haben. Tatsächlich zählen viel mehr Entscheidungen mit, als bewusst wahrgenommen werden:
- jede geänderte Indikatorperiode,
- jede angepasste Ein- oder Ausstiegsregel,
- jeder gewechselte Zeitraum, jedes ausgeschlossene Instrument,
- jede verworfene Idee, die nach einem Blick auf die Kurve fallen gelassen wurde.
Der letzte Punkt ist entscheidend. Auch abgebrochene Versuche zählen. Wer eine Variante nach fünf Sekunden Kurvenbetrachtung verwirft, hat einen Test durchgeführt und dessen Ergebnis verwendet.
Deflated Sharpe Ratio
Das Gegenmittel ist eine Korrektur, die die Versuchszahl explizit einrechnet. Die Deflated Sharpe Ratio fragt: Wie wahrscheinlich ist es, dass die beobachtete Sharpe Ratio bei der gegebenen Zahl von Versuchen allein durch Zufall entsteht?
In die Rechnung gehen ein: die beobachtete Sharpe Ratio, die Länge der Reihe, die Zahl der Versuche sowie Schiefe und Wölbung der Renditeverteilung. Die beiden letzten Größen sind kein Beiwerk – Strategien mit vielen kleinen Gewinnen und seltenen großen Verlusten (etwa Optionsverkäufe) erzeugen Sharpe Ratios, die die klassische Formel systematisch überschätzt.
Das Ergebnis ist keine neue Kennzahl fürs Marketing, sondern eine Wahrscheinlichkeit: Wie sicher ist es, dass hier überhaupt etwas ist?
Overfitting-Wahrscheinlichkeit
Ein zweiter, komplementärer Ansatz. Die Daten werden mehrfach in Trainings- und Testhälften geteilt, jeweils in unterschiedlichen Kombinationen. Für jede Aufteilung wird die auf der Trainingshälfte beste Variante bestimmt und geprüft, wie sie sich auf der Testhälfte schlägt.
Landet die im Training beste Variante im Test regelmäßig unterhalb des Medians, ist die Auswahl überangepasst. Der Anteil solcher Fälle ist die Overfitting-Wahrscheinlichkeit (PBO). Nähert sie sich 50 Prozent, wählt das Verfahren rein zufällig aus.
Der praktische Wert liegt darin, dass hier nicht eine einzelne Strategie geprüft wird, sondern der Auswahlprozess. Genau der ist die Fehlerquelle.
Was das praktisch heißt
- Versuche protokollieren. Vor dem ersten Test eine Zählung anlegen und jede Variante eintragen, auch die verworfenen.
- Hypothese vor Daten. Wer zuerst begründet, warum ein Zusammenhang existieren sollte, und danach testet, braucht wenige Versuche. Wer sucht, braucht viele – und muss dafür bezahlen.
- Skeptisch gegenüber Bestwerten. Die eine glänzende Variante aus einer langen Reihe ist per Konstruktion die am stärksten überangepasste.
- Ergebnisse mit Bandbreite berichten. Eine Verteilung ist ehrlicher als eine Zahl – dieselbe Logik wie beim Monte-Carlo-Rechner .
Der unbequeme Schluss
Die meisten veröffentlichten Backtests – in Büchern, in sozialen Medien, in Produktbroschüren – nennen keine Versuchszahl. Nach allem, was dieser Artikel beschreibt, sind ihre Kennzahlen damit nicht interpretierbar. Das ist kein Vorwurf an einzelne Autoren, sondern eine strukturelle Eigenschaft: Wer ein Ergebnis präsentiert, hat fast immer aus mehreren ausgewählt.
Weiterlesen
Zum Abschluss: was Modelle über ihre eigenen Merkmale sagen können – und wie aus einer Wahrscheinlichkeit eine Positionsgröße wird.