Beide offenen Vorschlaege umgesetzt: Trail 1,0 + Legacy-Recheck

VORSCHLAG 1 - Trail-Multiplikator 1,5 -> 1,0 (core/exit_model.py LIVE.mult),
live verifiziert ("AKTIVIERT ... mult=1.0x").
Voller Sweep mit FIXEM SL 2,0 (backtest_trailmult.py, 8 Werte 0,5-3,0):
enger ist MONOTON besser. Wave-Signal H1/H2 SigmaR:
    0,5 +1258/+2418 · 0,8 +852/+1668 · 1,0 +80/+1360
    1,5 -220/+1305 · 2,0 -394/+1198 · 2,5 -1072/+1327
Optimum am RAND = Warnsignal, deshalb Gegentest auf SQUEEZE-Entries mit
Echtkosten (--squeeze): das Setup lebt von Laeufern, muesste also
dagegenhalten - tut es NICHT (1,0: H1 -0,202/H2 +0,010 · 1,5:
-0,219/-0,032). Deshalb 1,0 (besser als 1,5 in beiden Haelften auf BEIDEN
Signalmengen), aber NICHT 0,5: Randwert, und die Sim modelliert keine
Exit-Slippage - ein engerer Trail loest viel haeufiger aus und ist davon
staerker betroffen (real bis 0,75xATR ueber den Stop).

VORSCHLAG 2 - backtest_legacy_recheck.py (NEU): die beiden Legacy-Befunde
nachgerechnet, die live ECHTE Gates steuern.
  EIA-Blackout BESTAETIGT: auch mit echtem Exit + Echtkosten in BEIDEN
  Haelften schlechter als der Rest (-0,097 / -0,119). Gate ist gedeckt.
  DEAD-HOURS reproduzieren NICHT als selektiver Befund: 19 von 22 Stunden
  sind in beiden Haelften negativ, keine robust positive Stunde. Die alte
  Auswahl (0-7, 12, 16) ist damit nicht mehr gestuetzt. Praktisch folgenlos
  (dead_hours ist leer), aber eine Reaktivierung auf der alten Begruendung
  waere nicht gedeckt.

Einschraenkung selbst benannt: der Recheck handelt die UNGEGATETE
EMA-Richtung (ohne min_conf, Breakout-Bestaetigung, HTF-Filter, Raum-Gate).
Fuer den Vergleich neutral, die absoluten Werte sind nicht das Live-Signal.

Konsequenz fuer den TF-Churn-Fix: "WARTEN Richtung 43 %" ist eine
Haeufigkeits-, keine Ertragsgroesse - mehr Signale sind nur dann besser,
wenn die freigegebenen Setups auch tragen.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
Axel Hocks
2026-07-31 13:09:32 +02:00
co-authored by Claude Opus 5
parent 4c1a68a7e1
commit bb17ecff0a
4 changed files with 260 additions and 9 deletions
+32 -2
View File
@@ -1982,8 +1982,19 @@ konstant; (d) es gab **keine Telemetrie über die Entscheidung selbst**.
| 3,0 | 1088 | +1397 | 2,00 |
**Der Worst-Case ist bei JEDEM Multiplikator identisch 2,00** (der SL deckelt).
**Die Entscheidung bleibt richtig:** 1,5 schlägt 2,0 UND 2,5 in beiden Hälften.
**NEU und offen:** **Trail 1,0 schlägt 1,5 in BEIDEN Hälften** (73/+1346 vs
325/+1294) — eigener Vorschlag, bewusst NICHT ungefragt umgesetzt.
**➜ TRAIL AUF 1,0 GESETZT (User-Vorgabe „setze alle Vorschläge um", 2026-07-31),
in `core/exit_model.py` (`LIVE.mult`), live verifiziert (`AKTIVIERT … mult=1.0x`).**
Voller Sweep (`backtest_trailmult.py`, fixer SL 2,0, 8 Werte 0,53,0): **enger ist
MONOTON besser** — Wave-Signal H1/H2 ΣR: 0,5 **+1258/+2418** · 0,8 +852/+1668 ·
1,0 +80/+1360 · 1,5 220/+1305 · 2,0 394/+1198 · 2,5 1072/+1327.
**Optimum am RAND des Suchbereichs = Warnsignal** („misst man besser oder nur
weniger?"). **Gegentest auf SQUEEZE-Entries mit Echtkosten** (`--squeeze`) — das
Setup lebt von LÄUFERN, müsste also dagegenhalten: **tut es nicht**, auch dort ist
enger monoton besser (1,0: H1 0,202/H2 +0,010 · 1,5: 0,219/0,032). Deshalb der
Schritt auf 1,0 — besser als 1,5 in beiden Hälften auf **beiden** Signalmengen —
aber **nicht** auf 0,5 (Randwert). ⚠ Zweiter Grund gegen 0,5: die Sim modelliert
**keine Exit-Slippage**; ein engerer Trail löst viel häufiger aus und ist stärker
betroffen (real gemessen bis 0,75×ATR über den Stop hinaus).
- **Stufe 2 — ERLEDIGT:** **Entscheidungs-Telemetrie.** (a) Jede Empfehlung loggt
jetzt einen maschinenlesbaren **`block_reason`** (`recommendations.block_reason`,
DB migriert mit Backup): `deadband · dead_hour · eia · htf_counter · stretch ·
@@ -2028,6 +2039,25 @@ konstant; (d) es gab **keine Telemetrie über die Entscheidung selbst**.
**Migrations-Regel (in `exit_model.py` festgehalten):** ein Backtest darf nur auf
`simulate()` umgestellt werden, wenn er danach DIESELBEN Zahlen liefert — sonst ist
es keine Refaktorierung, sondern eine unbemerkte Änderung der Messgrundlage.
**LEGACY-RECHECK (`backtest_legacy_recheck.py`, 2026-07-31): die beiden Befunde
nachgerechnet, die live ECHTE Gates steuern.**
· ✅ **EIA-Blackout BESTÄTIGT** — auch mit dem echten Exit + Echtkosten ist das
Fenster Mi 15:3016:30 in BEIDEN Hälften schlechter als der Rest (ØR-Differenz
0,097 / 0,119). Das aktive Gate ist gedeckt.
· ❌ **DEAD-HOURS reproduzieren NICHT als selektiver Befund** — mit dem echten Exit
sind **19 von 22 Stunden in BEIDEN Hälften negativ**, es gibt **keine** robust
positive Stunde. Die alte Analyse hatte 07 sowie 12 und 16 als *die* schlechten
Stunden herausgehoben; wenn fast alles negativ ist, ist diese Auswahl nicht mehr
gestützt. (Praktisch folgenlos, weil `dead_hours` ohnehin leer ist — aber eine
Reaktivierung auf der alten Begründung wäre nicht gedeckt.)
**Einschränkung des Rechecks (selbst benannt):** er handelt die **ungegatete**
EMA-Richtung — ohne Mindest-Konfidenz, Breakout-Bestätigung, HTF-Filter und
Raum-Gate. Für den VERGLEICH (Fenster gegen Rest, Stunde gegen Stunde) ist das
neutral, die absoluten Werte sind aber NICHT das Live-Signal.
**Konsequenz für die Erfolgskontrolle des TF-Churn-Fixes:** „WARTEN-Anteil
Richtung 43 % bewegen" ist als Zielgröße mit Vorsicht zu lesen — die 43 % stammen
aus `backtest_dist.py` (Signal-HÄUFIGKEIT), sie sind kein Ertragsversprechen. Mehr
Signale sind nur dann besser, wenn die freigegebenen Setups auch tragen.
**Erwartung: die drei Fälle sind nicht vollständig.** Sie wurden bei gezielter Suche
in ~20 min gefunden; die Trefferquote spricht für weitere. `analyze_divergence.py`