KI-Buch (Illab) ausgewertet: Workflow statt Signale, echte Luecke ist die Validierungsmethode

Zweites eingereichtes Buch, anderes Genre: Co-Piloten, No-Code-Bots, Scanner,
Agenten-Pipelines. Triage gegen den Projektstand: 10 von 12 Kapitel-Konzepten
sind gebaut (Copilot, Circuit-Breaker, Logs, Slippage-Messung, Dedup,
Tagesreport, Provider-Fallback) oder gemessen verworfen (Muster, Momentum,
Sentiment). Alt-Daten und Rebalancing sind fuer einen WTI-CFD gegenstandslos.

DIE EINE ECHTE LUECKE: Kap. 9.2 empfiehlt WALK-FORWARD, dieses Projekt prueft
mit ZWEI STICHPROBEN -- das Wort kommt in CLAUDE.md nie vor. Zwei Haelften haben
genau zwei Vorzeichen; ein Setup, das in der Haelfte aller Zeitbloecke negativ
ist, kann trotzdem 'beidhaelftig positiv' aussehen. Genau so ist das
P(break)-Modell ausgefallen (H1->H2 AUC 0,715, live 0,368).

Gemessen am Squeeze, gleiche Daten/Regel/Exit, variiert nur die Zeitaufteilung:
  2 Haelften: H1 -0,134 / H2 +0,036
  8 Bloecke:  - - - + + + - +   = 4 von 8 positiv, Spanne -0,301 .. +0,214
Die einzigen zwei Bloecke mit KI ohne Null sind BEIDE negativ. Kein Block ist
gesichert positiv. Die Haelften-Sicht verdeckt nichts, zeigt aber auch nichts.

Keine Code-Aenderung: die 2-Stichproben-Regel bleibt die Mindesthuerde (sie hat
28 Eingriffe korrekt abgewiesen), ist aber eine Aussage ueber zwei Regime, nicht
ueber Stabilitaet ueber die Zeit.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
Axel Hocks
2026-08-19 08:36:11 +02:00
co-authored by Claude Opus 5
parent adda5b0ccc
commit 5eec4517f8
4 changed files with 221 additions and 0 deletions
+77
View File
@@ -7434,6 +7434,83 @@ vollständig.
**Verifikation der Zustellung steht aus** — sie erfolgt mit dem Report am
nächsten Morgen um 07:30. Die Bausteine sind einzeln live gegengeprüft.
## ⚠⚠ KI-TRADING-BUCH (Illab) AUSGEWERTET — es geht um WORKFLOW, nicht um
## Signale; die eine echte Lücke ist die VALIDIERUNGS-METHODE (2026-08-19)
User reichte „Trading mit KI meistern 2026“ ein. Anderes Genre als das
Risueño-Buch: keine Chartmuster, sondern Co-Piloten, No-Code-Bots, Scanner,
Agenten-Pipelines, Broker-APIs. **Triage zuerst.**
| Buch-Kapitel | Stand im Projekt |
|---|---|
| 1 KI-Co-Pilot mit Live-Feeds, Makro-Prompts | ✅ `core/agent.py` + `daily_levels.py` (z.ai mit Web-Suche) |
| 2 Kill-Switch, Tagesstopp 2 % | ✅ Circuit-Breaker `daily_loss_limit_pct = 8` (scharf seit 17.08.) |
| 2 Ausführungs-Logs, CSV-Export | ✅ `trades`-DB + 16 `ctx_*`-Spalten + Wochenreport |
| 3 Mustererkennung, visuelles Backtesting | ❌ Muster 3× gemessen, Ziel-Trefferquote 1338 % |
| 4 Pre-Trade-Checkliste mit Score | ⚠ `_entry_checklist` rechnet weiter, **Dialog am 11.08. entfernt** (User) |
| 4 Slippage je Trade messen | ✅ `analyze_slippage_holdtime.py` (Median 0,017 $, Tail 4,19) |
| 5 Sentiment-Filter | ⚠ gebaut, gemessen **nicht robust prädiktiv** (03.08.) |
| 5 Alt-Daten: Insider, Optionsflüsse | ❌ Aktien-spezifisch, für einen WTI-CFD ohne Entsprechung |
| 6 Ranking, Rebalancing | ❌ EIN Instrument, EIN Slot — gegenstandslos |
| 7 Secrets nicht im Skript, Idempotenz | ✅ `oil_widget_config.ini` (gitignored) · Dedup über `_pending_tickets` |
| 8 Pre-Market-Coach-Agent 08:30 | ✅ Tagesreport 07:30 (Telegram + E-Mail) |
| 9 Fallback nach 2 Fehlern in Folge | ✅ `agent._mark_dead` (gebaut 05.08. nach dem 18-h-Ausfall) |
| 10 Momentum-Breakout-Fallstudie | ❌ 2× gemessen, verworfen |
**Was das Buch NICHT liefert:** eine einzige belegte Zahl. Seine Beispiele
(„Trefferquote steigt von 55 % auf 70 %“, „12 Trades, 9 Gewinner“) sind
Illustrationen ohne Stichprobe — dieselbe Schwäche wie die S.-203-Tabelle des
Risueño-Buchs. Als Ideenquelle taugt es, als Beleg nicht.
✅✅ **DIE EINE ECHTE LÜCKE — Kapitel 9.2 empfiehlt WALK-FORWARD, dieses Projekt
prüft mit ZWEI STICHPROBEN.** Das Wort kommt in 8.000 Zeilen CLAUDE.md kein
einziges Mal vor. Und der Einwand ist nicht akademisch: zwei Hälften haben
genau **zwei Vorzeichen**. Ein Setup, das in der Hälfte aller Zeitblöcke
negativ ist, kann trotzdem „beidhälftig positiv“ aussehen — die Regel winkt es
durch. Genau dieser Fall ist hier live eingetreten: das P(break)-Modell wurde
am 31.07. auf H1 gefittet, auf H2 mit **AUC 0,715** bestätigt — und lief live
auf **0,368**. Der Split hielt, die Zeit nicht.
**GEMESSEN (`backtest_walkforward.py`): dieselben Daten, dieselbe Regel,
derselbe Exit — variiert wird NUR die Aufteilung der Zeitachse.**
| Sicht | Ergebnis |
|---|---|
| **(a) 2 Hälften** (Projekt-Methode) | H1 0,134 · H2 **+0,036** |
| **(b) 8 Blöcke** (~35 Tage) | ** + + + +** — **4 von 8 positiv** |
| Spanne ØR über die Blöcke | **0,301 … +0,214** |
⚠⚠ **Die schärfste Zeile: die einzigen ZWEI Blöcke, deren 95-%-KI die Null
ausschliesst, sind BEIDE negativ** (Block 2 [0,524 … 0,005], Block 3
[0,576 … 0,020]). Kein einziger Block ist gesichert positiv.
✅ Die Hälften-Sicht **verdeckt hier nichts** (H1 entspricht den negativen
Blöcken 13) — aber sie **zeigt auch nichts**: dass das Vorzeichen über die
Zeitachse **viermal kippt**, ist eine Information, die zwei Stichproben
prinzipiell nicht liefern können.
**Grenze, vorab benannt:** kürzere Blöcke → breitere KI; ein einzelner
positiver Block ist NICHT dasselbe wie eine positive Hälfte. Belastbar ist das
**Vorzeichenmuster**, nicht die Einzelzelle. Und wie schon am 13.08.: die
ABSOLUTWERTE reproduzieren den dokumentierten Kontrollwert (+0,124/+0,292)
nicht — meine Auswahl ist strenger (362/559 gegen 1.092/1.807 Trades). Gültig
ist allein der **interne** Vergleich (a) gegen (b), weil beide auf derselben
Pipeline laufen.
**KONSEQUENZ (keine Code-Änderung):** die 2-Stichproben-Regel bleibt die
**Mindest**hürde — sie hat 28 Eingriffe korrekt abgewiesen. Aber sie ist eine
Aussage über **zwei Regime**, keine über **Stabilität über die Zeit**. Für
alles, was live Geld bewegt, gehört die Blocksicht daneben. `ci95` und
`stichprobe.paarweise` sind 2026-08-07/17 aus demselben Grund entstanden:
**jede zusätzliche Achse hat bisher etwas gefunden, das die vorige verdeckte.**
**Vier weitere Buch-Ideen, benannt und NICHT gebaut** (jeweils mit Grund):
**(1) Gestaffelte Einstiege** (30/30/40 %) — ungemessen; bei EINEM Slot und
95-%-Margin-Sizing hiesse das kleinere Positionen, also eine Sizing-Frage.
**(2) Wöchentlicher Drawdown-Stopp** (5 %) — der Tagesbreaker existiert, der
Wochenbreaker nicht; bei MaxDD 82,8 % nicht abwegig, aber ungemessen.
**(3) Abgelehnte Signale protokollieren** — der Entry-Dialog wurde am 11.08.
entfernt, **ohne die Ablehnungen je zu loggen**; das „Warum“ fehlt seitdem.
**(4) Versioniertes `playbook_rules.json`** — CLAUDE.md IST das Playbook, nur
unversioniert ausser in git.
## ⚠⚠ TRADING-BUCH (Risueño Gómez) AUSGEWERTET — 17 von 20 Konzepten waren
## schon gemessen, die übrigen DREI fallen durch (`backtest_buch_luis.py`, 2026-08-19)