KI-Copilot: zwei Prompt-Fehler behoben + kalibrierte Groessen ergaenzt
Diagnose zur Frage "Bias fast immer neutral": es ist NICHT der Prompt, es ist
der Provider. Bruch exakt am 20.07. (DeepSeek-Wechsel) - bis 19.07. war der
Copilot zu 42-90 % gerichtet, ab 21.07. nur noch zu 1,5-9,3 %. Der Prompt war
unveraendert. Und er hedged aus KORREKTER Schlussfolgerung: ~90 % WARTEN-Signal,
negativer Track-Record, plus die Prompt-Anweisung, genau dann NEUTRAL zu sagen.
Gemessen, ob mehr Meinung ueberhaupt Wert haette: KI-LONG n=286 +0,29 $ / 76 %
Treffer, KI-SHORT n=93 -0,02 $ / 55 %. ABER die 286 sind 20 Episoden an 5 Tagen
(Minutentakt-Logger), die 93 sind 16 Episoden -> effektiv n~20 gegen n~16, ein
Regime. Kein Beleg. Deshalb BEWUSST nicht am Prompt gedreht, um Meinung zu
erzwingen; Verdict-Gewicht unveraendert.
Zwei echte Prompt-Fehler behoben (Korrektheit, keine Meinungsmache):
- _SYS beschrieb das Wellen-Signal als "ATR-ZigZag" - es ist EMA12 vs EMA50
- _SYS nannte "TradersUnion-Tachos" als Input - TU ist seit 19.07. raus
Kalibrierte Groessen ergaenzt: _tool_market gab dem Copiloten NUR Wellen-Signal
und Session. Neu: p_break_target / p_break_stop (AUC 0,65 bzw. 0,68-0,72) und
cone (80%-Baender mit der REAL gemessenen Abdeckung 77 %), plus Lese-Anleitung
im Prompt (45-55 % explizit als Muenzwurf markiert).
Zwei Fallen an Live-Daten korrigiert: p_break steht bereits in PROZENT (die
zuerst gebaute x100-Umrechnung haette 300 erzeugt), und die Engine-Felder plus
die engine-Referenz im Agent existierten gar nicht - der Fail-safe haette still
nichts geliefert. Snapshot weist die Werte jetzt nur zu, rechnet sie nicht neu.
DeepSeek max_tokens 4000 -> 8000: das JSON brach regelmaessig mitten im Text ab
("Unterminated string"), real 2x in ~14 Zyklen = ~14 % stille Ausfaelle.
Kerzen/Muster bewusst NICHT eingespeist - die Lehrbuch-Lesart ist hier gemessen
invertiert (langer Koerper im Trend -0,132/-0,042; 2x Volumen -0,117/-0,204;
Muster-Kursziel trifft nur 13-38 %). Roh eingespeist wuerden sie schaden.
Verifiziert: Stub-Test von _tool_market (Werte unveraendert durchgereicht, nur
80%-Baender, ohne Engine kein Absturz); Prozess juenger als beide Dateien.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
20cd04caa7
commit
00c78201fa
@@ -2539,6 +2539,63 @@ konstant; (d) es gab **keine Telemetrie über die Entscheidung selbst**.
|
||||
in ~20 min gefunden; die Trefferquote spricht für weitere. `analyze_divergence.py`
|
||||
regelmäßig laufen lassen (Kandidat für den Wochenreport).
|
||||
|
||||
## KI-Copilot: warum er neutral ist, und was 2026-08-02 repariert wurde
|
||||
|
||||
**User-Frage:** „Der Bias ist fast immer neutral — können wir konkretere Empfehlungen
|
||||
bekommen? Weitere Quellen (Kerzen, Muster)?"
|
||||
|
||||
**Diagnose — es ist NICHT der Prompt, es ist der Provider.** Der Bruch ist exakt
|
||||
datierbar (`recommendations.ai_sentiment` je Tag): bis **19.07.** war der Copilot zu
|
||||
**42–90 %** gerichtet, ab **21.07.** nur noch zu **1,5–9,3 %**. Dazwischen liegt der
|
||||
Wechsel auf **DeepSeek (2026-07-20)**. Der Prompt war die ganze Zeit unverändert.
|
||||
⚠ Und er hedged **aus korrekter Schlussfolgerung**, nicht aus Schwäche: die
|
||||
Begründungen sind konkret und zutreffend, und er bekommt zu ~90 % ein WARTEN-Signal,
|
||||
einen negativen Track-Record UND die ausdrückliche Prompt-Anweisung, genau dann
|
||||
NEUTRAL zu empfehlen. Er tut, was dort steht.
|
||||
|
||||
**Sind seine gerichteten Rufe etwas wert? Unentschieden — die Stichprobe trägt nicht.**
|
||||
Forward-Return über `verdict_votes` × `candles_m1`: KI-LONG n=286 → **+0,29 $** in
|
||||
Richtung / 76 % Treffer (60 min), KI-SHORT n=93 → −0,02 $ / 55 %. ⚠ **Das ist KEIN
|
||||
Beleg:** die 286 Stimmen sind **20 Episoden an 5 Tagen** (Minutentakt-Logger), die 93
|
||||
sind 16 Episoden — effektiv n≈20 gegen n≈16, alles in einem Regime. Dasselbe
|
||||
Cluster-Muster, an dem ORB gescheitert ist. **Deshalb bewusst NICHT am Prompt gedreht,
|
||||
um mehr Meinung zu erzwingen** — das würde eine korrekte Schlussfolgerung überschreiben
|
||||
und einer unbelegten Stimme mehr Gewicht geben. Verdict-Gewicht bleibt 1,0 bei
|
||||
gerichteter Aussage, 0 bei NEUTRAL.
|
||||
|
||||
**Zwei echte Prompt-FEHLER behoben (Korrektheit, keine Meinungsmache):**
|
||||
1. `_SYS` beschrieb das Wellen-Signal als **„ATR-ZigZag"** — es ist seit Langem
|
||||
**EMA12 vs. EMA50**; ZigZag wurde verworfen (~0 Edge). Das Modell missverstand also
|
||||
die Natur des Hauptsignals.
|
||||
2. `_SYS` nannte **„TradersUnion-Tachos"** als Input — TU ist seit 2026-07-19 gar nicht
|
||||
mehr im Copilot-Kontext (`_tool_market`). Das Modell wurde auf Daten hingewiesen,
|
||||
die es nie sieht.
|
||||
|
||||
**Die zwei kalibrierten Größen ergänzt.** Befund beim Nachsehen: `_tool_market` gab dem
|
||||
Copiloten **nur Wellen-Signal + Session** — er war das schlechtest informierte Modul im
|
||||
System und bekam ausgerechnet die einzigen beiden Komponenten nicht, deren Kalibrierung
|
||||
out-of-sample nachgewiesen ist. Neu im Kontext: **`p_break_target` / `p_break_stop`**
|
||||
(AUC 0,65 bzw. 0,68–0,72) und **`cone`** (80 %-Bänder, mit der REAL gemessenen Abdeckung
|
||||
77 %, nicht dem Nennwert). Dazu eine Lese-Anleitung im Prompt — ohne sie liest ein LLM
|
||||
„P(break) 30 %" als schwaches Signal statt als klare Aussage „Level hält mit 70 %";
|
||||
45–55 % ist ausdrücklich als Münzwurf markiert.
|
||||
⚠ **Zwei Fallen beim Bau, beide an Live-Daten korrigiert:** (a) `p_break` steht im
|
||||
Snapshot **bereits in Prozent** (3 = 3 %, deckungsgleich mit der Chart-Zeile „97 %
|
||||
Abprall") — die zuerst gebaute ×100-Umrechnung hätte 300 erzeugt; (b) die Engine-Felder
|
||||
`_last_sr_close_hint`/`_last_stop_approach`/`_last_cone` und die `engine`-Referenz im
|
||||
Agent **existierten gar nicht** — der Fail-safe hätte still nichts geliefert. Beides
|
||||
verdrahtet, der Snapshot rechnet die Werte ohnehin und weist sie jetzt nur zu (kein
|
||||
zweites Rechnen, anders als beim Konsens-Pfeil). Mit Stub-Test verifiziert (Werte
|
||||
unverändert durchgereicht, nur 80 %-Bänder, ohne Engine kein Absturz).
|
||||
|
||||
⚠ **Kerzen/Muster bewusst NICHT eingespeist.** Ein LLM wendet darauf die Lehrbuch-Lesart
|
||||
an — und die ist hier gemessen **invertiert**: „langer Körper im Trend = Fortsetzung"
|
||||
→ −0,132/−0,042 (Klimax, läuft dagegen); „2× Volumen = echt" → −0,117/−0,204 (monoton
|
||||
falsch herum); Muster-Kursziel trifft nur zu 13–38 %. Roh eingespeist würden sie den
|
||||
Copiloten aktiv verschlechtern. Offener Kandidat: sie MIT der gemessenen Lesart
|
||||
mitgeben („langer Docht oben; gemessen läuft der Kurs danach eher GEGEN die Kerze") —
|
||||
noch nicht gebaut.
|
||||
|
||||
## Gesamtprüfung 2026-08-02 (nach `docs/review-prompt.md`)
|
||||
|
||||
Erster vollständiger Durchlauf des Review-Prompts. **Keine Strategie-Änderung** — alle
|
||||
|
||||
Reference in New Issue
Block a user