# Pre-registratie — Samen of afzonderlijk: Claude, GPT en hun overleg

**Status:** vastgelegd vóór aanvang. Dit document staat in versiebeheer en is extern
getijdstempeld met OpenTimestamps. Wijzigingen na de startdatum zijn zichtbaar in de
historie en maken de betrokken toets ongeldig.

**Vastgelegd:** 14 september 2026
**Start meting:** maandag 21 september 2026 (eerste handelsdag van de meting)
**Looptijd:** 6 maanden, tot en met vrijdag 19 maart 2027 (125 handelsdagen)
**Geen verlenging** bij een tegenvallende of onbesliste uitkomst.

---

## 1. De vraag

QUANTHEA laat naast de echte beslissing drie schaduwsporen meelopen. Deze proef beantwoordt
één vraag: **doen Claude en GPT het samen beter dan elk afzonderlijk?** Dat is alleen eerlijk
te beantwoorden als vóór de meting vastligt wat wordt vergeleken, hoe, en wanneer iets
"beter" heet.

**Eerlijkheid vooraf.** De sporen lopen sinds juli en augustus 2026. De tussenstand over
11 augustus – 14 september 2026 is bij het opstellen van dit protocol bekeken. Die periode,
en alles vóór 21 september 2026, telt **niet** mee in de toets en wordt uitsluitend
beschrijvend gerapporteerd.

## 2. De drie sporen

Alle drie zijn **synthetisch**: gelijkgewogen (1/N), zonder kosten of slippage, zonder orders,
gewaardeerd op slotkoersen uit dezelfde koersbron, bij elke dagrun herwogen naar de doellijst
van die dag.

| Spoor | Wat het is | Wat het ziet |
|---|---|---|
| **C — Claude alleen** | De dagelijkse doellijst van de echte beslisser (Claude Opus 5), gelijkgewogen. Dit spoor roept zelf geen model aan; het modelveld in de records draagt een historisch label. | Het volledige dagdossier van de beslisser |
| **G — GPT alleen** | De eigen dagelijkse doellijst van een OpenAI-model met een eigen boekhouding. Het model wordt per run gekozen uit een vaste volgorde (voorkeur GPT-5.2). | Dezelfde marktbrede informatie (analyse, onderzoek, nieuws, technisch regime) en zijn **eigen** geschiedenis; **niet** Claude's posities, track record, reflectie of besluit van die dag. G beslist vóórdat het Claude's besluit beoordeelt. |
| **O — Overleg** | De consensuslijst na een overleg tussen Claude Opus 5 en GPT-6 Astra | Het volledige dagdossier van de beslisser **plus** de besluiten van C en G van die dag |

De echte portefeuille (met werkelijke weging, kosten en uitvoering) doet **niet** mee in de
toets en wordt uitsluitend beschrijvend getoond.

## 3. Hypothesen

- **H1 (primair):** O − C — voegt het overleg iets toe aan Claude alleen?
- **H2 (primair):** O − G — voegt het overleg iets toe aan GPT alleen?
- **H3 (secundair):** G − C — verschillen de twee modellen afzonderlijk?

"Samen beter dan afzonderlijk" betekent: **zowel H1 als H2** valt uit als "beter".

## 4. Primaire grootheid en toets

Per paar de dagelijkse verschilreeks d_t = r_X,t − r_Y,t, geregresseerd op de markt en de
breedte/size-spread, identiek aan het A/B-amendement van 30 juli 2026:

    d_t = α + β₁·r_SPY,t + β₂·(r_RSP,t − r_SPY,t) + ε_t

- **Toetsstatistiek:** Newey-West op α (Bartlett-kernel, AR(1)-prewhitening, automatische
  bandbreedte met een ondergrens van 10 lags).
- **Kritieke waarden:** stationaire bootstrap (Politis-Romano, gemiddelde bloklengte 10
  handelsdagen, 10.000 replicaties).
- **Meervoudig toetsen:** H1 en H2 vormen één familie; Holm-correctie op α = 0,05.
  H3 wordt apart gerapporteerd en heeft geen invloed op de hoofdconclusie.
- Het ruwe cumulatieve verschil wordt beschrijvend gerapporteerd.

## 5. Uitputtende beslisregel

Per paar:

| Uitkomst | Voorwaarde |
|---|---|
| **beter** | α > 0 én significant na correctie |
| **slechter** | α < 0 én significant na correctie |
| **niet-onderscheidbaar** | niet significant — volwaardige uitkomst, met 95%-BI |

Hoofdconclusie:

| Conclusie | Voorwaarde |
|---|---|
| **Samen beter** | H1 = beter én H2 = beter |
| **Samen slechter** | minstens één van H1/H2 = slechter, en geen van beide = beter |
| **Niet aangetoond** | alle overige combinaties |

## 6. Power — wat realistisch te zien is

Gemeten over de 23 gemeenschappelijke dagrendementen van 11 augustus – 14 september 2026
(indicatief, klein monster, buiten de toets):

| Paar | Correlatie | Tracking error | Benodigd verschil voor t > 1,96 over 6 maanden |
|---|---|---|---|
| O − C | 0,97 | 1,7 %/jr | ≈ 2,4 procentpunt cumulatief |
| O − G | 0,66 | 5,6 %/jr | ≈ 7,8 procentpunt cumulatief |
| G − C | 0,68 | 5,5 %/jr | ≈ 7,6 procentpunt cumulatief |

**Falsificatie-framing, expliciet.** H1 is binnen zes maanden redelijk toetsbaar omdat O en
C sterk samenhangen. H2 en H3 vergen grote verschillen; daar is "niet-onderscheidbaar" de
meest waarschijnlijke eerlijke uitkomst. Die wordt als zodanig gepubliceerd.

## 7. Regime en wat vast moet staan

- **Modelregime bij de start.** Vóór 21 september 2026 zijn de volgende wijzigingen
  doorgevoerd, zodat het venster onder één regime begint: de Claude-kant van het overleg
  wisselde van Claude Fable 5.1 naar **Claude Opus 5** (besluit 14 september 2026, om de
  kosten te beperken); de tweede lezer slaat een dag over zonder modelcall wanneer de echte
  portefeuille onbekend is (ontbrekende dag, zie hieronder).
- **Latere modelwissels.** Een wissel tijdens het venster is geen reden tot herstart. Het
  model per dag wordt uit de records gehaald en bij de uitkomst gemeld; de toets gaat over de
  sporen "zoals ze in het venster draaiden". Een uitsplitsing per modelregime is alleen
  beschrijvend.
- **Mechaniek.** Weging (1/N), koersbron, waarderingsmoment en consensusprocedure wijzigen
  niet. Elke onvermijdelijke wijziging wordt met datum gelogd en bij de uitkomst gemeld.
- **Ontbrekende dagen.** Heeft een spoor op een handelsdag geen record, dan blijven zijn
  posities ongewijzigd en worden ze gewaardeerd. Ontbreekt voor één spoor meer dan 10 % van
  de handelsdagen, dan krijgt elk paar met dat spoor de uitkomst **onvolledig**.
- **Afbreken.** Stopt een spoor definitief, dan wordt het protocol voor de betrokken paren als
  **afgebroken** gepubliceerd, met de reden.

## 8. Geen contaminatie

- De echte beslisser leest de sporen C, G en O **niet** in zijn dagprompt.
- G ziet Claude's besluit pas ná zijn eigen beslissing.
- Geen spoor krijgt de tussenstand of de criteria van dit protocol te zien.

## 9. Bekende beperkingen

- **O is geankerd.** Het overleg vertrekt vanaf de besluiten van C en G; "samen" is dus
  "overleg ná twee afzonderlijke besluiten", niet een onafhankelijk derde oordeel.
- **Synthetisch.** Geen kosten, geen echte weging: de toets gaat over namenkeuze, niet over
  een uitvoerbare portefeuille.
- **Gedeelde input.** Alle sporen rusten op dezelfde analyse en nieuwsbron.
- **Kort.** Zes maanden is één marktregime.

## 10. Publicatie

Op of kort na 19 maart 2027 wordt gepubliceerd, ongeacht de richting: per paar α, t,
bootstrap-kritieke waarde en 95%-BI; de hoofdconclusie uit §5; de ruwe cumulatieve
verschillen; modellen per regime; ontbrekende dagen; en elke afwijking van dit protocol.

---

*QUANTHEA is een open proef · paper trading · illustratief · geen beleggingsadvies, geen
aanbod tot belegging.*
