Pre-registratie — Samen of afzonderlijk: Claude, GPT en hun overleg
Status: vastgelegd vóór aanvang. Dit document staat in versiebeheer en is extern getijdstempeld met OpenTimestamps. Wijzigingen na de startdatum zijn zichtbaar in de historie en maken de betrokken toets ongeldig.
Vastgelegd: 14 september 2026 Start meting: maandag 21 september 2026 (eerste handelsdag van de meting) Looptijd: 6 maanden, tot en met vrijdag 19 maart 2027 (125 handelsdagen) Geen verlenging bij een tegenvallende of onbesliste uitkomst.
---
1. De vraag
QUANTHEA laat naast de echte beslissing drie schaduwsporen meelopen. Deze proef beantwoordt één vraag: doen Claude en GPT het samen beter dan elk afzonderlijk? Dat is alleen eerlijk te beantwoorden als vóór de meting vastligt wat wordt vergeleken, hoe, en wanneer iets "beter" heet.
Eerlijkheid vooraf. De sporen lopen sinds juli en augustus 2026. De tussenstand over 11 augustus – 14 september 2026 is bij het opstellen van dit protocol bekeken. Die periode, en alles vóór 21 september 2026, telt niet mee in de toets en wordt uitsluitend beschrijvend gerapporteerd.
2. De drie sporen
Alle drie zijn synthetisch: gelijkgewogen (1/N), zonder kosten of slippage, zonder orders, gewaardeerd op slotkoersen uit dezelfde koersbron, bij elke dagrun herwogen naar de doellijst van die dag.
| Spoor | Wat het is | Wat het ziet |
|---|---|---|
| C — Claude alleen | De dagelijkse doellijst van de echte beslisser (Claude Opus 5), gelijkgewogen. Dit spoor roept zelf geen model aan; het modelveld in de records draagt een historisch label. | Het volledige dagdossier van de beslisser |
| G — GPT alleen | De eigen dagelijkse doellijst van een OpenAI-model met een eigen boekhouding. Het model wordt per run gekozen uit een vaste volgorde (voorkeur GPT-5.2). | Dezelfde marktbrede informatie (analyse, onderzoek, nieuws, technisch regime) en zijn eigen geschiedenis; niet Claude's posities, track record, reflectie of besluit van die dag. G beslist vóórdat het Claude's besluit beoordeelt. |
| O — Overleg | De consensuslijst na een overleg tussen Claude Opus 5 en GPT-6 Astra | Het volledige dagdossier van de beslisser plus de besluiten van C en G van die dag |
De echte portefeuille (met werkelijke weging, kosten en uitvoering) doet niet mee in de toets en wordt uitsluitend beschrijvend getoond.
3. Hypothesen
- H1 (primair): O − C — voegt het overleg iets toe aan Claude alleen?
- H2 (primair): O − G — voegt het overleg iets toe aan GPT alleen?
- H3 (secundair): G − C — verschillen de twee modellen afzonderlijk?
"Samen beter dan afzonderlijk" betekent: zowel H1 als H2 valt uit als "beter".
4. Primaire grootheid en toets
Per paar de dagelijkse verschilreeks d_t = r_X,t − r_Y,t, geregresseerd op de markt en de breedte/size-spread, identiek aan het A/B-amendement van 30 juli 2026:
d_t = α + β₁·r_SPY,t + β₂·(r_RSP,t − r_SPY,t) + ε_t
bandbreedte met een ondergrens van 10 lags).
handelsdagen, 10.000 replicaties).
H3 wordt apart gerapporteerd en heeft geen invloed op de hoofdconclusie.
- Toetsstatistiek: Newey-West op α (Bartlett-kernel, AR(1)-prewhitening, automatische
- Kritieke waarden: stationaire bootstrap (Politis-Romano, gemiddelde bloklengte 10
- Meervoudig toetsen: H1 en H2 vormen één familie; Holm-correctie op α = 0,05.
- Het ruwe cumulatieve verschil wordt beschrijvend gerapporteerd.
5. Uitputtende beslisregel
Per paar:
| Uitkomst | Voorwaarde |
|---|---|
| beter | α > 0 én significant na correctie |
| slechter | α < 0 én significant na correctie |
| niet-onderscheidbaar | niet significant — volwaardige uitkomst, met 95%-BI |
Hoofdconclusie:
| Conclusie | Voorwaarde |
|---|---|
| Samen beter | H1 = beter én H2 = beter |
| Samen slechter | minstens één van H1/H2 = slechter, en geen van beide = beter |
| Niet aangetoond | alle overige combinaties |
6. Power — wat realistisch te zien is
Gemeten over de 23 gemeenschappelijke dagrendementen van 11 augustus – 14 september 2026 (indicatief, klein monster, buiten de toets):
| Paar | Correlatie | Tracking error | Benodigd verschil voor t > 1,96 over 6 maanden |
|---|---|---|---|
| O − C | 0,97 | 1,7 %/jr | ≈ 2,4 procentpunt cumulatief |
| O − G | 0,66 | 5,6 %/jr | ≈ 7,8 procentpunt cumulatief |
| G − C | 0,68 | 5,5 %/jr | ≈ 7,6 procentpunt cumulatief |
Falsificatie-framing, expliciet. H1 is binnen zes maanden redelijk toetsbaar omdat O en C sterk samenhangen. H2 en H3 vergen grote verschillen; daar is "niet-onderscheidbaar" de meest waarschijnlijke eerlijke uitkomst. Die wordt als zodanig gepubliceerd.
7. Regime en wat vast moet staan
doorgevoerd, zodat het venster onder één regime begint: de Claude-kant van het overleg wisselde van Claude Fable 5.1 naar Claude Opus 5 (besluit 14 september 2026, om de kosten te beperken); de tweede lezer slaat een dag over zonder modelcall wanneer de echte portefeuille onbekend is (ontbrekende dag, zie hieronder).
model per dag wordt uit de records gehaald en bij de uitkomst gemeld; de toets gaat over de sporen "zoals ze in het venster draaiden". Een uitsplitsing per modelregime is alleen beschrijvend.
niet. Elke onvermijdelijke wijziging wordt met datum gelogd en bij de uitkomst gemeld.
posities ongewijzigd en worden ze gewaardeerd. Ontbreekt voor één spoor meer dan 10 % van de handelsdagen, dan krijgt elk paar met dat spoor de uitkomst onvolledig.
afgebroken gepubliceerd, met de reden.
- Modelregime bij de start. Vóór 21 september 2026 zijn de volgende wijzigingen
- Latere modelwissels. Een wissel tijdens het venster is geen reden tot herstart. Het
- Mechaniek. Weging (1/N), koersbron, waarderingsmoment en consensusprocedure wijzigen
- Ontbrekende dagen. Heeft een spoor op een handelsdag geen record, dan blijven zijn
- Afbreken. Stopt een spoor definitief, dan wordt het protocol voor de betrokken paren als
8. Geen contaminatie
- De echte beslisser leest de sporen C, G en O niet in zijn dagprompt.
- G ziet Claude's besluit pas ná zijn eigen beslissing.
- Geen spoor krijgt de tussenstand of de criteria van dit protocol te zien.
9. Bekende beperkingen
"overleg ná twee afzonderlijke besluiten", niet een onafhankelijk derde oordeel.
een uitvoerbare portefeuille.
- O is geankerd. Het overleg vertrekt vanaf de besluiten van C en G; "samen" is dus
- Synthetisch. Geen kosten, geen echte weging: de toets gaat over namenkeuze, niet over
- Gedeelde input. Alle sporen rusten op dezelfde analyse en nieuwsbron.
- Kort. Zes maanden is één marktregime.
10. Publicatie
Op of kort na 19 maart 2027 wordt gepubliceerd, ongeacht de richting: per paar α, t, bootstrap-kritieke waarde en 95%-BI; de hoofdconclusie uit §5; de ruwe cumulatieve verschillen; modellen per regime; ontbrekende dagen; en elke afwijking van dit protocol.
---
QUANTHEA is een open proef · paper trading · illustratief · geen beleggingsadvies, geen aanbod tot belegging.