# Pre-registratie — A/B tegen een naïef stijlreplicaat

**Status:** vastgelegd vóór aanvang. De commit-hash van dit bestand in
`gthielen/quanthea-platform` is het tijdstempel; wijzigingen aan het protocol na
de startdatum zijn zichtbaar in de git-historie en maken de proef ongeldig.

**Vastgelegd:** 26 juli 2026
**Start meting:** maandag 3 augustus 2026, 14:45 CEST — de eerste volledige
wekelijkse run. De run van 27 juli is een proefdraai en telt niet mee.
**Minimale looptijd:** 6 maanden (≈130 handelsdagen, ≥24 wekelijkse herwegingen)

---

## 1. De vraag

QUANTHEA claimt dat een LLM autonoom een aandelenportefeuille kan beheren en de
S&P 500 kan verslaan. Na 40 handelsdagen stond de voorsprong op +6,02 procentpunt
tegen de cap-gewogen S&P 500 en +1,75 tegen de gelijkgewogen variant.

Attributie liet zien dat het grootste deel daarvan uit **stijl** komt: gelijk wegen
in plaats van naar beurswaarde, lage-volatiliteitsweging, en een kanteling naar
defensie, banken, zorg en energie in een periode waarin mega-cap tech achterbleef.

Dat roept één vraag op die met een index niet te beantwoorden is:

> **Voegt het model iets toe boven een simpele, mechanische strategie met
> vergelijkbare stijlblootstelling?**

Zo niet, dan is de LLM decoratie en had een scoreformule van drie regels hetzelfde
gedaan. Deze proef beantwoordt die vraag.

## 2. De twee sleeves

### Sleeve A — QUANTHEA (bestaand)
Ongewijzigd. Het model kiest namen en gewichten zoals het dat nu doet.

### Sleeve B — naïef stijlreplicaat (nieuw)
Volledig mechanisch, geen LLM, geen discretie:

| | |
|---|---|
| Universum | S&P 500-constituenten, **bevroren** op de startdatum, lijst in `docs/universe-ab-frozen.csv` |
| Score | 50% momentum + 50% winstgevendheid, beide als percentielrang **binnen de sector** |
| Momentum | rendement over 252 handelsdagen, met de laatste 21 dagen eruit (klassiek 12–1) |
| Winstgevendheid | return on equity (`roe`, yfinance) |
| Selectie | top 28 op de gecombineerde score, na ontdubbeling van aandelenklassen |
| Ontdubbeling | van GOOG/GOOGL, FOX/FOXA en NWS/NWSA telt alleen de best scorende mee — anders zit dezelfde onderneming er dubbel in |
| Weging | gelijk, 1/28 per naam |
| Herweging | wekelijks, maandag, zelfde moment als sleeve A |
| Kosten | 3 bp op het verhandelde bedrag, identiek aan sleeve A |

Sectorneutraal rangschikken is bewust: zonder die correctie meet de proef vooral
welke sector het goed deed, en dat weten we al.

### Wat gelijk moet zijn
Zelfde kalender, zelfde herwegingsmoment, zelfde kostenaanname, zelfde
mark-to-market op slotkoersen. Sleeve B is **synthetisch** — geen orders, geen
uitvoering. Dat is een bewuste keuze: uitvoeringsverschillen zijn precies wat we
in sleeve A al apart meten (2,7pp tegenover de IBKR-rekening), en die ruis hoort
niet in deze vergelijking thuis.

## 3. Vooraf vastleggen van de signalen

Dit is de kern, en het adresseert de zwaarste kritiek op de huidige opzet: zonder
vooraf vastgelegde beslislijsten is niet te scheiden wat het model deed en wat
achteraf-rationalisatie was.

Vanaf de start, voor **beide** sleeves:

1. Vóór de opening wordt de doellijst (namen + gewichten) berekend en opgeslagen.
2. Van die lijst wordt een SHA-256-hash gepubliceerd via `/api/decisions`, vóórdat
   er een order wordt geplaatst.
3. Na sluiting wordt de volledige lijst gepubliceerd, zodat iedereen de hash kan
   narekenen.

Wie achteraf beweert iets besloten te hebben, wordt afgerekend op de hash.

## 4. Criteria — vooraf vastgelegd

**Primair.** Verschil in time-weighted rendement, sleeve A minus sleeve B, netto
kosten. De proef slaagt als na 6 maanden aan **beide** voorwaarden is voldaan:

- cumulatief verschil ≥ **300 basispunten**, én
- Newey-West t-statistiek op de dagelijkse verschilreeks (lag 5) > **1,96**

**Secundair.** Regressie van beide sleeves op Mkt-Rf, SMB, HML, RMW, CMA en UMD.
Vereist: de alpha van sleeve A ligt significant boven die van sleeve B (p < 0,05).

**Robuustheid.** Block-bootstrap met blokken van 5 dagen; p-waarde van het
cumulatieve verschil < 0,05.

**Faalconditie.** Als na 6 maanden het 80%-betrouwbaarheidsinterval van het
verschil de nul omvat én het verschil onder 150 basispunten ligt, is de proef
mislukt. Dan is er geen aantoonbare toegevoegde waarde van het model boven zijn
eigen stijl, en dat wordt als zodanig gepubliceerd.

**Geen verlenging bij tegenvallende uitkomst.** De horizon staat vast. Doorgaan
"omdat het net niet significant was" is precies de fout die deze opzet moet
voorkomen.

## 5. Wat deze proef niet aantoont

- Niet dat de strategie geld waard is. Zes maanden blijft kort.
- Niet dat het resultaat bij grotere bedragen standhoudt. Bij het huidige vermogen
  is marktimpact verwaarloosbaar; richting enkele tientallen miljoenen begint die
  bij deze omloopsnelheid 1 tot 2% per jaar te kosten.
- Niet dat sleeve B de best mogelijke mechanische strategie is. Het is een
  *redelijke* benchmark, geen optimale.
- Niets over andere markten. Het universum is Amerikaans.

## 6. Waarom dit gepubliceerd wordt

De proef kan mislukken. Dat is het punt: een test die alleen gunstig kan uitpakken
bewijst niets. Het protocol staat vast vóór de uitkomst bekend is, en de uitkomst
wordt gepubliceerd ongeacht de richting.

---

*QUANTHEA is een open proef · paper trading · illustratief · geen beleggingsadvies,
geen aanbod tot belegging.*
