Pre-registratie — A/B tegen een naïef stijlreplicaat
Status: vastgelegd vóór aanvang. De commit-hash van dit bestand in gthielen/quanthea-platform is het tijdstempel; wijzigingen aan het protocol na de startdatum zijn zichtbaar in de git-historie en maken de proef ongeldig.
Vastgelegd: 26 juli 2026 Start meting: maandag 3 augustus 2026, 14:45 CEST — de eerste volledige wekelijkse run. De run van 27 juli is een proefdraai en telt niet mee. Minimale looptijd: 6 maanden (≈130 handelsdagen, ≥24 wekelijkse herwegingen)
---
1. De vraag
QUANTHEA claimt dat een LLM autonoom een aandelenportefeuille kan beheren en de S&P 500 kan verslaan. Na 40 handelsdagen stond de voorsprong op +6,02 procentpunt tegen de cap-gewogen S&P 500 en +1,75 tegen de gelijkgewogen variant.
Attributie liet zien dat het grootste deel daarvan uit stijl komt: gelijk wegen in plaats van naar beurswaarde, lage-volatiliteitsweging, en een kanteling naar defensie, banken, zorg en energie in een periode waarin mega-cap tech achterbleef.
Dat roept één vraag op die met een index niet te beantwoorden is:
**Voegt het model iets toe boven een simpele, mechanische strategie met
vergelijkbare stijlblootstelling?**
Zo niet, dan is de LLM decoratie en had een scoreformule van drie regels hetzelfde gedaan. Deze proef beantwoordt die vraag.
2. De twee sleeves
Sleeve A — QUANTHEA (bestaand)
Ongewijzigd. Het model kiest namen en gewichten zoals het dat nu doet.
Sleeve B — naïef stijlreplicaat (nieuw)
Volledig mechanisch, geen LLM, geen discretie:
| Universum | S&P 500-constituenten, bevroren op de startdatum, lijst in docs/universe-ab-frozen.csv |
| Score | 50% momentum + 50% winstgevendheid, beide als percentielrang binnen de sector |
| Momentum | rendement over 252 handelsdagen, met de laatste 21 dagen eruit (klassiek 12–1) |
| Winstgevendheid | return on equity (roe, yfinance) |
| Selectie | top 28 op de gecombineerde score, na ontdubbeling van aandelenklassen |
| Ontdubbeling | van GOOG/GOOGL, FOX/FOXA en NWS/NWSA telt alleen de best scorende mee — anders zit dezelfde onderneming er dubbel in |
| Weging | gelijk, 1/28 per naam |
| Herweging | wekelijks, maandag, zelfde moment als sleeve A |
| Kosten | 3 bp op het verhandelde bedrag, identiek aan sleeve A |
Sectorneutraal rangschikken is bewust: zonder die correctie meet de proef vooral welke sector het goed deed, en dat weten we al.
Wat gelijk moet zijn
Zelfde kalender, zelfde herwegingsmoment, zelfde kostenaanname, zelfde mark-to-market op slotkoersen. Sleeve B is synthetisch — geen orders, geen uitvoering. Dat is een bewuste keuze: uitvoeringsverschillen zijn precies wat we in sleeve A al apart meten (2,7pp tegenover de IBKR-rekening), en die ruis hoort niet in deze vergelijking thuis.
3. Vooraf vastleggen van de signalen
Dit is de kern, en het adresseert de zwaarste kritiek op de huidige opzet: zonder vooraf vastgelegde beslislijsten is niet te scheiden wat het model deed en wat achteraf-rationalisatie was.
Vanaf de start, voor beide sleeves:
1. Vóór de opening wordt de doellijst (namen + gewichten) berekend en opgeslagen. 2. Van die lijst wordt een SHA-256-hash gepubliceerd via /api/decisions, vóórdat er een order wordt geplaatst. 3. Na sluiting wordt de volledige lijst gepubliceerd, zodat iedereen de hash kan narekenen.
Wie achteraf beweert iets besloten te hebben, wordt afgerekend op de hash.
4. Criteria — vooraf vastgelegd
Primair. Verschil in time-weighted rendement, sleeve A minus sleeve B, netto kosten. De proef slaagt als na 6 maanden aan beide voorwaarden is voldaan:
- cumulatief verschil ≥ 300 basispunten, én
- Newey-West t-statistiek op de dagelijkse verschilreeks (lag 5) > 1,96
Secundair. Regressie van beide sleeves op Mkt-Rf, SMB, HML, RMW, CMA en UMD. Vereist: de alpha van sleeve A ligt significant boven die van sleeve B (p < 0,05).
Robuustheid. Block-bootstrap met blokken van 5 dagen; p-waarde van het cumulatieve verschil < 0,05.
Faalconditie. Als na 6 maanden het 80%-betrouwbaarheidsinterval van het verschil de nul omvat én het verschil onder 150 basispunten ligt, is de proef mislukt. Dan is er geen aantoonbare toegevoegde waarde van het model boven zijn eigen stijl, en dat wordt als zodanig gepubliceerd.
Geen verlenging bij tegenvallende uitkomst. De horizon staat vast. Doorgaan "omdat het net niet significant was" is precies de fout die deze opzet moet voorkomen.
5. Wat deze proef niet aantoont
is marktimpact verwaarloosbaar; richting enkele tientallen miljoenen begint die bij deze omloopsnelheid 1 tot 2% per jaar te kosten.
redelijke benchmark, geen optimale.
- Niet dat de strategie geld waard is. Zes maanden blijft kort.
- Niet dat het resultaat bij grotere bedragen standhoudt. Bij het huidige vermogen
- Niet dat sleeve B de best mogelijke mechanische strategie is. Het is een
- Niets over andere markten. Het universum is Amerikaans.
6. Waarom dit gepubliceerd wordt
De proef kan mislukken. Dat is het punt: een test die alleen gunstig kan uitpakken bewijst niets. Het protocol staat vast vóór de uitkomst bekend is, en de uitkomst wordt gepubliceerd ongeacht de richting.
---
QUANTHEA is een open proef · paper trading · illustratief · geen beleggingsadvies, geen aanbod tot belegging.