Waarom niet gewoon ChatGPT of Claude gebruiken
Je kunt een taalmodel vragen zich voor te doen als je doelgroep. Dat werkt, tot op zekere hoogte, en het is gratis. Deze pagina beschrijft wat er tussen dat en een onderzoek op dit platform zit, en waar de grens ligt. Wie na het lezen besluit het zelf te doen, heeft daar soms gelijk in.
Wat je met een los prompt krijgt
Eén model dat één antwoord geeft. Vraag je door, dan heeft het zijn eigen vorige antwoord als context en bouwt het daarop voort. Dat is precies wat je wilt in een gesprek, en precies wat je niet wilt in een steekproef.
Vraag je om vijftig persona's, dan komen ze uit één generatie die zichzelf ziet. De vijfde is geschreven met de eerste vier in beeld, de vijftigste met de negenenveertig ervoor. Ze gaan op elkaar lijken, en dat gebeurt op de manier die je het minst opvalt: ze klinken gevarieerd en zeggen hetzelfde.
Laat je datzelfde model daarna de antwoorden samenvatten, dan telt het model. Taalmodellen tellen slecht en zelfverzekerd. Er komt een percentage uit, het ziet er goed uit, en er is niets dat het tegenspreekt.
Vraag je het een tweede keer, dan krijg je een ander antwoord, zonder dat je weet welke van de twee je moet geloven. Dat is geen tekortkoming van het model. Het is een chatgesprek, en een chatgesprek is geen onderzoeksopzet.
Spreiding wordt afgedwongen in plaats van gehoopt
In een chatvenster is "maak ze divers" een verzoek. Het model doet zijn best, jij kunt niet nagaan of het gelukt is, en er gebeurt niets als het misgaat.
Hier wordt de groep in porties opgebouwd, waarbij elke portie de eerder gemaakte persona's meekrijgt met de opdracht ze niet te herhalen. Porties die tegelijk draaien zien elkaar niet, dus die krijgen elk de opdracht een andere hoek van de doelgroep te nemen. En na afloop wordt geteld: haalt de groep de 20% laag betrokken of kritische respondenten niet, dan stopt het onderzoek en krijg je je credits terug.
Dat laatste is het verschil tussen een richtlijn en een eis. Een groep waarin iedereen enthousiast is, bevestigt elk concept en meet niets.
De cijfers komen niet uit het model
Elk percentage, elk gemiddelde, elke top-2-box en elke uitsplitsing naar leeftijd of betrokkenheid wordt in gewone code berekend over de losse antwoorden. Het model dat het rapport schrijft krijgt die uitkomsten als invoer en mag ze verwoorden, niet herrekenen en niet aanvullen.
Dat is de reden dat twee runs op hetzelfde design hetzelfde soort oordeel geven. De antwoorden verschillen, de rekenkant niet.
Er is een oordeel vóór en na de run
Vóór de run weet je welk betrouwbaarheidsniveau bij deze vraagvorm hoort, want dat volgt uit een tabel met bronvermelding per regel. Kies je een prijsvraag, dan staat er vooraf dat die laag scoort en dat een groter pakket daar niets aan verandert.
Na de run wordt gekeken of de data dat waarmaakt. Er zijn drie controles die actief zoeken naar de manieren waarop synthetisch onderzoek stilletjes misgaat: te weinig spreiding in de antwoorden, een groep die uit elkaar valt als je hem in tweeën deelt, en concepten die te dicht bij elkaar liggen om te onderscheiden. Ze werken tegen de eigen uitkomst in, en dat is de bedoeling.
Een chatvenster geeft je nooit een reden om zijn eigen antwoord niet te vertrouwen. Dat is niet omdat het onbetrouwbaar is, maar omdat het daar niet voor gebouwd is.
Het design ligt vast vóór het veldwerk
Je keurt de vragenlijst expliciet goed voordat er één respondent antwoordt. Daarna krijgt iedereen precies dezelfde vragen met precies dezelfde antwoordopties, afgedwongen op formaat: een schaalvraag is een geheel getal van 1 tot 5, een keuzevraag is een van de opgegeven opties.
In een gesprek schuift de vraag mee met het gesprek. Dat merk je niet terwijl het gebeurt, en achteraf is niet meer te reconstrueren wie welke versie van de vraag kreeg.
Er is een weg naar echte mensen
Synthetisch onderzoek is een begin. Waar het spannend wordt, moet je eruit kunnen. Daarom zit er een deelbare survey in, die standaard alleen de vragen bevat waar het kompas over twijfelde, met een betrouwbaarheidsinterval op de échte antwoorden.
En is het oordeel rood, dan staat er een kant-en-klare briefing in het rapport die je rechtstreeks naar een onderzoeksbureau kunt sturen: doelgroep, te toetsen hypotheses, aanbevolen methode en steekproefomvang. Een product dat je vertelt wanneer je het niet moet gebruiken, is bruikbaarder dan een product dat overal ja op zegt.
Het is herleidbaar
Elke persona, elk antwoord, elk interviewtranscript en elke berekening blijft staan en is terug te kijken. Je kunt zien wie wat zei, hoe de groep was samengesteld en hoe het oordeel is opgebouwd.
Een gesprek in een chatvenster is dat ook, zolang je het niet sluit. Het verschil is dat je er geen verantwoording uit kunt trekken die je aan iemand anders kunt laten zien.
Naast elkaar
Wanneer je het beter zelf doet
Een chatvenster is sneller en gratis, en voor een paar dingen ook gewoon beter. Gebruik het om een idee scherp te krijgen, om een eerste lijst bezwaren te verzinnen, om een vragenlijst te herschrijven, of om een lang rapport samen te vatten.
Waar het misgaat, is zodra je de uitkomst als bevinding gaat behandelen. Vijftig verzonnen persona's die het onderling eens zijn, voelen als data en zijn het niet. Het gevaar zit niet in het gebruik maar in het vertrouwen.
Wat wij ook niet kunnen
- Marktomvang, penetratie en marktaandeel. Daarvoor is een getrokken steekproef nodig, en die hebben wij niet.
- Voorspellen wat een advertentie gaat converteren. Een A/B-test op je eigen verkeer is daarvoor beter en meestal goedkoper.
- Een prijs vaststellen. Prijsvragen zijn de zwakste vorm op dit platform en dat verandert niet met een groter pakket.
- Bewijs leveren. Wat hier uitkomt is richting, en bij een zware beslissing hoort daar validatie of een bureau achteraan.
- Iets zeggen over één specifieke persoon. Verdelingen over een hele groep komen in de buurt, individuele voorspellingen niet.
Op deze pagina staat geen nauwkeurigheidspercentage. Andere aanbieders noemen getallen als "80 tot 95 procent nauwkeurig". Wij hebben geen eigen meting die zo'n getal draagt, en suggereren dat een uitkomst met jouw echte resultaten vergeleken is, is precies wat dit platform nergens doet. De cijfers die er wél zijn komen uit gepubliceerd onderzoek en staan met bron op de pagina over de onderbouwing.