Questry AITerug naar de kennisbank

Kennisbank

Kan AI een winnende verkoopmail herkennen? Wat het SDR-Bench-onderzoek laat zien

Een nieuw onderzoek laat zien dat de beste AI-modellen ongeveer de helft vinden van wat een verkoper in een winnende mail stopt. De andere helft is geen intelligentie, maar geheugen.

Luuk van de Ven (mede-oprichter) · 7 september 2026 · Read this article in English

Iedereen die AI inzet voor sales krijgt vroeg of laat dezelfde vraag: kan het model eigenlijk een goede verkoopmail schrijven? Niet een mail die goed klinkt, maar een mail die tot een afspraak leidt. In mei 2026 verscheen een onderzoek dat precies dat meet, met echte verkoopmails van echte bedrijven.

De uitkomst is verrassend duidelijk. De beste modellen vinden ongeveer de helft van de argumenten die een verkoper in een winnende mail gebruikt. En bij een groot techbedrijf kon geen enkel model het verschil zien tussen een mail die tot een afspraak leidde en een mail die genegeerd werd. Dit artikel legt uit wat de onderzoekers deden, wat ze vonden, en wat dat betekent voor bedrijven die AI willen inzetten voor outreach.

Wat de onderzoekers deden

Het onderzoek, Benchmarking the Personalization Capabilities of Large Language Models, is opgezet rond een simpel idee. Als een verkoopmail aantoonbaar tot een afspraak heeft geleid, dan zit in die mail de winnende strategie: de pijnpunten en argumenten die de klant over de streep trokken. Een AI is goed in personalisatie als hij, zonder die mail te kennen, dezelfde argumenten weet te vinden.

De onderzoekers verzamelden twee soorten bewijs. Ten eerste 6.279 openbare klantcases van grote bedrijven uit 22 sectoren, waarin staat welk probleem een klant had en hoe een product dat oploste. Ten tweede echte verkoopmails van twee bedrijven: een zorgbedrijf en een Fortune 100-techbedrijf, met in totaal ruim 100.000 mails van 124 verkopers. Van elke mail was bekend of hij tot een gesprek had geleid.

Daarna kreeg de AI per geval drie dingen: het product, het bedrijf dat benaderd werd, en de datum. De opdracht: bedenk welke argumenten je zou gebruiken. De AI mocht op internet zoeken, maar alleen in informatie die op die datum al bestond. Zo kon het model niet stiekem de klantcase zelf opzoeken. Tot slot werd het antwoord van de AI naast de echte winnende mail gelegd en gescoord: welk deel van de echte argumenten had het model ook gevonden?

Welke modellen zijn getest

Het gaat om de modellen die bedrijven nu daadwerkelijk gebruiken: Claude Sonnet 4.6, GPT-5.4, GPT-5.4-mini, GPT-4o en Qwen 2.5, allemaal met webzoeken. Daarnaast drie zogenoemde deep-research-agents, die meerdere zoekrondes doen en veel meer tekst verwerken voordat ze antwoorden.

Resultaat 1: de beste AI vindt ongeveer de helft

Op de openbare klantcases scoorde Claude Sonnet 4.6 het hoogst met 56 op 100. De andere modellen zaten tussen de 35 en 45. Anders gezegd: het beste model vindt iets meer dan de helft van de argumenten die een mens in een winnende pitch stopt. De rest ontbreekt.

Opvallend is dat meer rekenkracht niet helpt. Een groter model, meer zoekopdrachten of een deep-research-agent die tienduizenden woorden verwerkt: de scores blijven hangen op hetzelfde niveau. De onderzoekers noemen dit het personalisatie-plateau. Het probleem zit niet in het denkvermogen van het model.

Resultaat 2: bij het techbedrijf zag de AI geen verschil

De belangrijkste test zat in de echte verkoopmails. Per bedrijf pakten de onderzoekers 200 mails die tot een afspraak leidden en 200 mails die genegeerd werden. De AI moest voor beide groepen de argumenten bedenken. Als het model snapt wat werkt, zouden zijn argumenten meer moeten lijken op de winnende mails dan op de verliezende.

Bij het zorgbedrijf lukte dat een beetje: de overlap met winnende mails was 32 procent, met genegeerde mails 22 procent. Bij het Fortune 100-techbedrijf was er geen verschil. De argumenten van de AI leken evenveel op de mails die werkten als op de mails die in de prullenbak verdwenen. In de woorden van de onderzoekers: geen enkel model kon statistisch succesvolle van mislukte outreach onderscheiden.

De verklaring is logisch. Een groot techbedrijf krijgt honderden mails per week met dezelfde voor de hand liggende argumenten. De mail die wint, wint niet op logica maar op iets specifieks: een detail dat alleen die verkoper wist. En dat detail staat nergens online.

Resultaat 3: in de praktijk was de helft direct bruikbaar

De onderzoekers lieten twaalf professionele verkopers het systeem gebruiken in hun normale werk, voor ruim 200 prospects. Van alle gegenereerde argumenten vonden zij 48 procent direct bruikbaar zonder herschrijven. Senior verkopers met minimaal tien jaar ervaring beoordeelden de output onafhankelijk, en hun oordeel kwam sterk overeen met de automatische score.

De conclusie van de onderzoekers is dan ook niet dat AI nutteloos is voor sales. Hun advies is human-in-the-loop: laat de AI bouwstenen leveren, en laat een mens kiezen wat erin gaat.

Waarom een mens meer vindt dan de AI

Dit is het deel dat het meest wordt misverstaan. De mens is niet slimmer dan het model. De mens weet meer. De AI kreeg alleen wat er online stond: de website, vacatures, nieuwsberichten, het jaarverslag. Daaruit haalt hij logische argumenten, en dat is de helft die hij wel vindt.

De verkoper die de deal sloot wist dingen die nergens gepubliceerd zijn. Wat een vergelijkbare klant vorig jaar zei. Welk argument bij de concurrent van deze prospect werkte. Welk bewijs deze branche overtuigt en welk bewijs juist wantrouwen oproept. Dat is de andere helft, en die is niet te vinden door beter te zoeken. Die zit in ervaring en geheugen.

Daarom helpt een beter model niet. Het ontbrekende deel is geen intelligentie, het is informatie die alleen in je eigen dealgeschiedenis bestaat.

Wat dit betekent voor AI in outreach

Wie AI inzet voor koude e-mail loopt precies tegen dit plateau aan. Een tool die alleen de website van een prospect leest en daar een mail van maakt, produceert de helft die iedereen produceert. In een drukke markt is dat de helft die genegeerd wordt.

Het verschil zit in het systeem eromheen. Ten eerste in wie je mailt: een scherpe selectie van bedrijven die lijken op je beste klanten, een goed bepaald ICP en TAM, levert meer op dan een lange lijst met generieke mails. Ten tweede in wat je onthoudt: elke reactie, elke afspraak en elke verloren deal bevat informatie die de volgende mail beter maakt, mits je die informatie vastlegt en teruggebruikt.

Dit is de reden dat Questry is gebouwd rond Open Brain, een zelflerend geheugen. Elk dossier wordt opgebouwd uit tientallen bronnen, inclusief je eigen eerdere mails en gesprekken. Open Brain kiest wie je benadert en schrijft de mail op basis van wat eerder werkte bij vergelijkbare bedrijven. Elke deal maakt de volgende campagne scherper. En net als de onderzoekers adviseren, blijft de mens in de lus: de AI schrijft en boekt de afspraak, jij bevestigt.

Bron

Srivastava, A. e.a. (2026). Benchmarking the Personalization Capabilities of Large Language Models. arXiv:2607.20471. De dataset (SDR-Bench) en de testomgeving (SDR-Arena) zijn openbaar beschikbaar, zodat nieuwe modellen opnieuw getest kunnen worden.

Benieuwd hoe Questry AI dit voor je automatiseert?

Bekijk de abonnementen