Vertical betekent taakspecifiek, niet alleen sectorspecifiek
Twee producten voor dezelfde sector kunnen volledig andere intelligentie nodig hebben. Een juridisch zoekproduct moet autoriteit, datum en jurisdictie begrijpen; contractredlining vraagt clausules, onderhandelingspositie en tracked changes; dossierorkestratie vraagt identiteit, rechten, status en audit. De verticale eenheid is daarom de taak in context, niet het marktlabel.
Leg het domein vast als productmodel: kernentiteiten, toegestane toestanden, beslisregels, uitzonderingen en gevolgen. Pas daarna kies je modellen, retrieval en agents. Dit voorkomt dat een probabilistisch systeem stilletjes bedrijfslogica gaat improviseren die in code, policy of een bevoegde rol thuishoort.
Algemene modelkwaliteit is niet jouw productkwaliteit
LegalBench bevat 162 juridische redeneertaken van veertig bijdragers en bestaat juist omdat algemene taalbenchmarks onvoldoende zeggen over rechtsrelevante taken. NIST adviseert eveneens dat prestaties worden gemeten onder omstandigheden die lijken op de deploymentsetting, met gedocumenteerde testsets, metrics en betrokken domeinexperts.
Bouw daarom een eigen task suite vóór je breed uitrolt. Gebruik echte, geanonimiseerde gevallen, synthetische randgevallen en adversarial inputs. Score niet alleen het eindantwoord, maar bronselectie, ontbrekende informatie, geldige toolkeuze, formaat, onzekerheid en de vraag of een mens de fout kan herkennen.
- Normale cases uit het werkelijke volume.
- Zeldzame maar impactvolle uitzonderingen.
- Verouderde, tegenstrijdige en ontbrekende bronnen.
- Onjuiste gebruikersaannames en prompt injection.
- Uitvallende tools, time-outs en dubbele mutaties.
RAG is een bronmechanisme, geen waarheidssysteem
Retrieval-augmented generation kan relevante stukken context ophalen en citaties mogelijk maken. Maar de pipeline kan falen doordat de juiste bron ontbreekt, een chunk de uitzondering verliest, ranking de verkeerde versie kiest of het model correct bewijs verkeerd interpreteert. Een antwoord met een link is nog geen onderbouwd antwoord.
Stanford RegLab liet bij wettelijke surveys zien dat standaard-RAG en commerciële juridische systemen sterk uiteenlopende en soms lage taaknauwkeurigheid hadden, terwijl een speciaal ontworpen systeem met domeinbenchmark beter presteerde. De productles is breder: optimaliseer retrieval, redenering en verificatie samen tegen de taak die werkelijk telt.
Bronnen [3]
Workflow-inpassing bepaalt economische waarde
Een nauwkeurig antwoord dat opnieuw moet worden gekopieerd, gecontroleerd en ingevoerd, levert beperkte systeemwinst. Vertical AI krijgt waarde wanneer het dossiercontext kan lezen, een voorstel in het juiste objectmodel schrijft, wijzigingen toont, toestemming vraagt en het resultaat gecontroleerd terugzet. Dat vereist identity, integraties, product-UX en operationeel eigenaarschap naast modelwerk.
Scheid informatie, voorstel en actie. Een systeem mag ruim zoeken, smaller adviseren en alleen binnen expliciete rechten muteren. Laat iedere actie een idempotency key, actor, broncontext, status en herstelpad dragen. Zo kan autonomie per capability groeien zonder dat het gehele product ineens onbeheerst handelt.
Bouw een leerlus die niet van geheimen afhankelijk is
De beste vertical-AI data ontstaat vaak tijdens het werk: welke suggestie werd aangepast, welke bron ontbrak, welke uitzondering leidde tot escalatie en welk resultaat hield stand. Verzamel die signalen met toestemming en duidelijke bewaartermijnen. Maak correctie goedkoop en structureer reden en uitkomst, zodat een team patronen kan herkennen zonder ieder dossier opnieuw te lezen.
Gebruik de leerlus eerst voor evaluaties, retrieval, policies en UX. Fine-tuning is pas logisch wanneer voldoende representatieve, rechtmatig bruikbare voorbeelden bestaan en een meetbare foutvorm ermee verbetert. De verdedigbare voorsprong is niet dat niemand hetzelfde basismodel kan kopen, maar dat jouw volledige product sneller en veiliger leert van het domein.
Bronnen [2]