28 mei 2026

Universiteit van Amsterdam

UvA-onderzoekers ontwikkelen methode die semantische integriteit van synthetische data borgt

Dienstensector

Generatieve modellen worden steeds vaker ingezet om synthetische tabellaire data te produceren voor toepassingen als fraudedetectie, privacybehoud en het stresstesten van modellen. Een fundamenteel probleem daarbij is dat statistische getrouwheid en semantische geldigheid niet hetzelfde zijn: een model kan realistische data genereren die toch domeinconstraints schendt. In een nieuw paper introduceren UvA-onderzoekers een aanpak die dit probleem aanpakt zonder expliciete regelspecificatie.

In kritieke domeinen zoals financiën, gezondheidszorg en productie is de kwaliteit van synthetische data niet alleen een kwestie van statistische nauwkeurigheid. Generatieve modellen kunnen marginale distributies nauwkeurig nabootsen en toch records produceren die fundamentele domeinconstraints schenden, bijvoorbeeld transactiebedragen die niet overeenkomen met rekeningtypes, of risicomarkeringen die onverenigbaar zijn met de classificatie van tegenpartijen. Dergelijke fouten vertegenwoordigen onwaarschijnlijke of juridisch onhoudbare scenario’s met reële gevolgen.

LSR (Latent Semantic Regularization) pakt dit probleem aan door impliciete constraintstructuur rechtstreeks uit de data te leren, zonder dat expliciete regelspecificatie, haalbaarheidscontroles of samengestelde negatieve voorbeelden nodig zijn. Het raamwerk werkt in twee fasen: eerst wordt een validator voorgetraind als een variationeel autoencoder met een normaliseringsstroomprior, daarna wordt deze bevroren ingebracht als semantische regularisatieterm bij het trainen van het generatieve model. Op die manier stuurt LSR het generatieproces richting semantisch plausibele output, zonder dat domeinkennis expliciet hoeft te worden gecodeerd.

Voor financiële datasynthese, waar schendingen van constraints reële gevolgen kunnen hebben, biedt LSR een robuuste evaluatie-infrastructuur en inductieve bias voor AI in audit en compliancetoepassingen. Het paper is van de hand van Saba Amiri, Carlijn Nijhuis, Eric Nalisnick, Adam Belloum, Sander Klous en Leon Gommans, en wordt gepresenteerd op het Symposium on Probabilistic Machine Learning in Seoul, Zuid-Korea, in juli 2026.

Lees ook

Meet tumoren snel en nauwkeurig dankzij AI

28 november 2023

AI helpt docenten bij nakijken, maar roept vragen op over betrouwbaarheid

7 april 2026

Amsterdam AI November Newsletter

21 november 2023

Schrijf je in voor onze nieuwsbrief

Blijf je graag op de hoogte blijven van wat er binnen het Amsterdam AI ecosysteem gebeurd?