Generatieve modellen worden steeds vaker ingezet om synthetische tabellaire data te produceren voor toepassingen als fraudedetectie, privacybehoud en het stresstesten van modellen. Een fundamenteel probleem daarbij is dat statistische getrouwheid en semantische geldigheid niet hetzelfde zijn: een model kan realistische data genereren die toch domeinconstraints schendt. In een nieuw paper introduceren UvA-onderzoekers een aanpak die dit probleem aanpakt zonder expliciete regelspecificatie.
In kritieke domeinen zoals financiën, gezondheidszorg en productie is de kwaliteit van synthetische data niet alleen een kwestie van statistische nauwkeurigheid. Generatieve modellen kunnen marginale distributies nauwkeurig nabootsen en toch records produceren die fundamentele domeinconstraints schenden, bijvoorbeeld transactiebedragen die niet overeenkomen met rekeningtypes, of risicomarkeringen die onverenigbaar zijn met de classificatie van tegenpartijen. Dergelijke fouten vertegenwoordigen onwaarschijnlijke of juridisch onhoudbare scenario’s met reële gevolgen.
LSR (Latent Semantic Regularization) pakt dit probleem aan door impliciete constraintstructuur rechtstreeks uit de data te leren, zonder dat expliciete regelspecificatie, haalbaarheidscontroles of samengestelde negatieve voorbeelden nodig zijn. Het raamwerk werkt in twee fasen: eerst wordt een validator voorgetraind als een variationeel autoencoder met een normaliseringsstroomprior, daarna wordt deze bevroren ingebracht als semantische regularisatieterm bij het trainen van het generatieve model. Op die manier stuurt LSR het generatieproces richting semantisch plausibele output, zonder dat domeinkennis expliciet hoeft te worden gecodeerd.
Voor financiële datasynthese, waar schendingen van constraints reële gevolgen kunnen hebben, biedt LSR een robuuste evaluatie-infrastructuur en inductieve bias voor AI in audit en compliancetoepassingen. Het paper is van de hand van Saba Amiri, Carlijn Nijhuis, Eric Nalisnick, Adam Belloum, Sander Klous en Leon Gommans, en wordt gepresenteerd op het Symposium on Probabilistic Machine Learning in Seoul, Zuid-Korea, in juli 2026.