跳到正文
arXiv:cs.LG· Aparana Gupta, Anurup Dey, Suyash Dwivedi·· 4 小时前AI 评分33

SynEval:面向多表合成数据生成的多维评估框架

Beyond Marginals: A Multi-Dimensional Evaluation Framework for Multi-Table Synthetic Data Generation

AI 导读

研究者提出 SynEval,一个面向多表(关系型)合成数据库的六维评估框架,联合评估逐列保真度、多变量结构保持(含条件分布检查 P(Y|X))、跨表完整性、ML 效用、隐私保护与边缘案例鲁棒性。该框架可输出统一加权质量分并支持按表和按维度下钻,且与生成器无关,可对任意真实与合成 CSV 文件夹自动推断 schema 后运行。

正文

View PDF HTML (experimental)

Abstract:Synthetic data generation is critical for privacy compliance, machine learning augmentation, and software testing. While single-table evaluation is well established, multi-table (relational) synthesis, the dominant enterprise use case, lacks a unified evaluation framework. Existing approaches assess marginal column distributions in isolation, overlooking joint distributions, cross-table structural integrity, downstream utility, and production-readiness edge cases. We present SynEval, a six-dimensional evaluation framework for multi-table synthetic databases. SynEval jointly assesses per-column fidelity, multivariate structure preservation including a novel conditional distribution check, cross-table integrity, ML utility, privacy protection, and edge-case robustness. The framework produces a unified weighted quality score with per-table and per-dimension drill-down, and is generator-agnostic, operating on any pair of real and synthetic CSV folders with automatic schema inference. SynEval is a framework to combine conditional distribution checks P(Y|X), cross-table cardinality validation, and production-readiness edge-case testing within a single evaluation pipeline for relational synthetic data.
Subjects: Databases (cs.DB); Machine Learning (cs.LG)
Cite as: arXiv:2610.06854 [cs.DB]
  (or arXiv:2610.06854v1 [cs.DB] for this version)
  https://doi.org/10.48550/arXiv.2610.06854

arXiv-issued DOI via DataCite

Submission history

From: Anurup Dey [view email]
[v1] Tue, 28 Apr 2026 14:47:08 UTC (984 KB)

来源:arXiv:cs.LG · arxiv.org