arXiv:cs.LG· Aparana Gupta, Anurup Dey, Suyash Dwivedi·· 4 小时前AI 评分33
SynEval:面向多表合成数据生成的多维评估框架
Beyond Marginals: A Multi-Dimensional Evaluation Framework for Multi-Table Synthetic Data Generation
AI 导读
研究者提出 SynEval,一个面向多表(关系型)合成数据库的六维评估框架,联合评估逐列保真度、多变量结构保持(含条件分布检查 P(Y|X))、跨表完整性、ML 效用、隐私保护与边缘案例鲁棒性。该框架可输出统一加权质量分并支持按表和按维度下钻,且与生成器无关,可对任意真实与合成 CSV 文件夹自动推断 schema 后运行。
正文
Abstract:Synthetic data generation is critical for privacy compliance, machine learning augmentation, and software testing. While single-table evaluation is well established, multi-table (relational) synthesis, the dominant enterprise use case, lacks a unified evaluation framework. Existing approaches assess marginal column distributions in isolation, overlooking joint distributions, cross-table structural integrity, downstream utility, and production-readiness edge cases. We present SynEval, a six-dimensional evaluation framework for multi-table synthetic databases. SynEval jointly assesses per-column fidelity, multivariate structure preservation including a novel conditional distribution check, cross-table integrity, ML utility, privacy protection, and edge-case robustness. The framework produces a unified weighted quality score with per-table and per-dimension drill-down, and is generator-agnostic, operating on any pair of real and synthetic CSV folders with automatic schema inference. SynEval is a framework to combine conditional distribution checks P(Y|X), cross-table cardinality validation, and production-readiness edge-case testing within a single evaluation pipeline for relational synthetic data.
| Subjects: | Databases (cs.DB); Machine Learning (cs.LG) |
| Cite as: | arXiv:2610.06854 [cs.DB] |
| (or arXiv:2610.06854v1 [cs.DB] for this version) | |
| https://doi.org/10.48550/arXiv.2610.06854 arXiv-issued DOI via DataCite |
Submission history
From: Anurup Dey [view email]
[v1]
Tue, 28 Apr 2026 14:47:08 UTC (984 KB)
来源:arXiv:cs.LG · arxiv.org