{"id":"W4416050261","doi":"10.48550/arxiv.2508.14936","title":"Can synthetic data reproduce real-world findings in epidemiology? A replication study using adversarial random forests","year":2025,"lang":"en","type":"preprint","venue":"MDC Repository (Max-Delbrueck-Center for Molecular Medicine)","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Leibniz-Gemeinschaft; Deutsche Forschungsgemeinschaft; European Commission; Bundesministerium für Bildung und Forschung; Freie Hansestadt Bremen","keywords":"Synthetic data; Replication (statistics); Curse of dimensionality; Generative model; Dimensionality reduction; Data quality; Stability (learning theory); Generative grammar; Statistical model","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0577633,0.001017023,0.0009329719,0.001028066,0.0007067352,0.001871819,0.001794216,0.001384121,0.002473559],"category_scores_gemma":[0.1723562,0.0005336288,0.002263136,0.001125864,0.002071235,0.001976878,0.001718441,0.002451455,0.0004577595],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009347733,"about_ca_system_score_gemma":0.00158118,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002887771,"about_ca_topic_score_gemma":0.00236012,"domain_scores_codex":[0.9756492,0.01975718,0.0008458263,0.002065566,0.001397192,0.0002851562],"domain_scores_gemma":[0.8223499,0.1310816,0.007138127,0.03284093,0.006053348,0.0005361054],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004684984,0.0009574005,0.1474551,0.003561757,0.004199043,0.001346249,0.003432864,0.5180966,0.01221304,0.08042695,0.0180313,0.2055948],"study_design_scores_gemma":[0.0008294946,0.00234604,0.02826931,0.001053443,0.00125466,0.001089231,0.001439787,0.7275327,0.01748244,0.1910582,0.02731556,0.0003291721],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3158679,0.002483385,0.6655937,0.002943612,0.0009128677,0.001519652,0.006306584,0.0009323557,0.003440025],"genre_scores_gemma":[0.8343854,0.0005538129,0.1566664,0.001261202,0.0001784187,0.00150479,0.004469941,0.0002071818,0.0007727801],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9422367,"threshold_uncertainty_score":0.3054852,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09009185104687441,"score_gpt":0.4003850397833321,"score_spread":0.3102931887364577,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}