{"id":"W4413111174","doi":"10.1002/sim.70227","title":"A Framework for Generating Realistic Synthetic Tabular Data in a Randomized Controlled Trial Setting","year":2025,"lang":"en","type":"article","venue":"Statistics in Medicine","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; McGill University Health Centre","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Randomized controlled trial; Synthetic data; Copula (linguistics); Artificial intelligence; Machine learning; Data mining; Econometrics; Medicine; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05612613,0.001097553,0.001425763,0.001829067,0.0004813989,0.001940824,0.00293014,0.00235733,0.007589698],"category_scores_gemma":[0.1264141,0.0008732757,0.002158921,0.001500341,0.001747524,0.001797923,0.002145275,0.003267833,0.001273005],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001287625,"about_ca_system_score_gemma":0.003702773,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00171785,"about_ca_topic_score_gemma":0.00170371,"domain_scores_codex":[0.9707568,0.02538317,0.000865755,0.001207953,0.001463127,0.0003232608],"domain_scores_gemma":[0.8427989,0.1389827,0.006151329,0.007285508,0.003652754,0.001128756],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000817917,0.0002329737,0.003165498,0.0007356134,0.0002799676,0.0003017588,0.0005745062,0.5865921,0.001184218,0.2938634,0.007035843,0.1052162],"study_design_scores_gemma":[0.0003863539,0.0003163798,0.0003075181,0.0001545024,0.00005589608,0.0001107324,0.00004292098,0.849685,0.0006397084,0.1432136,0.005047573,0.00003986884],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002449577,0.0001874025,0.9951432,0.0005073044,0.00006561792,0.0004641484,0.0003357224,0.0003061946,0.0005408314],"genre_scores_gemma":[0.111332,0.0003615538,0.8830027,0.0005683344,0.0001211661,0.002913572,0.0007223546,0.0001307854,0.000847471],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.05612613,"threshold_uncertainty_score":0.2968269,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03481874690734359,"score_gpt":0.3819513484906666,"score_spread":0.347132601583323,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}