{"id":"W4224311959","doi":"10.2196/35734","title":"Utility Metrics for Evaluating Synthetic Health Data Generation Methods: Validation Study","year":2022,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":68,"is_retracted":false,"has_abstract":true,"ca_institutions":"Children's Hospital of Eastern Ontario; University of Ottawa","funders":"","keywords":"Computer science; Metric (unit); Data mining; Machine learning; Synthetic data; Artificial intelligence; Data set","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.04109218,0.001664027,0.0008518821,0.00418114,0.0007313605,0.001547604,0.001776015,0.001396253,0.001061054],"category_scores_gemma":[0.1299026,0.0003692625,0.00108282,0.002269226,0.00177446,0.001724832,0.002520192,0.001765753,0.000312387],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002350816,"about_ca_system_score_gemma":0.001676477,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005597022,"about_ca_topic_score_gemma":0.003467067,"domain_scores_codex":[0.9780804,0.0135933,0.001710077,0.001517985,0.004666273,0.0004319836],"domain_scores_gemma":[0.8394923,0.1186705,0.007052926,0.01429318,0.01907827,0.001412933],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.00172394,0.001946776,0.08682645,0.001688682,0.001073528,0.0003002699,0.0008622442,0.6019289,0.006759522,0.01043121,0.01041545,0.276043],"study_design_scores_gemma":[0.0002007061,0.002122951,0.01716918,0.000263574,0.0001110987,0.0003421835,0.0002941903,0.962233,0.009748509,0.004485619,0.00294718,0.00008171568],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6056353,0.003953364,0.378817,0.0009655455,0.0003843439,0.002223222,0.00301869,0.00173854,0.003263871],"genre_scores_gemma":[0.8312166,0.0005803426,0.1624895,0.0002080059,0.00008619806,0.0009565026,0.003862927,0.0001444409,0.0004554169],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9589078,"threshold_uncertainty_score":0.2173188,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3011521977899394,"score_gpt":0.5364280745162925,"score_spread":0.2352758767263531,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}