{"id":"W4210414007","doi":"10.2196/preprints.23139","title":"Evaluating Identity Disclosure Risk in Fully Synthetic Health Data: Model Development and Validation (Preprint)","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Privacy-Preserving Technologies in Data","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Children's Hospital of Eastern Ontario; University of Ottawa","funders":"","keywords":"Overfitting; Identity (music); Computer science; Synthetic data; Preprint; Generative model; Data science; Data mining; World Wide Web; Artificial intelligence; Generative grammar","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02519599,0.0007054473,0.0007390629,0.0008894137,0.0004813367,0.001473462,0.001714378,0.001752213,0.002677472],"category_scores_gemma":[0.06179139,0.0004139072,0.001560819,0.0007447788,0.001202948,0.001101112,0.001654016,0.002055084,0.000385921],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002238278,"about_ca_system_score_gemma":0.002483991,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02114214,"about_ca_topic_score_gemma":0.0109768,"domain_scores_codex":[0.9946973,0.003953332,0.0002119751,0.0004585899,0.0005118573,0.0001668052],"domain_scores_gemma":[0.9204522,0.06887057,0.002427385,0.003503896,0.004373796,0.0003721278],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000195852,0.0001426696,0.0110611,0.0001419659,0.0001211311,0.00006692818,0.0001443821,0.9631853,0.000268728,0.009307433,0.001993788,0.01337072],"study_design_scores_gemma":[0.00001832288,0.00004483481,0.001049677,0.00002588738,0.00001226033,0.00001486882,0.00003208934,0.9949204,0.0002812961,0.003297112,0.0002941653,0.00000895721],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.4320686,0.001232421,0.549039,0.00472344,0.0002631258,0.001495043,0.005740439,0.0007490282,0.004688938],"genre_scores_gemma":[0.8247156,0.0003719051,0.1674339,0.0005028271,0.00007302268,0.001244723,0.003952225,0.00005549913,0.001650291],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02519599,"threshold_uncertainty_score":0.1332508,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1965442568271047,"score_gpt":0.3965316421401946,"score_spread":0.1999873853130899,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}