{"id":"W4403289769","doi":"10.1186/s12982-024-00245-3","title":"Efficient detection of data entry errors in large-scale public health surveys: an unsupervised machine learning approach","year":2024,"lang":"en","type":"article","venue":"Discover Public Health","topic":"Artificial Intelligence in Healthcare","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Ministry of Labour","funders":"Ministry of Health and Family Welfare; Indian Council of Medical Research","keywords":"Scale (ratio); Computer science; Unsupervised learning; Machine learning; Public health; Artificial intelligence; Data science; Medicine; Geography; Cartography; Nursing","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.0337017,0.000427776,0.0009586496,0.001049522,0.001191877,0.0001104398,0.001096122,0.0003899925,0.000299482],"category_scores_gemma":[0.001178239,0.0003942463,0.0001086623,0.002759943,0.0001510156,0.001235314,0.0006939212,0.002893824,0.0001212049],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001834123,"about_ca_system_score_gemma":0.01328459,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.05711382,"about_ca_topic_score_gemma":0.09554966,"domain_scores_codex":[0.9777079,0.01389586,0.002820391,0.001633002,0.001076972,0.002865867],"domain_scores_gemma":[0.9953551,0.0007594603,0.000641518,0.001677314,0.0002811098,0.001285454],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008094843,0.003067568,0.5748641,0.01098294,0.00009067266,0.0000120265,0.1495089,0.002329815,0.00008435202,0.00528544,0.0007432651,0.2529499],"study_design_scores_gemma":[0.0005286969,0.0004873916,0.03776421,0.0005571507,0.000005307312,0.000005542708,0.05923433,0.8611021,0.000008807335,0.00008292041,0.03978997,0.000433596],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8723083,0.005425218,0.08413845,0.02869407,0.002649124,0.003631062,0.001688288,0.000652176,0.000813277],"genre_scores_gemma":[0.9928183,0.000547121,0.0005755234,0.0017512,0.0003543677,0.0001864421,0.003361186,0.0001258958,0.0002799853],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8587723,"threshold_uncertainty_score":0.9998509,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2832986354967932,"score_gpt":0.467259722435846,"score_spread":0.1839610869390528,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}