{"id":"W3095502049","doi":"10.1093/jssam/smaa023","title":"Machine Learning for Occupation Coding—A Comparison Study","year":2020,"lang":"en","type":"article","venue":"Journal of Survey Statistics and Methodology","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Koch Institute for Integrative Cancer Research, Massachusetts Institute of Technology; Robert Koch Institut; Universität Mannheim; Social Sciences and Humanities Research Council of Canada; Deutsche Forschungsgemeinschaft; Institut für Arbeitsmarkt- und Berufsforschung","keywords":"Computer science; Coding (social sciences); Machine learning; Artificial intelligence; Multinomial distribution; Data mining; Statistics; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.00437858,0.0001005745,0.0006789394,0.00007252662,0.00005671229,0.00001481625,0.00006080258,0.00004023607,0.00002489636],"category_scores_gemma":[0.01571069,0.00008350674,0.00004050105,0.00009597405,0.00004419174,0.00003581122,0.00003291967,0.0002629689,0.000001094302],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0000162764,"about_ca_system_score_gemma":0.00006769545,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000794246,"about_ca_topic_score_gemma":0.00009662518,"domain_scores_codex":[0.9973524,0.001637991,0.0005685051,0.0001419992,0.000166397,0.0001326991],"domain_scores_gemma":[0.9945121,0.004194802,0.0005120019,0.00006726004,0.0005013901,0.0002124103],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003388833,0.0001722636,0.9656792,0.0001074182,0.0002093405,0.00004906419,0.0006244579,0.00008654936,0.0004411006,0.0001199181,0.005460706,0.02366115],"study_design_scores_gemma":[0.003222549,0.004317896,0.9726246,0.00001393406,0.0002205503,0.00004138786,0.0002994243,0.01079891,0.00004062576,0.0001533997,0.008177914,0.0000888016],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1170077,0.0004261326,0.8810257,0.0004091716,0.000208128,0.0002746254,0.0006267659,0.0000099749,0.00001177293],"genre_scores_gemma":[0.7581279,0.0001279828,0.2410116,0.0003649242,0.0001271412,0.000002003016,0.0002054664,0.0000149441,0.00001799972],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6411203,"threshold_uncertainty_score":0.9925804,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.400401439441831,"score_gpt":0.4705134066249507,"score_spread":0.07011196718311963,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}