{"id":"W3095502049","doi":"10.1093/jssam/smaa023","title":"Machine Learning for Occupation Coding—A Comparison Study","year":2020,"lang":"en","type":"article","venue":"Journal of Survey Statistics and Methodology","topic":"Data-Driven Disease Surveillance","field":"Medicine","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Koch Institute for Integrative Cancer Research, Massachusetts Institute of Technology; Robert Koch Institut; Universität Mannheim; Social Sciences and Humanities Research Council of Canada; Deutsche Forschungsgemeinschaft; Institut für Arbeitsmarkt- und Berufsforschung","keywords":"Computer science; Coding (social sciences); Machine learning; Artificial intelligence; Multinomial distribution; Data mining; Statistics; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01694215,0.0008501569,0.0008303429,0.002942241,0.0008997315,0.00199656,0.001856336,0.001448836,0.003745319],"category_scores_gemma":[0.06901777,0.0002847299,0.001225649,0.00298517,0.00106234,0.002800574,0.001308104,0.002236977,0.001336861],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002513106,"about_ca_system_score_gemma":0.00160088,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01115459,"about_ca_topic_score_gemma":0.006810096,"domain_scores_codex":[0.9881981,0.008676227,0.0004607773,0.001105959,0.001182372,0.0003766715],"domain_scores_gemma":[0.9058338,0.07850874,0.002803256,0.004851162,0.007031919,0.0009711168],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.006119942,0.0044772,0.3391311,0.001813921,0.001562427,0.0002549437,0.002252256,0.08193183,0.001026108,0.01291286,0.02636205,0.5221554],"study_design_scores_gemma":[0.0006985183,0.002724193,0.2539698,0.0007449757,0.0006943414,0.000338304,0.004961906,0.7021742,0.00270902,0.01490342,0.01589185,0.0001895232],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.964805,0.002601005,0.02262511,0.001633907,0.0002978493,0.0003159638,0.001286929,0.0003572337,0.006076986],"genre_scores_gemma":[0.9811615,0.0003964672,0.01479587,0.000157368,0.0001023903,0.0001827638,0.002279029,0.00006386267,0.0008607627],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9830579,"threshold_uncertainty_score":0.08959979,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.400401439441831,"score_gpt":0.4705134066249507,"score_spread":0.07011196718311963,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}