{"id":"W3172401221","doi":"10.1017/pan.2021.15","title":"Multi-Label Prediction for Political Text-as-Data","year":2021,"lang":"en","type":"article","venue":"Political Analysis","topic":"Topic Modeling","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Centre for Social Innovation","funders":"Compute Canada; National Science Foundation","keywords":"Computer science; Machine learning; Artificial intelligence; Code (set theory); Set (abstract data type); Supervised learning; Training set; Source code; Government (linguistics); Data set; Association (psychology); Natural language processing; Artificial neural network; Psychology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008189013,0.000898994,0.0008082141,0.003997688,0.001173354,0.00183605,0.001428326,0.001502514,0.002349821],"category_scores_gemma":[0.03789064,0.0002976839,0.0006366962,0.003807139,0.0008338633,0.003332465,0.001385746,0.003500791,0.001475809],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001225155,"about_ca_system_score_gemma":0.0008982957,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005781762,"about_ca_topic_score_gemma":0.007544234,"domain_scores_codex":[0.9948737,0.003075105,0.0001840613,0.0009607768,0.0006434192,0.0002629951],"domain_scores_gemma":[0.935798,0.05084828,0.004236425,0.004058525,0.004091955,0.0009666632],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001015847,0.001515343,0.1551412,0.0005143407,0.0003635118,0.0004889448,0.0009439923,0.4039959,0.004902861,0.01904187,0.04565397,0.3664222],"study_design_scores_gemma":[0.000008575915,0.00001495255,0.003087791,0.00001747375,0.000006404688,0.00001447482,0.00006177874,0.9851732,0.0007455895,0.009823857,0.001036401,0.000009480222],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4861923,0.002307198,0.4862832,0.005509006,0.0009017647,0.0003157062,0.008015973,0.005876716,0.004598022],"genre_scores_gemma":[0.9097651,0.0001824702,0.08229762,0.0002096775,0.0004017318,0.0001532105,0.005871086,0.0001488445,0.0009703343],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008189013,"threshold_uncertainty_score":0.04330814,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0953883885612755,"score_gpt":0.3506028114180816,"score_spread":0.2552144228568061,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}