{"id":"W4403340319","doi":"10.1017/s0008423924000234","title":"Replicating “Language Matters”: Taking Baselines into Account","year":2024,"lang":"en","type":"article","venue":"Canadian Journal of Political Science","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université Laval; Western University; Université de Montréal","funders":"","keywords":"Computer science; Law and economics; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09800271,0.001063573,0.00134743,0.004431598,0.004294422,0.00620541,0.004057744,0.002754496,0.007436608],"category_scores_gemma":[0.3530616,0.0003465437,0.002677712,0.008213095,0.004432456,0.004125167,0.003621418,0.002384279,0.002295064],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003897785,"about_ca_system_score_gemma":0.004110183,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.09098172,"about_ca_topic_score_gemma":0.05076947,"domain_scores_codex":[0.8870554,0.06839355,0.005973969,0.01821979,0.01547569,0.004881599],"domain_scores_gemma":[0.6175264,0.2733639,0.02541644,0.04727192,0.0331623,0.003259157],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002412784,0.00085121,0.8390694,0.002153226,0.006865249,0.00129181,0.01547758,0.006008212,0.003447678,0.02900361,0.04338879,0.05003059],"study_design_scores_gemma":[0.0006344294,0.001971944,0.7599143,0.001355389,0.004021846,0.0007126473,0.02371726,0.02357491,0.009101412,0.04225019,0.1324002,0.0003454396],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7858182,0.007289564,0.1137615,0.008770616,0.002782035,0.002312047,0.03912926,0.001449236,0.03868759],"genre_scores_gemma":[0.9751372,0.0001168606,0.009917045,0.001028666,0.0001897621,0.001213623,0.01043487,0.0002692966,0.001692763],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9019973,"threshold_uncertainty_score":0.5182941,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1231493895483586,"score_gpt":0.5038126145455223,"score_spread":0.3806632249971637,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}