{"id":"W4220967648","doi":"10.1097/bpo.0000000000002136","title":"Interobserver and Intraobserver Agreement are Unsatisfactory When Determining Abstract Study Design and Level of Evidence","year":2022,"lang":"en","type":"article","venue":"Journal of Pediatric Orthopaedics","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"BC Children's Hospital","funders":"","keywords":"Medicine; Medical physics; Nuclear medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"evaluation","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.5890805,0.001567967,0.003900871,0.01580559,0.003774827,0.006287855,0.003928802,0.002632241,0.002614083],"category_scores_gemma":[0.7743081,0.00200072,0.003930409,0.007811885,0.007419873,0.004731447,0.006481323,0.002998385,0.001787686],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005011111,"about_ca_system_score_gemma":0.007539934,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00310806,"about_ca_topic_score_gemma":0.006367558,"domain_scores_codex":[0.2334984,0.4239887,0.2102761,0.01869145,0.1112963,0.002249149],"domain_scores_gemma":[0.09646841,0.6121557,0.08064523,0.04930374,0.159164,0.002262948],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.006575472,0.0004643721,0.3203954,0.05221044,0.01221833,0.001554446,0.03844006,0.003259014,0.01285406,0.01119864,0.03108538,0.5097444],"study_design_scores_gemma":[0.001679198,0.004318683,0.5076298,0.0616335,0.0115168,0.007217058,0.02696951,0.03427396,0.03522236,0.07618728,0.2314198,0.001931983],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.292236,0.1021865,0.4964483,0.01415136,0.01355921,0.02970492,0.003784462,0.002683709,0.04524552],"genre_scores_gemma":[0.7112868,0.006616846,0.2597414,0.003620166,0.001717253,0.01247634,0.00098127,0.0007586089,0.002801281],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.4109195,"threshold_uncertainty_score":0.506737,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9015335398561041,"score_gpt":0.5068814397572236,"score_spread":0.3946521000988805,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}