{"id":"W3163329370","doi":"10.1002/bin.1793","title":"Further evaluating interobserver reliability and accuracy with and without structured visual‐inspection criteria","year":2021,"lang":"en","type":"article","venue":"Behavioral Interventions","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Brock University","funders":"","keywords":"Visual inspection; Psychology; Reliability (semiconductor); Context (archaeology); Artificial intelligence; Computer science; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.17097,0.0008820095,0.0009398906,0.002727284,0.001158451,0.002331407,0.001893527,0.001277107,0.002194256],"category_scores_gemma":[0.4165725,0.0006542067,0.001543795,0.001767267,0.002453794,0.00242037,0.002754788,0.001405347,0.0006689592],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001250832,"about_ca_system_score_gemma":0.001408097,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002692198,"about_ca_topic_score_gemma":0.005379988,"domain_scores_codex":[0.8535601,0.0971467,0.01789656,0.01047959,0.01918278,0.001734271],"domain_scores_gemma":[0.4254586,0.3955055,0.04298497,0.04921727,0.08528791,0.001545777],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004029236,0.001589883,0.6168246,0.003389186,0.003063291,0.0003806843,0.04992186,0.008145617,0.01690856,0.007003519,0.009143641,0.2796],"study_design_scores_gemma":[0.0006046899,0.003576423,0.8470868,0.001805732,0.00114676,0.001050412,0.01114155,0.06835338,0.02682054,0.01982678,0.0180048,0.000582075],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8080807,0.00166137,0.1763941,0.0008479449,0.0007480123,0.002018072,0.0005206899,0.0005381706,0.009190894],"genre_scores_gemma":[0.9552857,0.0001505994,0.04218209,0.0001420625,0.00007715625,0.001214384,0.0002425338,0.0001238695,0.0005817276],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.82903,"threshold_uncertainty_score":0.9041865,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4952346674730059,"score_gpt":0.5462249051868463,"score_spread":0.05099023771384043,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}