{"id":"W4402619708","doi":"10.1111/jebm.12638","title":"Evaluation of the reliability and usability of CARE‐Radiology: A descriptive‐analytic study","year":2024,"lang":"en","type":"article","venue":"Journal of Evidence-Based Medicine","topic":"Radiology practices and education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Usability; Reliability (semiconductor); Descriptive research; Psychology; Computer science; Statistics; Mathematics; Human–computer interaction; Physics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"reporting","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"evaluation","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.08274382,0.0003797882,0.001084342,0.006123594,0.0008041128,0.001719053,0.0009655994,0.0004786338,0.001001865],"category_scores_gemma":[0.1928413,0.0004974657,0.00151757,0.004140131,0.002160413,0.002091703,0.00149913,0.0006355697,0.0002144152],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002334156,"about_ca_system_score_gemma":0.002684449,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001208779,"about_ca_topic_score_gemma":0.001299037,"domain_scores_codex":[0.9233014,0.04075104,0.01451848,0.002530333,0.01748438,0.001414351],"domain_scores_gemma":[0.6687489,0.2434909,0.03659208,0.007013797,0.04256759,0.001586748],"domain_codex":null,"domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0008549126,0.0007600893,0.8949643,0.002644132,0.0005195828,0.0003083533,0.04112666,0.0005064841,0.001480637,0.0005890506,0.0006347163,0.05561113],"study_design_scores_gemma":[0.0001374143,0.004665602,0.9270495,0.001465832,0.0004440226,0.001262459,0.05378349,0.003359565,0.002520703,0.0007067745,0.004431641,0.0001730772],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9910055,0.0006122552,0.005179576,0.0001193574,0.00001837224,0.001415476,0.000286904,0.00002668771,0.00133594],"genre_scores_gemma":[0.9925799,0.0002537766,0.004851205,0.00005585636,0.00001555682,0.001854777,0.0002176122,0.00001383627,0.0001575939],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9172562,"threshold_uncertainty_score":0.4375964,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.242088675245645,"score_gpt":0.4457038113049224,"score_spread":0.2036151360592774,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}