{"id":"W4402619708","doi":"10.1111/jebm.12638","title":"Evaluation of the reliability and usability of CARE‐Radiology: A descriptive‐analytic study","year":2024,"lang":"en","type":"article","venue":"Journal of Evidence-Based Medicine","topic":"Radiology practices and education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Usability; Reliability (semiconductor); Descriptive research; Psychology; Computer science; Statistics; Mathematics; Human–computer interaction; Physics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"reporting","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"evaluation","study_design":"observational","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01624991,0.0001114137,0.0006008795,0.0002088612,0.00003909523,0.000004414497,0.0001255425,0.00007562596,0.0001120695],"category_scores_gemma":[0.02258641,0.00005192077,0.0001333166,0.0004292174,0.0006081076,0.0002322262,0.00001723766,0.0003942676,4.120894e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003766537,"about_ca_system_score_gemma":0.00191208,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001597505,"about_ca_topic_score_gemma":0.00001972849,"domain_scores_codex":[0.9965223,0.001244019,0.000924856,0.000193603,0.001007997,0.0001072071],"domain_scores_gemma":[0.9946591,0.00205793,0.0006427822,0.0003784425,0.002164643,0.00009712819],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002158945,0.0007916034,0.9290609,0.001995827,0.0007697532,0.00002126542,0.01777546,0.001114342,0.01291598,0.00004223679,0.001560586,0.03179305],"study_design_scores_gemma":[0.002428954,0.008466108,0.9516119,0.005057238,0.008893462,0.0002731438,0.01534065,0.006223544,0.0008835311,0.0005273267,0.0002300042,0.00006416351],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9540942,0.02579265,0.00007576066,0.01842972,0.000893974,0.0006205845,9.978004e-7,0.000003868488,0.00008821822],"genre_scores_gemma":[0.9989372,0.00040471,0.0001812674,0.000112485,0.0003331143,0.000006173446,5.50076e-7,0.000006190619,0.00001832748],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04484296,"threshold_uncertainty_score":0.9856468,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.242088675245645,"score_gpt":0.4457038113049224,"score_spread":0.2036151360592774,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}