{"id":"W4366462753","doi":"10.1177/08465371231171125","title":"Accuracy of Information and References Using ChatGPT-3 for Retrieval of Clinical Radiological Information","year":2023,"lang":"en","type":"article","venue":"Canadian Association of Radiologists Journal","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":126,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hospital for Sick Children; University of Toronto","funders":"","keywords":"Medicine; Subspecialty; Radiological weapon; Correctness; Information retrieval; Checklist; Medical physics; Radiology; Computer science; Family medicine; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03483252,0.0007903901,0.0009390188,0.004827376,0.0008439184,0.002079373,0.001393766,0.001702405,0.004222812],"category_scores_gemma":[0.2868446,0.0003003723,0.0006429789,0.001665712,0.0008340426,0.002036094,0.003030466,0.0008241739,0.002504343],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001369674,"about_ca_system_score_gemma":0.002363122,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002549464,"about_ca_topic_score_gemma":0.002979951,"domain_scores_codex":[0.9530038,0.03248201,0.004336705,0.002490377,0.006891517,0.0007955747],"domain_scores_gemma":[0.6369411,0.2748834,0.01992228,0.01493367,0.0500081,0.003311372],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01006594,0.001292944,0.2453861,0.009764023,0.0004285974,0.004596881,0.07290188,0.003632827,0.05334365,0.001409091,0.04866575,0.5485124],"study_design_scores_gemma":[0.001886239,0.0105087,0.5068606,0.01192501,0.0016623,0.01371149,0.05798049,0.1215034,0.1298362,0.00528355,0.137309,0.001533004],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9309721,0.002231903,0.03797968,0.003198377,0.0008964912,0.002197383,0.003536765,0.007896352,0.01109099],"genre_scores_gemma":[0.9241422,0.0008105741,0.0644759,0.001241921,0.0002383636,0.001379709,0.003122277,0.000647281,0.003941801],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9651675,"threshold_uncertainty_score":0.1842142,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2617026522178948,"score_gpt":0.4714570099247067,"score_spread":0.2097543577068119,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}