{"id":"W4386224103","doi":"10.3390/jcm12175550","title":"Examining the Validity of ChatGPT in Identifying Relevant Nephrology Literature: Findings and Implications","year":2023,"lang":"en","type":"article","venue":"Journal of Clinical Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":50,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medicine; Internal medicine; External validity; Nephrology; Statistics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2767903,0.001030697,0.001671691,0.02152045,0.00402032,0.009044711,0.003893857,0.002236676,0.004396866],"category_scores_gemma":[0.793225,0.001014201,0.003168359,0.02126716,0.007549177,0.01661474,0.0136213,0.003075434,0.001168477],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007672508,"about_ca_system_score_gemma":0.01711942,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008744135,"about_ca_topic_score_gemma":0.01366638,"domain_scores_codex":[0.7676251,0.1388601,0.03413141,0.01214333,0.04365873,0.003581313],"domain_scores_gemma":[0.0654849,0.8302957,0.0488658,0.01373836,0.03880429,0.002810944],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001642538,0.0004791049,0.5136995,0.0356129,0.001742208,0.001812778,0.1992567,0.0008804258,0.001538425,0.007895323,0.02028023,0.2151598],"study_design_scores_gemma":[0.0006884609,0.001245146,0.5545428,0.05583719,0.004587585,0.003382728,0.2900288,0.01074412,0.003441278,0.02547683,0.04945365,0.0005712896],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8675637,0.01593206,0.03539265,0.02919229,0.001499514,0.00963835,0.005818606,0.001224296,0.03373855],"genre_scores_gemma":[0.9367937,0.003736314,0.03974693,0.005351185,0.0004394802,0.01041567,0.001703723,0.0003017991,0.001511179],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7232097,"threshold_uncertainty_score":0.8918463,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5086633924811425,"score_gpt":0.5614521106476769,"score_spread":0.05278871816653441,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}