{"id":"W4396977388","doi":"10.3390/curroncol31050212","title":"The Consistency and Quality of ChatGPT Responses Compared to Clinical Guidelines for Ovarian Cancer: A Delphi Approach","year":2024,"lang":"en","type":"article","venue":"Current Oncology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medicine; Ovarian cancer; Consistency (knowledge bases); Quality (philosophy); Delphi; Delphi method; Oncology; Internal medicine; Cancer; Computer science; Artificial intelligence; Programming language","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2460631,0.0007326126,0.001062913,0.008465596,0.002152191,0.00311574,0.001769209,0.001278369,0.001925043],"category_scores_gemma":[0.3280093,0.0007601489,0.002071392,0.004687425,0.004566118,0.00302849,0.008323902,0.001543853,0.000309095],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007483502,"about_ca_system_score_gemma":0.008687949,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003022384,"about_ca_topic_score_gemma":0.00253721,"domain_scores_codex":[0.7102276,0.2364253,0.02583327,0.005037492,0.01802417,0.004452186],"domain_scores_gemma":[0.5797397,0.3378161,0.01453794,0.006695172,0.05879442,0.002416617],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.001814759,0.00077822,0.1432708,0.005830296,0.0007822533,0.0005565039,0.6465027,0.002508292,0.004994222,0.007503381,0.003042856,0.1824158],"study_design_scores_gemma":[0.0005719013,0.005531704,0.1837026,0.007784685,0.0006390854,0.0007768384,0.7357355,0.0207699,0.009514679,0.01744271,0.01694661,0.0005837748],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9538895,0.0005601818,0.02528762,0.001861329,0.0001034894,0.01081786,0.0003914677,0.00005546155,0.007033166],"genre_scores_gemma":[0.958587,0.0004294408,0.02564636,0.0005194256,0.00002786411,0.014139,0.0002196937,0.00002121759,0.0004100478],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2460631,"threshold_uncertainty_score":0.9297384,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8760309744262508,"score_gpt":0.7019647014159975,"score_spread":0.1740662730102532,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}