{"id":"W4413042237","doi":"10.1097/sih.0000000000000877","title":"Exploring AI Hallucinations of ChatGPT","year":2025,"lang":"en","type":"article","venue":"Simulation in Healthcare The Journal of the Society for Simulation in Healthcare","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"Alberta Children's Hospital; University of Calgary","funders":"","keywords":"Debriefing; Citation; Relevance (law); Computer science; Generative grammar; Information retrieval; Psychology; Natural language processing; Artificial intelligence; Medical education; Medicine; Library science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01740377,0.0009131269,0.0004481427,0.002693079,0.001563629,0.00444293,0.001617947,0.00196856,0.004768764],"category_scores_gemma":[0.2056818,0.0004261599,0.0008528706,0.001411068,0.004551823,0.005011442,0.004274148,0.002098047,0.001038403],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001601688,"about_ca_system_score_gemma":0.001163788,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001019917,"about_ca_topic_score_gemma":0.001155095,"domain_scores_codex":[0.983741,0.01109196,0.0008660111,0.0008791406,0.003042266,0.0003794889],"domain_scores_gemma":[0.7720335,0.1882472,0.01456524,0.0122692,0.01067813,0.002206685],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004110998,0.0004912543,0.06906305,0.005637737,0.00046616,0.01032791,0.5254809,0.01410175,0.04745804,0.03545678,0.0241874,0.263218],"study_design_scores_gemma":[0.001064813,0.00514894,0.07491805,0.006797946,0.0009767954,0.03002927,0.2515817,0.1743567,0.07413229,0.1512119,0.2283097,0.001471935],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7746347,0.002502593,0.1739112,0.008878058,0.0009383306,0.0009336157,0.0005835096,0.00351207,0.03410593],"genre_scores_gemma":[0.9730391,0.0005145197,0.02111682,0.001462374,0.0002514492,0.0003721159,0.0002011286,0.0002464131,0.002796023],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01740377,"threshold_uncertainty_score":0.09204102,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.291558729212726,"score_gpt":0.4918616125617453,"score_spread":0.2003028833490193,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}