{"id":"W7165631997","doi":"10.2196/86999","title":"A Two-Tiered Rescue Protocol to Mitigate Difficulty-Based Failures of ChatGPT 5 and Gemini on the German M2 Medical Exam: Evaluation Study (Preprint)","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"German; Protocol (science); Baseline (sea); Wilcoxon signed-rank test; Latency (audio); Logistic regression","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007490851,0.001643751,0.001052478,0.000737072,0.0002933175,0.0008541287,0.001950534,0.001550336,0.003477385],"category_scores_gemma":[0.03817341,0.000537731,0.000533934,0.0002339876,0.0006285923,0.001216327,0.002306923,0.00125085,0.001803016],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005172177,"about_ca_system_score_gemma":0.0009772191,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00162643,"about_ca_topic_score_gemma":0.001471349,"domain_scores_codex":[0.9954554,0.002038749,0.0006659658,0.000802947,0.0007718033,0.000265188],"domain_scores_gemma":[0.9714122,0.01824051,0.001860515,0.00349033,0.003562671,0.001433886],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.04796473,0.01700064,0.03700716,0.003335709,0.0008198094,0.0007936559,0.005640067,0.03854638,0.1511543,0.0007478474,0.0159153,0.6810745],"study_design_scores_gemma":[0.01269244,0.1753511,0.1336671,0.0005248295,0.001455702,0.002542578,0.002085123,0.4128462,0.2306419,0.003048698,0.02416876,0.0009754522],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9443913,0.0002734772,0.0366649,0.0001599611,0.0001232209,0.003637103,0.000918502,0.01232423,0.00150732],"genre_scores_gemma":[0.9136825,0.0001200882,0.0751376,0.000416566,0.0000578662,0.005122801,0.001893675,0.0006069583,0.002961946],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007490851,"threshold_uncertainty_score":0.03961593,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2430391393080099,"score_gpt":0.5958295986510961,"score_spread":0.3527904593430862,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}