{"id":"W4408244728","doi":"10.2196/65108","title":"ChatGPT’s Performance on Portuguese Medical Examination Questions: Comparative Analysis of ChatGPT-3.5 Turbo and ChatGPT-4o Mini","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"McNemar's test; Categorical variable; Test (biology); Computer science; Turbo; Portuguese; Consistency (knowledge bases); Medical education; Medical physics; Statistics; Machine learning; Artificial intelligence; Medicine; Mathematics; Engineering","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.009490445,0.0009699081,0.0008507745,0.001930514,0.000376389,0.001227006,0.001181385,0.0008946063,0.002046069],"category_scores_gemma":[0.06505489,0.0004030942,0.001225218,0.001102102,0.0005438604,0.001329324,0.002278347,0.0006511621,0.001501485],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008143733,"about_ca_system_score_gemma":0.001279479,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004460873,"about_ca_topic_score_gemma":0.005587675,"domain_scores_codex":[0.9919115,0.004163739,0.0009934388,0.001077628,0.00153631,0.0003172824],"domain_scores_gemma":[0.9571361,0.02916481,0.003427885,0.002676852,0.005619424,0.00197489],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.008569363,0.001535986,0.5717525,0.002167974,0.0007644683,0.001052027,0.01294959,0.0086079,0.008927117,0.0009768326,0.01060332,0.3720928],"study_design_scores_gemma":[0.000265651,0.005357736,0.9186121,0.0005073207,0.0004368224,0.002336908,0.003883235,0.04634409,0.00773026,0.0008737147,0.01341252,0.0002396568],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9866174,0.0004406897,0.005472495,0.0001968589,0.00009988271,0.0003739454,0.001040133,0.000561276,0.005197402],"genre_scores_gemma":[0.9861003,0.0004175,0.007712689,0.0001108013,0.00005890137,0.0004367425,0.001989244,0.0001430788,0.003030774],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9905096,"threshold_uncertainty_score":0.05019087,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06824479477615698,"score_gpt":0.4625320639048515,"score_spread":0.3942872691286946,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}