{"id":"W4416797097","doi":"10.2196/79534","title":"Comparison of ChatGPT and DeepSeek on a Standardized Audiologist Qualification Examination in Chinese: Observational Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Audiologist; Observational study; MEDLINE; Research design; Observational learning","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003812876,0.0005744417,0.0006810727,0.001463044,0.0006885871,0.0007250175,0.000663975,0.000759899,0.001346315],"category_scores_gemma":[0.01698152,0.0003569538,0.0009740332,0.001022709,0.0008519527,0.001152687,0.001315357,0.0006869651,0.0004406161],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001316405,"about_ca_system_score_gemma":0.001667672,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02008434,"about_ca_topic_score_gemma":0.01888038,"domain_scores_codex":[0.9974947,0.0006157033,0.0003806017,0.0004057806,0.0007455344,0.0003576228],"domain_scores_gemma":[0.9920953,0.002228858,0.002070473,0.0005695944,0.001822797,0.001212894],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00008606224,0.0001580024,0.9949787,0.00002632408,0.00002525344,0.0001820147,0.001778663,0.00007187505,0.0001347573,0.00002015921,0.0001423631,0.002395725],"study_design_scores_gemma":[0.00001176695,0.0004381241,0.9954938,0.0000157153,0.00003273248,0.0001647472,0.002595316,0.0008372438,0.0001546984,0.00002611678,0.0002148227,0.00001486993],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9996682,0.00002216737,0.0000514247,0.00001837572,0.000002800781,0.00002717813,0.00005481528,0.000001753112,0.0001531587],"genre_scores_gemma":[0.9994965,0.00003314327,0.00008286211,0.00002014548,0.00000439931,0.00003667297,0.0001652251,0.000002019244,0.000159073],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02008434,"threshold_uncertainty_score":0.03993487,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5394568970248304,"score_gpt":0.6471570701944958,"score_spread":0.1077001731696654,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}