{"id":"W4417309864","doi":"10.2196/81673","title":"AI- vs Human-Based Assessment of Medical Interview Transcripts in a Generative AI–Simulated Patient System: Cross-Sectional Validation Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Generalizability theory; Consistency (knowledge bases); Matching (statistics); Generative grammar; Psychometrics; Generative model","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0336585,0.0006118136,0.0004439121,0.0009252451,0.0008068883,0.0009738462,0.0007543791,0.0009497223,0.001047212],"category_scores_gemma":[0.06358563,0.0004882845,0.0009470801,0.0004517647,0.002161321,0.001231928,0.001437152,0.0009924831,0.0005496971],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001258728,"about_ca_system_score_gemma":0.001318265,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001354218,"about_ca_topic_score_gemma":0.002171594,"domain_scores_codex":[0.9783876,0.01440533,0.001512865,0.002088219,0.002999125,0.0006069774],"domain_scores_gemma":[0.9130087,0.04711999,0.01182936,0.008040474,0.01794007,0.002061408],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004242199,0.01493656,0.9134279,0.0004321026,0.0006059077,0.0003223153,0.02840584,0.001754909,0.007327251,0.0004145487,0.0007737333,0.02735679],"study_design_scores_gemma":[0.0005389311,0.04255204,0.9238641,0.000172692,0.000325874,0.000642847,0.01046612,0.007991526,0.008972601,0.0003292595,0.004017955,0.0001260252],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.997156,0.00003531337,0.001745537,0.00001494354,0.00001284705,0.0006130964,0.00006179488,0.00001420251,0.000346324],"genre_scores_gemma":[0.9952708,0.00004167643,0.002872695,0.00009405453,0.00001488437,0.001179692,0.0002546391,0.00001538495,0.0002561441],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0336585,"threshold_uncertainty_score":0.1780053,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1288360537981913,"score_gpt":0.550083557258638,"score_spread":0.4212475034604467,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}