{"id":"W4409737348","doi":"10.2196/53335","title":"Guideline-Incorporated Large Language Model-Driven Evaluation of Medical Records Using MedCheckLLM","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Guideline; Computer science; Medical record; Data mining; Medicine; Pathology; Radiology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02820153,0.001064736,0.001108734,0.003028822,0.0008910067,0.003934213,0.002445331,0.001640206,0.004980967],"category_scores_gemma":[0.1389678,0.0006070148,0.001469204,0.001333164,0.0007946928,0.002434755,0.002987575,0.001924438,0.001370244],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002855277,"about_ca_system_score_gemma":0.005878262,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007632799,"about_ca_topic_score_gemma":0.02156223,"domain_scores_codex":[0.9748334,0.01779874,0.002174284,0.00129257,0.003634968,0.0002660283],"domain_scores_gemma":[0.866789,0.1078687,0.006490109,0.005590179,0.01199765,0.001264339],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.005116937,0.002029117,0.0331236,0.01110067,0.001356007,0.00260078,0.004911917,0.1410707,0.02728328,0.02720552,0.08794201,0.6562594],"study_design_scores_gemma":[0.001118249,0.001167856,0.004569548,0.002014344,0.0006393803,0.0007580081,0.0008987039,0.8629431,0.04038691,0.02484509,0.06033359,0.0003252246],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1154521,0.002486783,0.7910767,0.01118222,0.000634669,0.007052396,0.01746539,0.04490618,0.009743589],"genre_scores_gemma":[0.2694941,0.0003380137,0.7175252,0.001286057,0.00008762265,0.001529407,0.007863823,0.0007433332,0.001132467],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02820153,"threshold_uncertainty_score":0.1491458,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4402744422466343,"score_gpt":0.6350579875043667,"score_spread":0.1947835452577324,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}