{"id":"W4409225830","doi":"10.2196/64544","title":"Using Large Language Models to Automate Data Extraction From Surgical Pathology Reports: Retrospective Cohort Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Center for Advancing Translational Sciences","keywords":"Concordance; Context (archaeology); Computer science; Medicine; Data extraction; Health care; Artificial intelligence; MEDLINE; Internal medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01081365,0.0007091015,0.0005894582,0.002500589,0.0008888791,0.001438069,0.001121312,0.0007948562,0.002610321],"category_scores_gemma":[0.03268524,0.0008480739,0.001695723,0.001569293,0.0006011921,0.001490166,0.001501764,0.001298464,0.001453475],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007800296,"about_ca_system_score_gemma":0.00139223,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005739102,"about_ca_topic_score_gemma":0.008638856,"domain_scores_codex":[0.9946407,0.001901437,0.0008778945,0.001552972,0.0007391713,0.0002878293],"domain_scores_gemma":[0.9755191,0.008944091,0.005268581,0.004938461,0.004380773,0.0009489865],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006981851,0.0003193197,0.9825714,0.0001933708,0.0004479809,0.0005282271,0.001096241,0.0002642552,0.0009878356,0.00008262685,0.001803467,0.01100703],"study_design_scores_gemma":[0.0002351966,0.001652034,0.973323,0.0002590478,0.001158531,0.003251349,0.003713846,0.007528928,0.001922452,0.0005473461,0.006261387,0.0001467587],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9894537,0.0006344074,0.006088154,0.0001317907,0.00003087204,0.0003641367,0.002834893,0.00009450367,0.0003674843],"genre_scores_gemma":[0.9889249,0.0003267402,0.005227447,0.0001484979,0.00005025784,0.0005377386,0.004298492,0.00008646277,0.0003995044],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01081365,"threshold_uncertainty_score":0.05718875,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3546248710218109,"score_gpt":0.5985991056669716,"score_spread":0.2439742346451607,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}