{"id":"W4415404211","doi":"10.2196/70708","title":"Development and Validation of a Generative Artificial Intelligence-Based Pipeline for Automated Clinical Data Extraction From Electronic Health Records: Technical Implementation Study","year":2025,"lang":"en","type":"article","venue":"JMIR Bioinformatics and Biotechnology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Pipeline (software); Data extraction; Data integration; Timeline; Information extraction; Extraction (chemistry); Health data; Data modeling","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01203402,0.0008366578,0.0004794371,0.0008040894,0.0005229857,0.001995961,0.002831591,0.001074002,0.003012106],"category_scores_gemma":[0.03144458,0.0006723381,0.0009139939,0.0005877012,0.0008801571,0.002081392,0.00279669,0.001409649,0.00167143],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001335224,"about_ca_system_score_gemma":0.003860695,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005007608,"about_ca_topic_score_gemma":0.002106046,"domain_scores_codex":[0.9945834,0.002429019,0.0005136041,0.000955931,0.001238045,0.0002799694],"domain_scores_gemma":[0.9830664,0.008675645,0.0005923054,0.003584777,0.003568267,0.0005126675],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001776211,0.003389216,0.03186725,0.00182495,0.0003729999,0.001917751,0.006210781,0.09221042,0.1251653,0.01240089,0.017169,0.7056953],"study_design_scores_gemma":[0.0004841001,0.00143626,0.0108566,0.0003004245,0.0001724395,0.0007449611,0.0005924964,0.8278642,0.1295057,0.003513798,0.02435901,0.0001698867],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1698069,0.0001382164,0.7869405,0.0006608901,0.00008002436,0.002843641,0.0009686744,0.03646604,0.002095035],"genre_scores_gemma":[0.2520708,0.00008952005,0.7418842,0.0002622198,0.00001237953,0.001083596,0.002620962,0.0008479198,0.001128399],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01203402,"threshold_uncertainty_score":0.06364268,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2218310790735947,"score_gpt":0.5287346243886004,"score_spread":0.3069035453150057,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}