{"id":"W4379769651","doi":"10.1038/s41586-023-06160-y","title":"Health system-scale language models are all-purpose prediction engines","year":2023,"lang":"en","type":"article","venue":"Nature","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":447,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Institute for Advanced Research","funders":"National Cancer Institute; W. M. Keck Foundation","keywords":"Generalizability theory; Software deployment; Computer science; Machine learning; Predictive modelling; Artificial intelligence; Clinical decision support system; Language model; Scale (ratio); Health care; Data science; Decision support system; Psychology; Software engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003225219,0.001325337,0.0005574036,0.0008497937,0.0003982826,0.001742245,0.001598797,0.0009473379,0.00414646],"category_scores_gemma":[0.01760689,0.0005699818,0.0008099322,0.000547456,0.0005190255,0.00269255,0.001398681,0.002250242,0.003007382],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001010554,"about_ca_system_score_gemma":0.001741469,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008319083,"about_ca_topic_score_gemma":0.01142422,"domain_scores_codex":[0.9983474,0.0007950843,0.000120709,0.0003816624,0.0002777678,0.00007739499],"domain_scores_gemma":[0.9900385,0.007846314,0.0004824017,0.0007298821,0.0007350576,0.00016793],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007662465,0.0007486545,0.01848235,0.0007995101,0.0004613246,0.0004595322,0.0005860844,0.4214803,0.01124414,0.0118247,0.06111678,0.4720303],"study_design_scores_gemma":[0.00002527552,0.00005851798,0.0007423571,0.00005798656,0.0000316946,0.00004629153,0.00004413994,0.9843156,0.002432528,0.007897702,0.004327425,0.00002054055],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09215674,0.001686883,0.8519868,0.00675935,0.0005013572,0.0006774263,0.006863896,0.0312889,0.008078692],"genre_scores_gemma":[0.6476916,0.001020099,0.3348057,0.00244092,0.0002315541,0.0005665146,0.008000684,0.0007223202,0.004520559],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008319083,"threshold_uncertainty_score":0.01705682,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01301851991908903,"score_gpt":0.2999892234336552,"score_spread":0.2869707035145662,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}