{"id":"W4416783393","doi":"10.1038/s41598-025-26705-7","title":"Large language models versus classical machine learning performance in COVID-19 mortality prediction using high-dimensional tabular data","year":2025,"lang":"en","type":"article","venue":"Scientific Reports","topic":"COVID-19 diagnosis using AI","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Random forest; Recall; Bridging (networking); F1 score; Predictive modelling; Training set","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004033775,0.0001978927,0.0003586704,0.0004872865,0.0004587629,0.0001377414,0.0001938398,0.0001385117,0.0001296079],"category_scores_gemma":[0.002148845,0.0001911722,0.00006567633,0.001086076,0.0002086763,0.0005349316,0.0005192035,0.0004893095,0.000006165925],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007022167,"about_ca_system_score_gemma":0.001590553,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008542501,"about_ca_topic_score_gemma":0.0005078024,"domain_scores_codex":[0.9965484,0.0001368529,0.0006795184,0.001287052,0.0009058842,0.0004423081],"domain_scores_gemma":[0.9975073,0.0001715016,0.0002280714,0.001738674,0.0001177959,0.0002366673],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008360923,0.001741562,0.5534769,0.001202783,0.0002755165,0.00621043,0.001556609,0.3779172,0.02109866,0.0003101949,0.03333221,0.002041847],"study_design_scores_gemma":[0.001987364,0.00004985026,0.01107028,0.0004021686,0.0001906544,0.00007736189,0.0001109118,0.9519787,0.001017187,0.0002474869,0.03269153,0.0001764824],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.988641,0.0005231387,0.00301191,0.002141851,0.004903587,0.0004565835,0.0000486492,0.0001882419,0.00008507672],"genre_scores_gemma":[0.9957228,0.00001309603,0.00074392,0.0009795099,0.00009310647,0.00001359953,0.001732527,0.0000196478,0.0006818157],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5740616,"threshold_uncertainty_score":0.7795776,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07409088000545555,"score_gpt":0.3717262426470534,"score_spread":0.2976353626415978,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}