{"id":"W4411884041","doi":"10.1038/s41467-025-60762-w","title":"Extracting circumstances of Covid-19 transmission from free text with large language models","year":2025,"lang":"en","type":"article","venue":"Nature Communications","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Jewish General Hospital","funders":"Institut Pasteur; Agence Nationale de la Recherche","keywords":"Coronavirus disease 2019 (COVID-19); Severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2); 2019-20 coronavirus outbreak; Transmission (telecommunications); Computer science; Pandemic; Virology; Computational biology; Medicine; Biology; Outbreak; Telecommunications; Disease; Infectious disease (medical specialty)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002718319,0.00009523796,0.0001469971,0.00010861,0.0002629693,0.00004690366,0.003326116,0.0001517781,0.000009332595],"category_scores_gemma":[0.000149472,0.00008175954,0.00004362624,0.0004627873,0.00004772405,0.0003625691,0.0004563328,0.0006180151,8.089478e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00005157571,"about_ca_system_score_gemma":0.0002575874,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002621594,"about_ca_topic_score_gemma":0.0009578185,"domain_scores_codex":[0.9990804,0.0001256916,0.0002190783,0.0002386157,0.0001955277,0.0001407532],"domain_scores_gemma":[0.9959489,0.0006444624,0.0001142283,0.003136766,0.00008959344,0.00006612555],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001629721,0.0002552906,0.001112332,0.00006426217,0.00007619582,0.000004195594,0.01374006,0.003587043,0.004087101,0.9313288,0.001702771,0.04402569],"study_design_scores_gemma":[0.001333163,0.00002211953,0.0008944933,0.0003143424,0.00004805149,0.00000396518,0.002084814,0.8673627,0.00191347,0.0761065,0.04960447,0.0003119567],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003151604,0.01816779,0.9586777,0.01108541,0.00006676685,0.0001469791,0.00002971118,0.0001346297,0.008539405],"genre_scores_gemma":[0.7421963,0.0001654853,0.2567952,0.0007154094,0.000008105116,0.00001163346,0.0000149983,0.000004190679,0.00008867719],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8637756,"threshold_uncertainty_score":0.6180806,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0279004093832934,"score_gpt":0.3268215091203649,"score_spread":0.2989210997370715,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}