{"id":"W4382795050","doi":"10.1007/s12561-023-09375-9","title":"Statistical Learning of Large-Scale Genetic Data: How to Run a Genome-Wide Association Study of Gene-Expression Data Using the 1000 Genomes Project Data","year":2023,"lang":"en","type":"article","venue":"Statistics in Biosciences","topic":"Genetic Associations and Epidemiology","field":"Biochemistry, Genetics and Molecular Biology","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"SickKids Foundation; Hospital for Sick Children; Public Health Ontario; University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research; University of Toronto","keywords":"Biostatistics; Genetic data; Genome-wide association study; Computational biology; Genome; Scale (ratio); Data mining; Genetic association; Computer science; Data science; Biology; Gene; Genetics; Single-nucleotide polymorphism; Geography; Cartography; Medicine; Population; Public health; Genotype","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003460482,0.0001491311,0.0003083495,0.0001399364,0.0002209105,0.00004252142,0.002142869,0.000102462,0.000006560299],"category_scores_gemma":[0.005742935,0.0001166163,0.00001144927,0.000737067,0.0001358587,0.00001924284,0.002610309,0.0001324473,0.000001906902],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003242838,"about_ca_system_score_gemma":0.000330394,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003056197,"about_ca_topic_score_gemma":0.001517819,"domain_scores_codex":[0.9971228,0.0005948113,0.0005362573,0.000857441,0.0004563384,0.0004324164],"domain_scores_gemma":[0.9970074,0.0006486902,0.0004514489,0.00166857,0.0001709992,0.00005291822],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00001949778,0.0001851984,0.9546006,0.00002623974,0.0000496077,0.000003138591,0.001034877,0.003301532,0.03299594,0.00001291758,0.007207305,0.000563164],"study_design_scores_gemma":[0.0005398709,0.0006128077,0.8971151,0.00001845614,0.00009323376,0.000001393809,0.01276845,0.08243642,0.0006397294,0.00009397991,0.00540262,0.0002780113],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8668948,0.0001977333,0.1220556,0.0001984281,0.0001866028,0.0005384893,0.009902251,0.000008183612,0.00001790155],"genre_scores_gemma":[0.8829917,0.000352836,0.1118722,0.00005242237,0.00008746338,0.0000108228,0.00450223,0.00001529374,0.0001149521],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07913489,"threshold_uncertainty_score":0.6875244,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07540431863356317,"score_gpt":0.37668960225481,"score_spread":0.3012852836212468,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}