{"id":"W4391799433","doi":"10.1101/2024.02.12.24302720","title":"PheWAS analysis on large-scale biobank data with PheTK","year":2024,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Gene expression and cancer classification","field":"Biochemistry, Genetics and Molecular Biology","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"National Human Genome Research Institute","keywords":"Biobank; Scale (ratio); Data science; Computer science; Geography; Biology; Bioinformatics; Cartography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006991821,0.0009663003,0.0009947469,0.002645684,0.001243219,0.003947066,0.001592554,0.0006417105,0.03881672],"category_scores_gemma":[0.03154371,0.0009091971,0.00184055,0.003383467,0.0008035976,0.002264237,0.004187482,0.001857305,0.02037158],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009883322,"about_ca_system_score_gemma":0.004128148,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006355857,"about_ca_topic_score_gemma":0.007521326,"domain_scores_codex":[0.9952902,0.001346602,0.0005456686,0.001286106,0.001167442,0.0003639811],"domain_scores_gemma":[0.9832019,0.009349194,0.0009477454,0.003747537,0.002196717,0.0005569499],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004113974,0.000286176,0.04357534,0.003043071,0.00166633,0.001357893,0.001212579,0.02479241,0.01114394,0.01195755,0.7199141,0.1769367],"study_design_scores_gemma":[0.001566272,0.0005386267,0.07115937,0.0009439045,0.0007953743,0.00188142,0.001168586,0.1763653,0.03274586,0.07842942,0.6338167,0.0005891428],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"methods","genre_scores_codex":[0.06784321,0.001359202,0.2880339,0.005111324,0.001092088,0.001217875,0.3446024,0.2649236,0.02581651],"genre_scores_gemma":[0.2245801,0.0009047942,0.2659006,0.002931897,0.0003272452,0.003867248,0.4360857,0.04826595,0.01713638],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.03881672,"threshold_uncertainty_score":0.1298549,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02580702075498584,"score_gpt":0.3040751041403607,"score_spread":0.2782680833853748,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}