{"id":"W4386035726","doi":"10.1214/23-aos2289","title":"Optimal discriminant analysis in high-dimensional latent factor models","year":2023,"lang":"en","type":"article","venue":"The Annals of Statistics","topic":"Gene expression and cancer classification","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Minimax; Mathematics; Linear discriminant analysis; Discriminant; Classifier (UML); Pattern recognition (psychology); Principal component analysis; Latent variable; Artificial intelligence; Dimension (graph theory); Sample size determination; Dimensionality reduction; Logarithm; Latent variable model; Statistics; Mathematical optimization; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01202365,0.001087742,0.001671395,0.001726691,0.0008344129,0.001724164,0.00131992,0.001274464,0.001278988],"category_scores_gemma":[0.03056911,0.0006277984,0.001033306,0.001502197,0.002636324,0.002653,0.002591488,0.00271218,0.0006139457],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001359774,"about_ca_system_score_gemma":0.001430913,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001737254,"about_ca_topic_score_gemma":0.001340417,"domain_scores_codex":[0.9949002,0.003203611,0.0001864029,0.000703509,0.0007577586,0.0002485155],"domain_scores_gemma":[0.9860489,0.01084735,0.0007849895,0.001062767,0.001019758,0.0002362522],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002999911,0.0001079452,0.003481478,0.0002397589,0.0001153725,0.0001505973,0.0003439818,0.6029782,0.002209913,0.2388631,0.00250615,0.1487035],"study_design_scores_gemma":[0.00001080303,0.00001994556,0.0002571512,0.00001191947,0.000005217256,0.00001988651,0.00001718108,0.916104,0.0003358054,0.08289185,0.0003147327,0.00001143057],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01438079,0.0002783157,0.984543,0.0002449385,0.00001428424,0.00001978059,0.00002973103,0.0001094886,0.0003796176],"genre_scores_gemma":[0.5286863,0.000829839,0.4664478,0.0001986662,0.000149058,0.0003194458,0.0003603771,0.0001511336,0.00285742],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01202365,"threshold_uncertainty_score":0.06358784,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0983438622062266,"score_gpt":0.3423473871007673,"score_spread":0.2440035248945407,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}