{"id":"W2021683927","doi":"10.1088/1741-2560/6/5/058001","title":"On the risk of extracting relevant information from random data","year":2009,"lang":"en","type":"letter","venue":"Journal of Neural Engineering","topic":"Spectroscopy and Chemometric Analyses","field":"Chemistry","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hospital for Sick Children","funders":"","keywords":"Computer science; Random forest; Set (abstract data type); Feature selection; Data mining; Data set; Artificial intelligence; Selection (genetic algorithm); Process (computing); Feature (linguistics); Pattern recognition (psychology); Machine learning; Information retrieval","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["research_integrity"],"consensus_categories":[],"category_scores_codex":[0.0002646536,0.0002094235,0.0004720223,0.0002079684,0.00004038286,0.00006106591,0.0007783131,0.0002447126,0.0002705503],"category_scores_gemma":[0.002484351,0.0001335041,0.0002119667,0.0001793562,0.00001149558,0.0004191172,0.00005282759,0.002809003,0.000003130057],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0000588465,"about_ca_system_score_gemma":0.00003186454,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002501362,"about_ca_topic_score_gemma":1.682242e-7,"domain_scores_codex":[0.9984792,0.00001844733,0.0007488652,0.00009843114,0.0004830676,0.0001719466],"domain_scores_gemma":[0.9963305,0.001681475,0.001377389,0.0004904263,0.00008215377,0.00003803066],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003728774,0.00004519951,0.0001520642,0.0004981712,0.002298022,0.0003727377,0.0002986071,0.05614037,0.04063163,0.000009859824,0.8918393,0.0073412],"study_design_scores_gemma":[0.005757673,0.000350118,0.0005155316,0.002465309,0.006668243,0.0006628062,0.0004897817,0.2585401,0.1702715,0.0005474752,0.5520795,0.001651922],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6875284,0.008083668,0.01914356,0.2769395,0.002452051,0.0003198969,0.001539401,0.0001947386,0.003798859],"genre_scores_gemma":[0.9226991,0.002379193,0.002995282,0.05768706,0.01327069,0.000003147319,0.0005718184,0.0001266306,0.0002670776],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3397598,"threshold_uncertainty_score":0.9994916,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02108471223621137,"score_gpt":0.2429215245301855,"score_spread":0.2218368122939742,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}