{"id":"W4415216473","doi":"10.3389/fpsyg.2025.1592658","title":"Clarifying the reliability paradox: poor measurement reliability attenuates group differences","year":2025,"lang":"en","type":"article","venue":"Frontiers in Psychology","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; Centre for Addiction and Mental Health","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research; Krembil Foundation","keywords":"Reliability (semiconductor); Cognition; Variance (accounting); Set (abstract data type); Group (periodic table); Psychometrics; Rendering (computer graphics); Measure (data warehouse)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1551551,0.001593319,0.001960089,0.002143147,0.001376852,0.004069274,0.00339164,0.003025137,0.00238728],"category_scores_gemma":[0.4972902,0.0008683343,0.001898451,0.002196408,0.01330184,0.008528454,0.006370479,0.00666244,0.000710968],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001795665,"about_ca_system_score_gemma":0.003042459,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002403813,"about_ca_topic_score_gemma":0.001121933,"domain_scores_codex":[0.8977143,0.08222283,0.003418525,0.007327894,0.008377569,0.0009388733],"domain_scores_gemma":[0.4683021,0.456346,0.01876023,0.04238199,0.01318401,0.001025742],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0003948147,0.0001330427,0.03530006,0.0009448378,0.0008100988,0.0007534259,0.009207647,0.01537158,0.004731593,0.7932987,0.007211003,0.1318432],"study_design_scores_gemma":[0.0001239273,0.0003782338,0.01351631,0.0004302719,0.0002848145,0.000662136,0.0006372887,0.04849041,0.003674878,0.9241921,0.00750731,0.0001022986],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04441096,0.001617059,0.9315897,0.01497779,0.0004683493,0.0002736311,0.0001436292,0.0004213924,0.006097525],"genre_scores_gemma":[0.6521032,0.001103144,0.3376186,0.005585127,0.0007567641,0.001083404,0.0001891139,0.0003692165,0.001191302],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8448449,"threshold_uncertainty_score":0.8205485,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2971812503985126,"score_gpt":0.4443418164964959,"score_spread":0.1471605660979833,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}