{"id":"W4362673096","doi":"10.1111/emip.12553","title":"Validation as Evaluating Desired and Undesired Effects: Insights From Cross‐Classified Mixed Effects Model","year":2023,"lang":"en","type":"article","venue":"Educational Measurement Issues and Practice","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reliability (semiconductor); Variance (accounting); Computer science; Reliability engineering; Variance components; Validity; External validity; Cross-validation; Random effects model; Statistics; Data mining; Econometrics; Psychology; Artificial intelligence; Psychometrics; Mathematics; Engineering; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.4465812,0.002467516,0.004040416,0.005289753,0.002344986,0.007238971,0.005535049,0.004590868,0.004024855],"category_scores_gemma":[0.6171535,0.001745145,0.008743202,0.003791886,0.006440164,0.006994923,0.005814273,0.006149193,0.0004122041],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003804737,"about_ca_system_score_gemma":0.005010772,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006114068,"about_ca_topic_score_gemma":0.004311057,"domain_scores_codex":[0.4743856,0.4918931,0.009345068,0.01003411,0.01331841,0.001023673],"domain_scores_gemma":[0.1053897,0.8527051,0.01225304,0.01803736,0.01099079,0.0006240343],"domain_codex":"methods","domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002086495,0.0009936129,0.1154624,0.002691276,0.01001178,0.001193763,0.01334507,0.1259694,0.001318283,0.5263015,0.003523879,0.1971025],"study_design_scores_gemma":[0.0002996612,0.001238022,0.01525,0.001679019,0.002436363,0.0003821402,0.001424269,0.712891,0.001833495,0.2571212,0.00520655,0.0002382346],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04507495,0.001123756,0.9484598,0.001217002,0.0001626336,0.0008421033,0.0002005038,0.0002107469,0.002708452],"genre_scores_gemma":[0.5017322,0.0004442841,0.4930753,0.0007310767,0.0001287713,0.00257916,0.0003633877,0.000151241,0.0007944524],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.4465812,"threshold_uncertainty_score":0.682464,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7119997234981603,"score_gpt":0.5622263498475483,"score_spread":0.1497733736506121,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}