{"id":"W4243378373","doi":"10.31234/osf.io/v6crg","title":"Validation as Evaluating Desired and Undesired Effects: Insights from Cross-Classified Mixed Effects Model","year":2021,"lang":"en","type":"preprint","venue":"","topic":"Reliability and Agreement in Measurement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Reliability (semiconductor); Variance (accounting); Computer science; Reliability engineering; Variance components; Validity; Data mining; Statistics; Psychometrics; Mathematics; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3741476,0.002537559,0.004435786,0.005286908,0.0023706,0.007557484,0.005083943,0.004231463,0.00396406],"category_scores_gemma":[0.5604944,0.001773772,0.0077302,0.004624204,0.007826993,0.00819957,0.006658175,0.006691441,0.0005060597],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003532187,"about_ca_system_score_gemma":0.005491566,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006483129,"about_ca_topic_score_gemma":0.004597059,"domain_scores_codex":[0.5732358,0.390174,0.008768504,0.01319129,0.01352529,0.001105122],"domain_scores_gemma":[0.1900704,0.7485892,0.01613592,0.02931527,0.01507311,0.0008161287],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009931482,0.0004974008,0.06821283,0.002147456,0.00600106,0.0007949639,0.01552348,0.07615325,0.001322424,0.6607532,0.003130673,0.1644702],"study_design_scores_gemma":[0.000219062,0.0007514845,0.01316672,0.001289409,0.001618163,0.0003705373,0.001290232,0.4254569,0.00178014,0.5475876,0.006254073,0.000215692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01876337,0.0008455511,0.9765692,0.0008428757,0.00009553543,0.000425998,0.0001437226,0.0001697494,0.002143942],"genre_scores_gemma":[0.3544007,0.0005725275,0.6403654,0.0008052515,0.0001579039,0.002246072,0.0004021841,0.0002178396,0.0008321108],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6258523,"threshold_uncertainty_score":0.7717874,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2892285741810964,"score_gpt":0.4363073635794985,"score_spread":0.1470787893984021,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}