{"id":"W2139990047","doi":"10.1111/j.1745-3984.2011.00158.x","title":"Estimating Classification Consistency and Accuracy for Cognitive Diagnostic Assessment","year":2012,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":90,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Consistency (knowledge bases); Reliability (semiconductor); Computation; Subtraction; Statistical inference; Fraction (chemistry); Inference; Sampling (signal processing); Computer science; Statistics; Cognitive test; Artificial intelligence; Cognition; Mathematics; Data mining; Pattern recognition (psychology); Algorithm; Psychology; Arithmetic","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1035545,0.00169812,0.002388696,0.01376382,0.00157261,0.005045421,0.003601267,0.002957342,0.001857414],"category_scores_gemma":[0.5174043,0.0008104962,0.00202365,0.006973857,0.004957703,0.006458142,0.005271896,0.003715405,0.0008630933],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002312784,"about_ca_system_score_gemma":0.002480052,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002135807,"about_ca_topic_score_gemma":0.001497065,"domain_scores_codex":[0.9127699,0.04862287,0.00713484,0.008315929,0.02199535,0.001161218],"domain_scores_gemma":[0.5240027,0.3866173,0.02332029,0.03908265,0.02594883,0.001028326],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008542884,0.0003406424,0.1748996,0.0009191374,0.002282127,0.0003230358,0.002510667,0.08907442,0.003343957,0.1580759,0.005752421,0.5616237],"study_design_scores_gemma":[0.000175953,0.0004266956,0.07021218,0.0005814144,0.0005332922,0.001019019,0.0008064468,0.5072801,0.00823833,0.4042968,0.006069818,0.0003600944],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04193288,0.0007359284,0.9522573,0.0003169184,0.00009658703,0.0003139553,0.0002930441,0.0006537765,0.003399593],"genre_scores_gemma":[0.4975609,0.0003908419,0.4986362,0.0002340657,0.0002247493,0.001152976,0.0009064447,0.0003176629,0.0005761306],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1035545,"threshold_uncertainty_score":0.5476553,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7019996993223337,"score_gpt":0.5564925005972196,"score_spread":0.1455071987251142,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}