{"id":"W161357454","doi":"10.15388/infedu.2006.01","title":"Random Factors in IOI 2005 Test Case Scoring","year":2006,"lang":"en","type":"article","venue":"Informatics in Education","topic":"Software Engineering Research","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Ranking (information retrieval); Test (biology); Statistics; Olympiad; Rank (graph theory); Confidence interval; Variance (accounting); Population; Computer science; Econometrics; Mathematics; Artificial intelligence; Demography; Mathematics education","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1436528,0.001359954,0.001439776,0.01125671,0.001221881,0.005864263,0.002658207,0.002326902,0.002258782],"category_scores_gemma":[0.6014255,0.0008149795,0.001479493,0.007968144,0.005042578,0.004725269,0.004086329,0.00260477,0.0006373689],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004679312,"about_ca_system_score_gemma":0.002267962,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006255355,"about_ca_topic_score_gemma":0.005241785,"domain_scores_codex":[0.8007006,0.1221003,0.009252614,0.01320418,0.05152913,0.003213233],"domain_scores_gemma":[0.3160465,0.5895903,0.0342194,0.03303772,0.02492834,0.00217786],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001111301,0.0003983869,0.4089805,0.0003777359,0.0008144285,0.0003788022,0.002023936,0.1865828,0.001548355,0.064822,0.004374037,0.3285877],"study_design_scores_gemma":[0.0002233368,0.001828937,0.1840634,0.000358853,0.0003877115,0.0009455942,0.0008810285,0.6942203,0.005979871,0.1048895,0.005849032,0.0003725784],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.552215,0.001632118,0.4216972,0.001385713,0.0001623031,0.0009542086,0.0007146297,0.001103913,0.02013483],"genre_scores_gemma":[0.9260932,0.0001324402,0.07182736,0.0001448677,0.00005950646,0.0003578496,0.0005073206,0.0001345925,0.0007428813],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1436528,"threshold_uncertainty_score":0.7597175,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01197712325499854,"score_gpt":0.2779785689758177,"score_spread":0.2660014457208191,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}