{"id":"W2945134239","doi":"10.65109/ecst4444","title":"Report-Sensitive Spot-Checking in Peer-Grading Systems","year":2019,"lang":"en","type":"article","venue":"","topic":"Machine Learning and Algorithms","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Grading (engineering); Computer science; Scalability; Incentive; Obstacle; Homogeneous; Ground truth; Theoretical computer science; Mathematical proof; Mathematics education; Artificial intelligence; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02372238,0.001971239,0.003653517,0.002195378,0.003571595,0.004874575,0.008772812,0.004758959,0.009623817],"category_scores_gemma":[0.1013133,0.001735945,0.001243682,0.002262491,0.003688501,0.009626571,0.008034986,0.004931614,0.00271786],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002995251,"about_ca_system_score_gemma":0.004748117,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004718759,"about_ca_topic_score_gemma":0.003486241,"domain_scores_codex":[0.9748795,0.009433239,0.001615237,0.005720989,0.005799922,0.002551087],"domain_scores_gemma":[0.8691249,0.07278611,0.01264065,0.03027591,0.01096741,0.004204968],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003847011,0.001372833,0.01932138,0.001098868,0.0003439148,0.001973965,0.003585129,0.4003985,0.0133981,0.2171184,0.02368421,0.3138578],"study_design_scores_gemma":[0.0002366085,0.0003914615,0.001408213,0.00007614705,0.00008443746,0.0005087677,0.0002668091,0.8559428,0.005635191,0.1302729,0.005050158,0.0001266019],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1326129,0.0014127,0.8412912,0.002490267,0.0005878434,0.001159495,0.0007780273,0.008309392,0.01135817],"genre_scores_gemma":[0.938124,0.0002155748,0.05550035,0.0003421254,0.0002348881,0.0002220701,0.0002719454,0.0002649439,0.004824182],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02372238,"threshold_uncertainty_score":0.1254575,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01046836796641533,"score_gpt":0.25292207121072,"score_spread":0.2424537032443046,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}