{"id":"W4389630093","doi":"10.1109/models58315.2023.00029","title":"Automated Grading of Use Cases","year":2023,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Trent University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Grading (engineering); Computer science; Software; Automation; Sentence; Natural language processing; Software engineering; Artificial intelligence; Matching (statistics); Programming language; Engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005531958,0.001382996,0.001339238,0.007758861,0.0008157456,0.003326952,0.00234563,0.001065343,0.007174151],"category_scores_gemma":[0.06116857,0.0004765556,0.0008571555,0.002711936,0.0004323472,0.002196752,0.002026232,0.001124191,0.004315643],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001247744,"about_ca_system_score_gemma":0.001679882,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003588606,"about_ca_topic_score_gemma":0.004534465,"domain_scores_codex":[0.9831051,0.004019209,0.001850782,0.002551171,0.00781104,0.0006626931],"domain_scores_gemma":[0.9373353,0.01945425,0.005211446,0.008215102,0.02861048,0.001173535],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002912207,0.000442844,0.01407894,0.0004196055,0.0000626123,0.0002192463,0.0005516626,0.00715901,0.02443265,0.002516237,0.01919618,0.9306298],"study_design_scores_gemma":[0.000277609,0.0008399381,0.06884586,0.0004295011,0.0002181358,0.001140628,0.001433307,0.6967182,0.1354482,0.01618973,0.07821038,0.0002484631],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2239952,0.0005754562,0.7000499,0.000528052,0.0003999635,0.002341904,0.00335589,0.04916963,0.01958403],"genre_scores_gemma":[0.5187131,0.0002834683,0.4551232,0.000147894,0.00009400547,0.0006866263,0.009430605,0.001938684,0.0135825],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007758861,"threshold_uncertainty_score":0.02925611,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06679643628250935,"score_gpt":0.3190017833353643,"score_spread":0.252205347052855,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}