{"id":"W15861381","doi":"10.21432/t2k670","title":"Field Test Evaluation of Educational Software: A Description of One Approach","year":2017,"lang":"en","type":"article","venue":"Canadian Journal of Learning and Technology","topic":"Educational Technology and Assessment","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Field (mathematics); Computer science; Test (biology); Quality (philosophy); Software; Product (mathematics); Alphabet; Management science; Data science; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03813045,0.004090641,0.003002268,0.01443494,0.002610068,0.008136665,0.004740581,0.005157717,0.005372367],"category_scores_gemma":[0.04359322,0.001812055,0.002275836,0.007270858,0.007023934,0.008461155,0.006003732,0.00455638,0.002767112],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005132082,"about_ca_system_score_gemma":0.006453191,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00370287,"about_ca_topic_score_gemma":0.004673375,"domain_scores_codex":[0.9272269,0.04795939,0.004634368,0.003147333,0.01628281,0.0007492437],"domain_scores_gemma":[0.9394822,0.03668817,0.003317623,0.006664352,0.01258998,0.001257652],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0006288156,0.002608985,0.009729924,0.007219323,0.0002739105,0.0007820156,0.00648131,0.004106321,0.01858808,0.05469871,0.006706768,0.8881759],"study_design_scores_gemma":[0.00121355,0.02257964,0.04103373,0.02147241,0.000823663,0.01564646,0.01564789,0.03482176,0.08222603,0.2313873,0.5307817,0.002365906],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0151661,0.02775501,0.8981797,0.003392128,0.0005525956,0.01026987,0.0004666367,0.001535346,0.04268267],"genre_scores_gemma":[0.08152631,0.01500795,0.8785362,0.00147179,0.0002953756,0.009197672,0.0003308548,0.0004171854,0.01321671],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03813045,"threshold_uncertainty_score":0.2016555,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04008810262872196,"score_gpt":0.301355754198165,"score_spread":0.261267651569443,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}