{"id":"W4388223267","doi":"10.1111/emip.12582","title":"Comparing Large‐Scale Assessments in Two Proctoring Modalities with Interactive Log Data Analysis","year":2023,"lang":"en","type":"article","venue":"Educational Measurement Issues and Practice","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Medical Council of Canada","funders":"","keywords":"Modalities; Comparability; Modality (human–computer interaction); Test (biology); Scale (ratio); Medicine; Computer science; Human–computer interaction; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006801779,0.0004476993,0.0004103289,0.002322901,0.0004736032,0.001458186,0.0008274757,0.0005962356,0.001948237],"category_scores_gemma":[0.0578754,0.0001772092,0.0006006366,0.002267651,0.0007188527,0.0008613405,0.001401093,0.0007935964,0.0004936264],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0013621,"about_ca_system_score_gemma":0.001587935,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02024706,"about_ca_topic_score_gemma":0.03498317,"domain_scores_codex":[0.9933679,0.003581427,0.0005128057,0.0009035917,0.001344151,0.0002902535],"domain_scores_gemma":[0.9198603,0.0574148,0.009402795,0.004648533,0.006930978,0.00174263],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00257426,0.002281828,0.8246668,0.0005706557,0.0007343006,0.000229991,0.00415935,0.01430251,0.00631761,0.0008249817,0.002362978,0.1409748],"study_design_scores_gemma":[0.00007520902,0.001263998,0.9486916,0.00008317943,0.0001431554,0.0001381984,0.002362645,0.03958053,0.0050226,0.0007554396,0.001811662,0.00007188016],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9886491,0.0001019832,0.00830463,0.0001084675,0.00001754152,0.0003147816,0.001042132,0.0001483019,0.001312908],"genre_scores_gemma":[0.9924785,0.00004076877,0.006231245,0.00003320073,0.0000132665,0.0002129788,0.0006349151,0.00001361715,0.0003416032],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02024706,"threshold_uncertainty_score":0.04025841,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5444063599822654,"score_gpt":0.5751607052320205,"score_spread":0.03075434524975507,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}