{"id":"W4415396057","doi":"10.1080/15391523.2025.2568526","title":"Keeping the “glass box” transparent: Comparing expert and AI-generated ratings and feedback in stealth assessment for judgement-focused negotiation simulations","year":2025,"lang":"en","type":"article","venue":"Journal of Research on Technology in Education","topic":"Conflict Management and Negotiation","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Negotiation; Electronic learning; Online assessment; Formative assessment; Higher education; Work (physics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07764111,0.0006427517,0.0009291162,0.001955144,0.001337037,0.003907629,0.001549007,0.001531113,0.002043796],"category_scores_gemma":[0.3179889,0.0004477668,0.0005630289,0.001075898,0.002934931,0.00355664,0.004157389,0.001484392,0.0006962247],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001821948,"about_ca_system_score_gemma":0.001562517,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001317399,"about_ca_topic_score_gemma":0.002262568,"domain_scores_codex":[0.8498929,0.1299573,0.004241457,0.00359688,0.01096912,0.001342455],"domain_scores_gemma":[0.5792757,0.3743551,0.01358773,0.01129505,0.01846897,0.003017399],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01510238,0.003215287,0.1203086,0.002930729,0.0006760277,0.000544321,0.2756328,0.01631285,0.03652621,0.006071995,0.002586319,0.5200925],"study_design_scores_gemma":[0.002666427,0.03950579,0.4225779,0.003776435,0.0007724272,0.001306458,0.2424168,0.1538993,0.07139243,0.03124286,0.02842068,0.002022537],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9640632,0.0002090343,0.02664932,0.0002860554,0.0000877868,0.0008139299,0.00007130308,0.0001615612,0.007657869],"genre_scores_gemma":[0.9775311,0.00008175651,0.02074736,0.0001364591,0.0000184285,0.0006265318,0.00007115604,0.00004702777,0.0007400298],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.07764111,"threshold_uncertainty_score":0.4106104,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1056071517416213,"score_gpt":0.498568736867848,"score_spread":0.3929615851262266,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}