{"id":"W4410979322","doi":"10.53103/cjess.v5i3.364","title":"ChatGPT: Hero or Villain? Comparative Evaluation by Canadian High School Students and Teachers","year":2025,"lang":"en","type":"article","venue":"Canadian Journal of Educational and Social Studies","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Barrie Urology Group","funders":"","keywords":"HERO; Mathematics education; Pedagogy; Psychology; Sociology; Art; Literature","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004722444,0.00009199864,0.0002427345,0.0002377179,0.0007282112,0.00004805539,0.00005450773,0.00006566655,0.0002299673],"category_scores_gemma":[0.0005897378,0.00007632835,0.00002706669,0.0001694901,0.0002142624,0.00008947452,0.000005685924,0.000168858,0.000003932294],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009844661,"about_ca_system_score_gemma":0.00804804,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.2268024,"about_ca_topic_score_gemma":0.6486744,"domain_scores_codex":[0.9991335,0.00007558171,0.0003023733,0.0001104711,0.0001888586,0.0001892083],"domain_scores_gemma":[0.9983821,0.0001722467,0.0001029119,0.0000360794,0.0008221489,0.0004845312],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00007424338,0.0000654325,0.703014,0.00006904187,0.0006187948,0.000003966619,0.08083677,0.000002039073,0.00001804081,0.003494642,0.1979729,0.01383017],"study_design_scores_gemma":[0.0003267938,0.0002285417,0.7867984,0.0002593569,0.0003085971,0.00002775024,0.1568007,0.000007387225,0.00006332116,0.007148175,0.0478668,0.000164179],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9159056,0.009359343,9.858088e-7,0.07329392,0.0006872329,0.0002273184,0.0000161554,9.636556e-7,0.0005084652],"genre_scores_gemma":[0.9947354,0.0003730906,0.0000302172,0.001923522,0.0004565683,0.00001834309,0.00001803883,0.000003900876,0.002440959],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.421872,"threshold_uncertainty_score":0.9975754,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2550967466908575,"score_gpt":0.5121983646571294,"score_spread":0.257101617966272,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}