{"meta":{"query_hash":"83ada4cbf0c3","filters":{"venue":"Studies In Educational Evaluation"},"cohort_total":18,"direct_labels_cover":0,"predictions_cover":18,"exported":18,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/83ada4cbf0c3","api":"https://metacan.xera.ac/api/v1/cohort?venue=Studies+In+Educational+Evaluation"},"results":[{"id":"W1838440795","doi":"10.1016/j.stueduc.2015.09.002","title":"Evaluating intake variables for a teacher education programme: Improving student success and process efficiency","year":2015,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Teacher Education and Leadership Studies","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of the Fraser Valley","funders":"","keywords":"Practicum; Psychology; Medical education; Focus group; Process (computing); Program evaluation; Mathematics education; Pedagogy; Medicine; Computer science; Political science; Sociology","score_opus":0.43336915743112503,"score_gpt":0.5880200743970577,"score_spread":0.1546509169659327,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1838440795","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.942794,0.010580651,0.00015441283,0.03545724,0.0031773455,0.0035887056,0.0000027023534,0.00006144735,0.0041834875],"genre_scores_gemma":[0.98946553,0.00006280304,0.003597945,0.00019117541,0.0011523048,0.004648767,0.00003714469,0.000016741082,0.0008276068],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9969517,0.0006387579,0.00045329434,0.00048069537,0.0010702893,0.00040528068],"domain_scores_gemma":[0.996253,0.00063501217,0.0002695199,0.00014694057,0.0025559594,0.0001395557],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0106808245,0.000180673,0.00022635575,0.00023139977,0.0005652245,0.00012455578,0.00020920839,0.00008328414,0.00004098546],"category_scores_gemma":[0.015526913,0.0001791604,0.0000346372,0.0005915477,0.00044263343,0.00042461156,0.000047249927,0.00014937196,0.0000050195126],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00003119211,0.0012061234,0.09697319,0.00016171439,0.000051946652,2.4475797e-8,0.7450688,0.00023126202,0.000011032614,0.011610599,0.0012690818,0.14338504],"study_design_scores_gemma":[0.0009270007,0.00011415952,0.0494783,0.0001166043,0.00011691531,9.339442e-7,0.91976506,0.0010686218,0.00000621967,0.026904097,0.0012440381,0.00025805732],"about_ca_topic_score_codex":0.0005979992,"about_ca_topic_score_gemma":0.0014867351,"teacher_disagreement_score":0.17469627,"about_ca_system_score_codex":0.0013441542,"about_ca_system_score_gemma":0.006083424,"threshold_uncertainty_score":0.9995512},"labels":[],"label_agreement":null},{"id":"W1976592601","doi":"10.1016/j.stueduc.2013.10.006","title":"Towards a culture of inquiry for data use in schools: Breaking down professional learning barriers through intentional interruption","year":2013,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Educational Assessment and Improvement","field":"Decision Sciences","cited_by":78,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Status quo; Context (archaeology); Interrupt; Psychology; Cognition; Professional development; Professional learning community; Social psychology; Pedagogy; Computer science; Political science","score_opus":0.6261356046479121,"score_gpt":0.6152237617204723,"score_spread":0.010911842927439741,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1976592601","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9795668,0.00085993134,0.002061425,0.010145365,0.0046266713,0.0021693767,0.000047132384,0.000011005148,0.0005122518],"genre_scores_gemma":[0.9819555,0.00006089274,0.0139161805,0.00026818208,0.00040007418,0.0014475678,0.0008185916,0.000010741253,0.0011222359],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99538356,0.00051431154,0.0012251926,0.00066902715,0.0019630324,0.00024485937],"domain_scores_gemma":[0.99389666,0.0016263122,0.00061833876,0.00042129218,0.0033820542,0.000055356664],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0064102313,0.00018163974,0.00030854408,0.0004248333,0.00019880416,0.00013108904,0.0006383477,0.00008579212,0.0008905276],"category_scores_gemma":[0.032662522,0.00014240446,0.00007444229,0.0008044334,0.00018986907,0.0029948629,0.00037686015,0.00028209362,0.000032791086],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022825347,0.0013936927,0.6410271,0.00016992727,0.00028925927,2.1020706e-7,0.09045049,0.0044277655,0.002267256,0.031188563,0.15484065,0.07371683],"study_design_scores_gemma":[0.0011448526,0.000116367955,0.53278255,0.00041312416,0.000033974673,0.0000021478495,0.1774884,0.022365076,0.000048786394,0.26292047,0.0024541307,0.00023011098],"about_ca_topic_score_codex":0.00030148504,"about_ca_topic_score_gemma":0.00025970265,"teacher_disagreement_score":0.2317319,"about_ca_system_score_codex":0.00063800847,"about_ca_system_score_gemma":0.0015592978,"threshold_uncertainty_score":0.97548574},"labels":[],"label_agreement":null},{"id":"W1982497397","doi":"10.1016/s0191-491x(02)00014-7","title":"Matching the grade 8 TIMSS item pool to the Ontario curriculum","year":2002,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Toronto; Lakehead University","funders":"","keywords":"Mathematics education; Curriculum; Matching (statistics); Secondary education; Psychology; Pedagogy; Mathematics; Statistics","score_opus":0.1656116291663467,"score_gpt":0.46858849052707463,"score_spread":0.30297686136072793,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1982497397","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8436687,0.0011877294,0.0000096810545,0.11455798,0.0029890847,0.0010912141,0.0000010218475,0.000013712783,0.03648089],"genre_scores_gemma":[0.99041015,0.00013058596,0.00016609175,0.0007760128,0.0010187597,0.0004442054,0.0000052932696,0.0000046174528,0.0070443125],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.9980574,0.00035439822,0.00019531502,0.00017319631,0.0010152132,0.00020447937],"domain_scores_gemma":[0.9988517,0.0006296581,0.00007524994,0.00014142739,0.0002733558,0.000028601477],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.002452534,0.000084366424,0.00008634964,0.000053433847,0.001055732,0.00007504377,0.0003132552,0.000025261437,0.0012303342],"category_scores_gemma":[0.00066354516,0.000052288546,0.000039463222,0.00044004456,0.00014160557,0.00015020985,0.00006780592,0.00013418341,0.00025685865],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000002029562,0.00020446152,0.09309825,0.0000032020166,0.00006308185,1.09156225e-7,0.7985937,0.00066096795,0.0000030204667,0.02902945,0.07384103,0.004500731],"study_design_scores_gemma":[0.00024271724,0.000021334703,0.59274167,0.00004426318,0.0000656798,5.644851e-7,0.30244815,0.0004367595,0.000001139861,0.027635746,0.07619528,0.00016667909],"about_ca_topic_score_codex":0.013748722,"about_ca_topic_score_gemma":0.22927839,"teacher_disagreement_score":0.49964345,"about_ca_system_score_codex":0.0009908624,"about_ca_system_score_gemma":0.0002079393,"threshold_uncertainty_score":0.99968266},"labels":[],"label_agreement":null},{"id":"W2054415360","doi":"10.1016/j.stueduc.2009.12.005","title":"Evaluation for learning: A cross-case analysis of evaluator strategies","year":2009,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Evaluation and Performance Assessment","field":"Decision Sciences","cited_by":19,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta; Queen's University","funders":"","keywords":"Process (computing); Citizen journalism; Participatory evaluation; Reflection (computer programming); Program evaluation; Knowledge management; Computer science; Process management; Psychology; Sociology; Political science; Engineering","score_opus":0.5328970254040822,"score_gpt":0.6892803130688502,"score_spread":0.15638328766476794,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2054415360","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98623157,0.0017120772,0.0014552473,0.0024583836,0.0008283548,0.0016688873,0.000020584144,0.000013817066,0.005611094],"genre_scores_gemma":[0.99653715,0.000054177184,0.0018888186,0.00012286224,0.00017058777,0.00071421976,0.00015989166,0.0000068117624,0.00034550353],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9903953,0.0014148242,0.0015687029,0.00062754896,0.0057373648,0.00025624124],"domain_scores_gemma":[0.9808043,0.0034310853,0.00088383415,0.0004614738,0.014362555,0.00005672436],"candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.056533244,0.00019898811,0.0005395718,0.0015798666,0.00032877302,0.0001655678,0.0003002257,0.000085629385,0.0021487398],"category_scores_gemma":[0.031728927,0.00016688208,0.00025476728,0.0034186912,0.00018824189,0.0009230479,0.000034226574,0.0001304046,0.000026486005],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011313563,0.0004764412,0.04781553,0.000016731386,0.0007925123,5.1811134e-7,0.011775674,0.7467484,0.0002182783,0.016260853,0.0011622185,0.17461969],"study_design_scores_gemma":[0.00095994014,0.00019682974,0.32015836,0.000015960462,0.0011750015,0.000004327582,0.014451356,0.5031605,0.00003943631,0.15947911,0.00022643532,0.00013280404],"about_ca_topic_score_codex":0.000017732236,"about_ca_topic_score_gemma":0.0003115428,"teacher_disagreement_score":0.27234283,"about_ca_system_score_codex":0.00073066616,"about_ca_system_score_gemma":0.0029080468,"threshold_uncertainty_score":0.99876344},"labels":[],"label_agreement":null},{"id":"W2072591409","doi":"10.1016/s0191-491x(00)00011-0","title":"The Brazilian National Evaluation System of Basic Education: Context, process, and impact","year":2000,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"School Choice and Performance","field":"Social Sciences","cited_by":23,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Context (archaeology); Process (computing); Process management; Mathematics education; Computer science; Psychology; Business; Geography","score_opus":0.08028795285571905,"score_gpt":0.49237274027401395,"score_spread":0.4120847874182949,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2072591409","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9259308,0.012649881,3.4926126e-7,0.006432097,0.0010574438,0.0009238896,0.0000072026623,0.000010647675,0.052987665],"genre_scores_gemma":[0.9965025,0.00094932073,0.000027951013,0.000094093106,0.0010940857,0.0006169604,0.0000331487,0.000005219897,0.0006767261],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.99724907,0.0004905747,0.0003573762,0.00019717989,0.0015425658,0.00016321441],"domain_scores_gemma":[0.9963559,0.00066607905,0.0001715706,0.00011264726,0.0026493047,0.000044517285],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0065820306,0.00009567924,0.0001257835,0.00009996874,0.0007661044,0.000043115466,0.00014654154,0.000048741458,0.0005977995],"category_scores_gemma":[0.002303023,0.00007492094,0.000034348945,0.00050705957,0.0003989842,0.0004356297,0.000008840138,0.00008665443,0.000027071937],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015253246,0.00037098333,0.14153071,0.00020092032,0.00018571172,3.946475e-8,0.08436802,0.0025741847,0.0000129611,0.050472386,0.032571048,0.6875605],"study_design_scores_gemma":[0.0010190391,0.00007297371,0.7868946,0.00043339562,0.00012629993,0.000005034957,0.13628677,0.005371088,0.000019220177,0.054041713,0.015460571,0.0002692749],"about_ca_topic_score_codex":0.00046681368,"about_ca_topic_score_gemma":0.0031735622,"teacher_disagreement_score":0.6872912,"about_ca_system_score_codex":0.0010767467,"about_ca_system_score_gemma":0.005958462,"threshold_uncertainty_score":0.9996768},"labels":[],"label_agreement":null},{"id":"W2089211529","doi":"10.1016/j.stueduc.2007.04.002","title":"ANTIBULLYING PROGRAMS: A SURVEY OF EVALUATION ACTIVITIES IN PUBLIC SCHOOLS","year":2007,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Bullying, Victimization, and Aggression","field":"Psychology","cited_by":15,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Social Sciences and Humanities Research Council of Canada; Ministère de l’Éducation, Gouvernement de l’Ontario","keywords":"Rigour; Psychological intervention; Program evaluation; Medical education; Poison control; Human factors and ergonomics; Suicide prevention; Medicine; Injury prevention; Psychology; Applied psychology; Nursing; Environmental health; Political science","score_opus":0.21528422940679026,"score_gpt":0.48333294453285675,"score_spread":0.2680487151260665,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2089211529","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.987801,0.0038263206,0.00022139677,0.00056194566,0.0019619397,0.0013639133,0.0000062805184,0.000017736587,0.0042394497],"genre_scores_gemma":[0.99798214,0.00012663312,0.0006389584,0.000044266784,0.00016717722,0.0005142262,0.00038670402,0.000017801094,0.00012209326],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9961162,0.001246727,0.0008041022,0.0004142516,0.0010671898,0.0003514927],"domain_scores_gemma":[0.99658996,0.0008947224,0.00047166634,0.00026283078,0.0017381106,0.000042714684],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.016933504,0.00017100401,0.0002813429,0.00073702756,0.0001338815,0.000024626079,0.0001290212,0.00012447992,0.0005889743],"category_scores_gemma":[0.0048029437,0.0001715758,0.000037487007,0.0013811815,0.00015379977,0.00035371733,0.000044683926,0.00020988406,0.000018297937],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000099204655,0.00081994163,0.91956663,0.000042655956,0.00007735344,4.3853942e-7,0.012037071,0.00043827787,0.00009779746,0.0020873707,0.000675038,0.0640582],"study_design_scores_gemma":[0.0012220318,0.000055411125,0.9756876,0.00027781876,0.00003188814,0.000003450795,0.016605578,0.0014392644,0.000040434417,0.0044167205,0.000059987,0.0001598046],"about_ca_topic_score_codex":0.0008003027,"about_ca_topic_score_gemma":0.0052375086,"teacher_disagreement_score":0.0638984,"about_ca_system_score_codex":0.0006870356,"about_ca_system_score_gemma":0.00079847564,"threshold_uncertainty_score":0.6996658},"labels":[],"label_agreement":null},{"id":"W2522686050","doi":"10.1016/j.stueduc.2016.08.007","title":"Meta-analysis of faculty's teaching effectiveness: Student evaluation of teaching ratings and student learning are not related","year":2016,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Evaluation of Teaching Practices","field":"Social Sciences","cited_by":584,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Mount Royal University","funders":"","keywords":"Psychology; Set (abstract data type); Meta-analysis; Student achievement; Sample (material); Mathematics education; Artifact (error); Correlation; Academic achievement; Computer science; Mathematics","score_opus":0.45477448836377427,"score_gpt":0.6028893736354598,"score_spread":0.14811488527168554,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2522686050","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9863142,0.0025054163,0.00007177076,0.007012738,0.00033679334,0.0012445254,0.000010911695,0.000021871205,0.002481813],"genre_scores_gemma":[0.9981865,0.00012306294,0.00081527524,0.00002729689,0.00006460694,0.00046347082,0.00002934962,0.000013106415,0.0002772835],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9763434,0.017267514,0.001105494,0.0005592721,0.004491648,0.00023269212],"domain_scores_gemma":[0.9865518,0.008753964,0.0018463166,0.00023716851,0.0025590777,0.000051643783],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.09268692,0.00020897137,0.00087692926,0.00073241844,0.0007431494,0.00004090412,0.00025532677,0.000097276854,0.0003099543],"category_scores_gemma":[0.047719847,0.00016016528,0.00028603105,0.0005909876,0.00037776283,0.0007945515,0.000127663,0.00033622983,0.0000040380655],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000057022742,0.0009973614,0.54149884,0.00008726221,0.067961805,1.6270826e-7,0.29708302,0.040203243,0.0017769658,0.032940555,0.00006437979,0.017329372],"study_design_scores_gemma":[0.0010310705,0.00007732966,0.82523584,0.00014785357,0.08254518,3.0091516e-7,0.084161125,0.0017476927,0.00007442099,0.0046952036,0.00007860357,0.00020539676],"about_ca_topic_score_codex":0.0007520456,"about_ca_topic_score_gemma":0.0010206393,"teacher_disagreement_score":0.28373697,"about_ca_system_score_codex":0.0011508133,"about_ca_system_score_gemma":0.00057051366,"threshold_uncertainty_score":0.96030164},"labels":[],"label_agreement":null},{"id":"W2782375796","doi":"10.1016/j.stueduc.2017.12.008","title":"Re-conceptualizing classroom assessment fairness: A systematic meta-ethnography of assessment literature and beyond","year":2018,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":82,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Queen's University","funders":"","keywords":"Conceptualization; Accountability; Construct (python library); Educational assessment; Psychology; Ethnography; Standards-based assessment; Process (computing); Pedagogy; Alternative assessment; Mathematics education; Sociology; Computer science; Political science","score_opus":0.18245862922193032,"score_gpt":0.5132713437504184,"score_spread":0.33081271452848804,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2782375796","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6998417,0.053101085,0.00048979284,0.01513653,0.0064442647,0.0071364674,0.000037096095,0.00008246341,0.21773066],"genre_scores_gemma":[0.9896287,0.0008079219,0.00789719,0.00013721397,0.00041338633,0.00081937294,0.00002981615,0.000009182502,0.0002572415],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9961613,0.0011573137,0.0006193485,0.00034651207,0.0014766084,0.00023893137],"domain_scores_gemma":[0.9966658,0.0011431158,0.00041743528,0.00020199716,0.001520175,0.00005148473],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0060895164,0.00018118176,0.00052548986,0.00031394674,0.00047473962,0.00009028619,0.00019762611,0.000087457054,0.00026591762],"category_scores_gemma":[0.0008890752,0.00015140354,0.00011833532,0.00095576805,0.0008144926,0.00041693737,0.00008448522,0.00013966487,0.000003137873],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000019786823,0.00063338166,0.13409217,0.003170358,0.003342903,5.6969833e-7,0.58134323,0.000024242034,0.000111972426,0.26980236,0.0062909364,0.001168078],"study_design_scores_gemma":[0.001213354,0.0003106268,0.18881425,0.0024664905,0.0028231142,7.7784125e-7,0.6834535,0.0007619327,0.000014968027,0.119139664,0.0005362915,0.00046503393],"about_ca_topic_score_codex":0.000080268655,"about_ca_topic_score_gemma":0.0010540592,"teacher_disagreement_score":0.28978702,"about_ca_system_score_codex":0.00042473103,"about_ca_system_score_gemma":0.00063644524,"threshold_uncertainty_score":0.6174057},"labels":[],"label_agreement":null},{"id":"W3128610517","doi":"10.1016/j.stueduc.2021.100977","title":"The long-term washback effects of the National Matriculation English Test on college English learning in China: Tertiary student perspectives","year":2021,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":31,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Matriculation; Active listening; Competence (human resources); Psychology; Test (biology); College English; Curriculum; Perception; Mathematics education; China; Medical education; Pedagogy; Medicine; Political science","score_opus":0.031240674061682346,"score_gpt":0.419786253443572,"score_spread":0.38854557938188966,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3128610517","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.98097533,0.0020698472,5.6310716e-7,0.0037720778,0.002308043,0.0009357651,0.000002761888,0.000012645534,0.009922994],"genre_scores_gemma":[0.99689007,0.00072531763,0.000024096244,0.000042928925,0.0009575095,0.00030140812,0.000014403374,0.0000074431127,0.0010368525],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9964652,0.0009977238,0.00034138083,0.00026832134,0.00173321,0.00019413515],"domain_scores_gemma":[0.9937923,0.0039099692,0.00021265895,0.00010674474,0.001957797,0.000020551754],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0026556675,0.00011838742,0.00014805216,0.0001058725,0.000732247,0.000053543412,0.00023295468,0.000055615576,0.000050944927],"category_scores_gemma":[0.02011385,0.00008689506,0.00007141533,0.000895014,0.000279045,0.00019478962,0.00010467049,0.00020326994,0.0000030999636],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000007635882,0.0005537834,0.8097692,0.000022435055,0.000054479246,3.6229147e-7,0.17357905,0.00090828346,0.000028183367,0.014033242,0.00069848716,0.0003448444],"study_design_scores_gemma":[0.00054839527,0.000023550312,0.8842094,0.00013739815,0.00002734641,1.3445455e-7,0.112840556,0.00006991737,0.000043873784,0.0019290777,0.00008752631,0.00008283731],"about_ca_topic_score_codex":0.000023572977,"about_ca_topic_score_gemma":0.0012807475,"teacher_disagreement_score":0.07444018,"about_ca_system_score_codex":0.0014457525,"about_ca_system_score_gemma":0.00096099323,"threshold_uncertainty_score":0.98814017},"labels":[],"label_agreement":null},{"id":"W3176398386","doi":"10.1016/j.stueduc.2021.101058","title":"The development and psychometric properties of an educational development impact questionnaire","year":2021,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Evaluation of Teaching Practices","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University; Alberta Advanced Education; University of Alberta","funders":"","keywords":"Exploratory factor analysis; Context (archaeology); Psychology; Scholarship; Psychometrics; Medical education; Applied psychology; Mathematics education; Knowledge management; Computer science; Medicine; Developmental psychology","score_opus":0.3343641478523127,"score_gpt":0.5538289167297261,"score_spread":0.2194647688774134,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3176398386","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9627375,0.015625825,0.000008897529,0.018891474,0.00085583946,0.00035063576,5.61299e-7,0.000008514252,0.0015207252],"genre_scores_gemma":[0.9920597,0.0004049098,0.006197053,0.000045634064,0.00020539612,0.00030938428,0.00002217735,0.000006438929,0.0007492693],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.99670637,0.0011703523,0.0004830884,0.00024691795,0.0012211287,0.00017213123],"domain_scores_gemma":[0.9967476,0.0008516349,0.00028095173,0.0001464904,0.0019147461,0.000058550864],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.008577959,0.000103262224,0.00012611145,0.00019565297,0.0012272885,0.00007416687,0.00015099297,0.000042202857,0.00009389518],"category_scores_gemma":[0.017653126,0.000080049715,0.000021726612,0.0006669822,0.00034393297,0.00050547667,0.000046815203,0.00010649912,0.00001039098],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000058893755,0.0011806684,0.1614004,0.00011474045,0.00034906826,1.2165401e-7,0.40258148,0.0007509282,0.00021788105,0.045721963,0.0009563895,0.38666746],"study_design_scores_gemma":[0.0002772074,0.000019222312,0.9387779,0.00019355836,0.000029048451,0.00000243423,0.043315135,0.00013935003,0.0003872358,0.011514553,0.0051920256,0.00015229697],"about_ca_topic_score_codex":0.00015837216,"about_ca_topic_score_gemma":0.005382599,"teacher_disagreement_score":0.77737755,"about_ca_system_score_codex":0.0010122159,"about_ca_system_score_gemma":0.009209225,"threshold_uncertainty_score":0.9964076},"labels":[],"label_agreement":null},{"id":"W4210694249","doi":"10.1016/j.stueduc.2022.101126","title":"Item wording effects in self-report measures and reading achievement: Does removing careless respondents help?","year":2022,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":17,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Reading (process); Psychology; Mathematics education; Academic achievement; Achievement test; Standardized test; Linguistics","score_opus":0.4604167025598831,"score_gpt":0.5511538330204064,"score_spread":0.09073713046052334,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4210694249","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9897216,0.0035060677,0.00013737069,0.0016660425,0.0032015452,0.0005882257,0.0000023513037,0.000020174803,0.0011566016],"genre_scores_gemma":[0.99266243,0.00008767609,0.0062302784,0.00009783083,0.00015550602,0.0004476151,0.000007983026,0.00000931759,0.00030138576],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99264497,0.0027558922,0.00088868197,0.0006861688,0.002749058,0.0002752471],"domain_scores_gemma":[0.95380396,0.04461826,0.0005475607,0.00037001754,0.00061131356,0.00004891836],"candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.04221355,0.00014581591,0.0003341896,0.0013675116,0.00055019365,0.00008563319,0.00033615396,0.00003323363,0.000054199718],"category_scores_gemma":[0.21099113,0.00011494425,0.0000402389,0.0027739739,0.000061258936,0.00025521198,0.00045894238,0.00024564948,0.000002149585],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000046491215,0.000104547005,0.9148682,0.000028720013,0.00004054688,0.000010907817,0.010046772,0.0017078572,0.00019913109,0.0007059223,0.0004257289,0.07181523],"study_design_scores_gemma":[0.00054268265,0.000048216636,0.8817748,0.00009382405,0.000021918335,0.000027757887,0.034569856,0.0026099482,0.000029231996,0.079626925,0.00050307,0.00015179468],"about_ca_topic_score_codex":0.000087862274,"about_ca_topic_score_gemma":0.000118140866,"teacher_disagreement_score":0.16877757,"about_ca_system_score_codex":0.0010147482,"about_ca_system_score_gemma":0.00027366326,"threshold_uncertainty_score":0.9862427},"labels":[],"label_agreement":null},{"id":"W4385393971","doi":"10.1016/j.stueduc.2023.101290","title":"Evaluating student engagement and experiential learning in global classrooms: A qualitative case study","year":2023,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Education and Critical Thinking Development","field":"Social Sciences","cited_by":18,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; University of Toronto","funders":"","keywords":"Experiential learning; Student engagement; Psychology; Interactivity; Pedagogy; Mathematics education; Experiential education; Educational technology; Qualitative research; Sociology; Computer science; Multimedia; Social science","score_opus":0.4136159316534047,"score_gpt":0.6442659677685991,"score_spread":0.2306500361151944,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4385393971","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99004453,0.00044634196,0.0000068281774,0.005050827,0.0012498164,0.0011494126,9.506362e-7,0.000038632472,0.00201263],"genre_scores_gemma":[0.997037,0.00010369173,0.0006672161,0.00009599055,0.00017917258,0.0014462725,0.000013466288,0.0000057527022,0.00045146214],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.99369484,0.0039098547,0.0004577198,0.00037820116,0.0012744043,0.00028495252],"domain_scores_gemma":[0.99784094,0.0014255631,0.000088899316,0.00008218075,0.000502387,0.00006004961],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.018461628,0.00011407913,0.00016790618,0.00020246417,0.0007588324,0.00006580442,0.00008912475,0.00003780638,0.00019874074],"category_scores_gemma":[0.008501549,0.00012210365,0.00002015776,0.001089416,0.00023420887,0.00016766728,0.00012004784,0.00017652108,0.000026924099],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000067434953,0.0004210449,0.07959288,0.000012034282,0.00003797318,0.000011733238,0.89640373,0.00039765556,0.0000012361675,0.01072616,0.00014101341,0.0122477915],"study_design_scores_gemma":[0.00059909635,0.0000709852,0.103553504,0.000049781436,0.000020231988,0.000002886363,0.8735084,0.0003925677,2.0366407e-7,0.021464966,0.0002240765,0.00011327701],"about_ca_topic_score_codex":0.00090629066,"about_ca_topic_score_gemma":0.0064278366,"teacher_disagreement_score":0.023960626,"about_ca_system_score_codex":0.0015231286,"about_ca_system_score_gemma":0.0009952474,"threshold_uncertainty_score":0.9998503},"labels":[],"label_agreement":null},{"id":"W4387762598","doi":"10.1016/j.stueduc.2023.101309","title":"Predicting reading comprehension performance based on student characteristics and item properties","year":2023,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Reading and Literacy Development","field":"Psychology","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Centre for Advancing Health Outcomes; University of Alberta","funders":"","keywords":"Reading comprehension; Reading (process); Affect (linguistics); Test (biology); Psychology; Multilingualism; Comprehension; Mathematics education; Cognition; Computer science; Cognitive psychology; Linguistics; Pedagogy; Communication","score_opus":0.1548524743564766,"score_gpt":0.43847279524195376,"score_spread":0.2836203208854772,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387762598","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9940193,0.00026252336,0.0000015962454,0.0010891983,0.0019744344,0.00039079017,0.000002570505,0.000039378334,0.0022201915],"genre_scores_gemma":[0.9978892,0.00008728525,0.000109266846,0.00016059102,0.0002051288,0.00048025354,0.00007674286,0.000010754667,0.000980768],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99867845,0.00016194205,0.00030518853,0.00026563669,0.00042069337,0.0001681073],"domain_scores_gemma":[0.9990157,0.00050917745,0.00009852648,0.00012874705,0.00022373881,0.000024137233],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0013387171,0.00010898567,0.00013830545,0.0002458255,0.00019949439,0.000021722242,0.000056832057,0.000032233023,0.000049507707],"category_scores_gemma":[0.0005188575,0.0000939316,0.00001291123,0.00026569818,0.000061005492,0.00006866206,0.00003655904,0.000100540856,0.00008430984],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005881385,0.00015866246,0.92159295,0.000091469956,0.000050176284,8.0279494e-7,0.04995685,0.0009177314,0.00009736781,0.00031837777,0.0013947978,0.025362004],"study_design_scores_gemma":[0.00036650148,0.000063505846,0.9583269,0.00044088982,0.00001523455,0.0000018811203,0.0054719653,0.034802627,0.000014480928,0.000079389196,0.0003198937,0.00009674886],"about_ca_topic_score_codex":0.000007174378,"about_ca_topic_score_gemma":0.0000019640177,"teacher_disagreement_score":0.044484884,"about_ca_system_score_codex":0.0002318369,"about_ca_system_score_gemma":0.000086753644,"threshold_uncertainty_score":0.38304195},"labels":[],"label_agreement":null},{"id":"W4402569962","doi":"10.1016/j.stueduc.2024.101403","title":"Students’ perceptions of online peer feedback in process-oriented L2 writing: A qualitative inquiry","year":2024,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"","keywords":"Peer feedback; Perception; Mathematics education; Peer evaluation; Process (computing); Qualitative research; Psychology; Computer science; Pedagogy; Higher education; Sociology; Political science","score_opus":0.23009569155715098,"score_gpt":0.6111867833582557,"score_spread":0.38109109180110473,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402569962","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9827357,0.0017090138,0.000014077931,0.009389365,0.0015443044,0.00073184294,0.00001752447,0.000022088068,0.0038361081],"genre_scores_gemma":[0.9966377,0.00035502945,0.0005053199,0.00005231696,0.0006089288,0.00036545095,0.000148094,0.00000995379,0.0013171958],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9962819,0.0006463556,0.0005465794,0.00031750815,0.0019847318,0.0002229197],"domain_scores_gemma":[0.99737245,0.0009835773,0.00010810294,0.0000931884,0.001408244,0.000034453198],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005441125,0.0001223373,0.00021273477,0.00039201285,0.00017689612,0.000044037817,0.00020441058,0.00006280413,0.00046279025],"category_scores_gemma":[0.0027702306,0.00012321843,0.000054149332,0.0013749416,0.0004947422,0.00037491476,0.000060106377,0.0001769045,0.000031532938],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0000140699685,0.00066717016,0.18061171,0.00008253728,0.00007344085,3.2806832e-7,0.8027387,0.00010994683,0.00002114655,0.012573492,0.0018423027,0.0012651411],"study_design_scores_gemma":[0.00028190337,0.000023619767,0.39545518,0.00024172371,0.000029260043,1.2139775e-7,0.59188753,0.00014661196,9.921818e-7,0.011639823,0.00021001084,0.000083231644],"about_ca_topic_score_codex":0.00020868045,"about_ca_topic_score_gemma":0.0028360216,"teacher_disagreement_score":0.21484347,"about_ca_system_score_codex":0.00084633887,"about_ca_system_score_gemma":0.0011244292,"threshold_uncertainty_score":0.50672287},"labels":[],"label_agreement":null},{"id":"W4404020856","doi":"10.1016/j.stueduc.2024.101412","title":"Predicting the Mathematics Literacy of Resilient Students from High‐performing Economies: A Machine Learning Approach","year":2024,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Online Learning and Analytics","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"","keywords":"Mathematics education; Literacy; Computer science; Sociology; Pedagogy; Mathematics","score_opus":0.050506115022949764,"score_gpt":0.4089772244966975,"score_spread":0.3584711094737477,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4404020856","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9851983,0.0068170237,0.003266619,0.0032538557,0.00081314147,0.0002433029,0.0000052281607,0.00003730425,0.00036522985],"genre_scores_gemma":[0.9737172,0.00016175116,0.025402848,0.000025832405,0.00025624485,0.00006838532,0.000040715862,0.000007496782,0.00031948398],"study_design_codex":"qualitative","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984541,0.0001662189,0.0004175967,0.00027206528,0.00056884653,0.00012117066],"domain_scores_gemma":[0.99823064,0.0011513806,0.00014961009,0.00022348727,0.00022814618,0.000016749884],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019574692,0.000102968974,0.00015698555,0.00014283143,0.000162194,0.0001235625,0.00040895003,0.000021754282,0.000014771135],"category_scores_gemma":[0.0010543452,0.00007482368,0.00004317222,0.00036973567,0.000060788974,0.0002975823,0.00020759861,0.00023615776,0.000010686644],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000009589779,0.00085322256,0.16710189,0.0006869236,0.0007127994,0.0000012832559,0.3835331,0.33812305,0.000057973233,0.051296312,0.0004327348,0.057191122],"study_design_scores_gemma":[0.00012942334,0.00002647635,0.016789459,0.00030793366,0.000044169294,0.0000021504943,0.0033985393,0.9512556,0.000012688488,0.02783192,0.00012960503,0.0000720098],"about_ca_topic_score_codex":0.000079797,"about_ca_topic_score_gemma":0.000011843443,"teacher_disagreement_score":0.6131326,"about_ca_system_score_codex":0.00020543054,"about_ca_system_score_gemma":0.00022248074,"threshold_uncertainty_score":0.3051221},"labels":[],"label_agreement":null},{"id":"W4413515290","doi":"10.1016/j.stueduc.2025.101512","title":"Stage-based professional development needs of canadian high school teachers: Insights from the dynamic model of educational effectiveness","year":2025,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Teacher Education and Leadership Studies","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Université du Québec à Montréal; Université du Québec en Outaouais","funders":"","keywords":"Professional development; Mathematics education; Faculty development; Psychology; Pedagogy","score_opus":0.16209022123376227,"score_gpt":0.4620496655656992,"score_spread":0.29995944433193694,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4413515290","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9150862,0.003033121,0.00004339372,0.077093646,0.0020298092,0.0008793354,0.000022958298,0.000005505973,0.0018060139],"genre_scores_gemma":[0.99576783,0.000044183158,0.0009389132,0.00033335155,0.000103653714,0.00074436003,0.00015243424,0.0000065595973,0.0019087187],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.9974627,0.0010145695,0.0004499033,0.00020078206,0.00067913585,0.00019293497],"domain_scores_gemma":[0.9957545,0.0026496514,0.00021549255,0.00018260535,0.0011328374,0.00006490628],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020346618,0.00013690493,0.00022369335,0.0006206107,0.0005775909,0.000017322898,0.00028558084,0.000085315645,0.00032672365],"category_scores_gemma":[0.004231882,0.00011449234,0.000046495898,0.0014037109,0.00069182017,0.00013011749,0.00003141579,0.00018023796,0.000007465256],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":true,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000047104662,0.00075419387,0.24168074,0.00012062642,0.00033899178,1.440369e-8,0.64473754,0.009330523,0.00014349191,0.09728352,0.0035246224,0.0020386276],"study_design_scores_gemma":[0.0004047405,0.0000058951587,0.6925524,0.00032997425,0.000045974914,7.837109e-9,0.27718392,0.00056416285,0.00006759577,0.02788525,0.00085612695,0.00010396301],"about_ca_topic_score_codex":0.053447276,"about_ca_topic_score_gemma":0.27307516,"teacher_disagreement_score":0.45087165,"about_ca_system_score_codex":0.0021924856,"about_ca_system_score_gemma":0.029088637,"threshold_uncertainty_score":0.9764155},"labels":[],"label_agreement":null},{"id":"W7104543262","doi":"10.1016/j.stueduc.2025.101530","title":"Stages of teaching expertise from routine to adaptive: A model for advancing teaching effectiveness","year":2025,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Teacher Education and Leadership Studies","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"University of Calgary","funders":"","keywords":"Conceptualization; Perspective (graphical); Focus group; Conceptual framework; Teaching method; Qualitative research; Multimethodology; Resource (disambiguation); Qualitative property; Professional development","score_opus":0.2695009569417753,"score_gpt":0.5581773688283811,"score_spread":0.2886764118866058,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7104543262","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8809176,0.005652737,0.04211203,0.061790682,0.0022586512,0.0027021372,0.000030474892,0.00004686886,0.0044887834],"genre_scores_gemma":[0.9830466,0.000032674543,0.014548455,0.0002913877,0.00021805767,0.001325533,0.000018404302,0.000008198436,0.00051070796],"study_design_codex":"qualitative","study_design_gemma":"qualitative","domain_scores_codex":[0.9976368,0.0010518461,0.0003423993,0.00031643835,0.00042044648,0.0002320927],"domain_scores_gemma":[0.99625325,0.0028011177,0.00012525397,0.00013348165,0.0006471355,0.000039768],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0061352956,0.00012324426,0.0002603826,0.00024206893,0.0005312085,0.000017193592,0.00015912377,0.00004739529,0.000015021011],"category_scores_gemma":[0.01650255,0.00012849385,0.00005134465,0.00024255402,0.00014831874,0.00019725061,0.00004914078,0.00015442654,0.0000016119312],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00011430571,0.00039490598,0.039281417,0.00008593842,0.00016508691,1.896643e-8,0.8385293,0.014820564,0.00033571493,0.06746226,0.0023852813,0.03642524],"study_design_scores_gemma":[0.0010569417,0.000051508563,0.17920564,0.0009186288,0.00012441381,3.179188e-8,0.72915405,0.024284441,0.00011361005,0.06429215,0.0005280753,0.0002704949],"about_ca_topic_score_codex":0.0022494486,"about_ca_topic_score_gemma":0.0034231548,"teacher_disagreement_score":0.13992421,"about_ca_system_score_codex":0.0013454998,"about_ca_system_score_gemma":0.0011022192,"threshold_uncertainty_score":0.9917819},"labels":[],"label_agreement":null},{"id":"W7117577854","doi":"10.1016/j.stueduc.2025.101557","title":"Assessing school readiness domains in a large cohort of refugee children: Validation and links with family factors","year":2025,"lang":"en","type":"article","venue":"Studies In Educational Evaluation","topic":"Early Childhood Education and Development","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Child, Adolescent and Family Mental Health","funders":"Universiti Sains Malaysia; British Academy","keywords":"Rasch model; Refugee; Polytomous Rasch model; Construct validity; Psychometrics; Sample (material); Cohort; Item analysis; Item response theory","score_opus":0.053041866382195935,"score_gpt":0.4417620280352073,"score_spread":0.3887201616530114,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W7117577854","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9892971,0.00088280125,0.00004662101,0.0023931987,0.0004477583,0.0007232614,0.000002688521,0.000009534356,0.0061970665],"genre_scores_gemma":[0.99798965,0.000287341,0.0010461209,0.00013693406,0.000077605575,0.00013511605,0.00007974968,0.0000045465567,0.0002429609],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9983786,0.00032498402,0.00035022147,0.00024755127,0.00053626386,0.00016239952],"domain_scores_gemma":[0.9988177,0.0003441558,0.00014981255,0.000102847924,0.0005487329,0.00003676866],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026787159,0.000097538024,0.00017780894,0.00037343122,0.00026329036,0.000050948627,0.00008137938,0.00008441163,0.000047537906],"category_scores_gemma":[0.0021251945,0.00008958073,0.000014850697,0.00087596156,0.00017621576,0.0003925891,0.000028567438,0.0001527227,0.0000017243665],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000005844272,0.00013152864,0.97097635,0.000014339728,0.000043340053,2.2320053e-8,0.019949526,0.00007612668,0.000009388834,0.0075497543,0.0002443572,0.0009994184],"study_design_scores_gemma":[0.00046675722,0.0000088902225,0.9570421,0.00021394662,0.000027430853,1.2550629e-7,0.03703432,0.000013482501,0.000024410563,0.0049748025,0.00010668595,0.00008705563],"about_ca_topic_score_codex":0.00054396293,"about_ca_topic_score_gemma":0.0017827679,"teacher_disagreement_score":0.017084796,"about_ca_system_score_codex":0.0006701802,"about_ca_system_score_gemma":0.003064737,"threshold_uncertainty_score":0.5436712},"labels":[],"label_agreement":null}]}