{"meta":{"query_hash":"7a547a233b1e","filters":{"venue":"International Journal of Assessment Tools in Education"},"cohort_total":15,"direct_labels_cover":0,"predictions_cover":15,"exported":15,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/7a547a233b1e","api":"https://metacan.xera.ac/api/v1/cohort?venue=International+Journal+of+Assessment+Tools+in+Education"},"results":[{"id":"W2945378006","doi":"10.21449/ijate.515085","title":"Explanatory Item Response Models for Polytomous Item Responses","year":2019,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":25,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Polytomous Rasch model; Item response theory; Rating scale; Psychology; Econometrics; Psychometrics; Scale (ratio); Statistics; Clinical psychology; Mathematics; Developmental psychology","score_opus":0.41021247149057005,"score_gpt":0.560403145971193,"score_spread":0.15019067448062295,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2945378006","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.016666485,0.00043171583,0.97594464,0.0008736208,0.00015698135,0.0014421942,0.0017225343,0.0006521786,0.0021095714],"genre_scores_gemma":[0.3319737,0.0010761258,0.6369758,0.0009146166,0.00024566866,0.013753904,0.007107706,0.00043185533,0.0075206337],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9266729,0.058621764,0.0027218494,0.006046461,0.0048387833,0.0010982567],"domain_scores_gemma":[0.84570485,0.11757525,0.010747859,0.01578909,0.00967396,0.00050897757],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06149807,0.0030460723,0.002382534,0.004500817,0.0012274414,0.004068957,0.006504051,0.0032846138,0.015656607],"category_scores_gemma":[0.18101895,0.0015935448,0.004386027,0.008170955,0.0023008054,0.005013618,0.0036744098,0.0059113377,0.005294409],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00064137334,0.00073750195,0.052478343,0.0020338667,0.0020826187,0.00073852285,0.0068992577,0.18077205,0.00080567045,0.49637204,0.021628698,0.23481002],"study_design_scores_gemma":[0.00022527145,0.00030393119,0.0115514435,0.0006659207,0.00038933344,0.0005271669,0.00097187184,0.6512028,0.00043243126,0.3148923,0.018645255,0.00019228423],"about_ca_topic_score_codex":0.0041491077,"about_ca_topic_score_gemma":0.0037193806,"teacher_disagreement_score":0.06149807,"about_ca_system_score_codex":0.002728054,"about_ca_system_score_gemma":0.0025789593,"threshold_uncertainty_score":0.32523674},"labels":[],"label_agreement":null},{"id":"W2993603560","doi":"10.21449/ijate.627361","title":"Educational data mining: A tutorial for the rattle package in R","year":2019,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Online Learning and Analytics","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Educational data mining; Context (archaeology); Data mining; Flexibility (engineering); Graphical user interface; Field (mathematics); Big data; Data science; Software; Data stream mining; Random forest; Set (abstract data type); Interface (matter); Machine learning","score_opus":0.044753681496017134,"score_gpt":0.42481545407214394,"score_spread":0.38006177257612683,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2993603560","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00080027117,0.0025470965,0.66218525,0.0016303896,0.0009996203,0.00079945795,0.046232384,0.2706384,0.01416703],"genre_scores_gemma":[0.0072989776,0.0033429952,0.8073483,0.002876644,0.0006321029,0.0060427985,0.03813893,0.114885315,0.019433944],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9977908,0.0008722344,0.00029760698,0.00031980802,0.00060469506,0.00011478915],"domain_scores_gemma":[0.98784757,0.008898185,0.00062525517,0.0012551377,0.0010461711,0.0003275867],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004827277,0.0027057775,0.0018393899,0.003189245,0.0005279492,0.0020387706,0.0039051312,0.0012837327,0.19014488],"category_scores_gemma":[0.022517622,0.0023449445,0.0026522132,0.003031881,0.00059423066,0.0030907027,0.002678544,0.0040333397,0.14999767],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00014186195,0.000097940814,0.0009483308,0.003076867,0.0002209032,0.00034559143,0.00022236565,0.0034379312,0.002458181,0.010494468,0.80500805,0.17354754],"study_design_scores_gemma":[0.00024400014,0.000085991436,0.0016914142,0.0009005841,0.00007792639,0.0007313197,0.00007537385,0.011755906,0.004063926,0.029414611,0.9508125,0.00014646437],"about_ca_topic_score_codex":0.0016787539,"about_ca_topic_score_gemma":0.002733702,"teacher_disagreement_score":0.19014488,"about_ca_system_score_codex":0.00060201605,"about_ca_system_score_gemma":0.002317394,"threshold_uncertainty_score":0.636098},"labels":[],"label_agreement":null},{"id":"W3121031673","doi":"10.21449/ijate.705426","title":"Examining the Measurement Invariance of TIMSS 2015 Mathematics Liking Scale through Different Methods","year":2021,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Rasch model; Measurement invariance; Mathematics; Statistics; Metric (unit); Homogeneity (statistics); Scale (ratio); Level of measurement; Descriptive statistics; Polytomous Rasch model; Scale invariance; Econometrics; Psychology; Structural equation modeling; Mathematics education; Social psychology; Item response theory; Confirmatory factor analysis; Psychometrics; Geography; Engineering","score_opus":0.6714988377706251,"score_gpt":0.597784172952272,"score_spread":0.07371466481835309,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3121031673","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8627525,0.001229221,0.1128923,0.00072137645,0.0004307055,0.0014078607,0.00093615387,0.00020674278,0.019423021],"genre_scores_gemma":[0.940789,0.00037222193,0.054220144,0.00013155468,0.000056978522,0.0022365318,0.0009973142,0.00007446199,0.0011217907],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9728381,0.012279758,0.0026009614,0.0027112425,0.008866199,0.00070366875],"domain_scores_gemma":[0.9642683,0.019561118,0.004467256,0.00418342,0.007098218,0.00042163115],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.024914999,0.00055521424,0.0007936482,0.00238937,0.0011581299,0.0019050201,0.000760961,0.00040021582,0.0037918105],"category_scores_gemma":[0.062883206,0.00032598295,0.0024695848,0.0025441998,0.0013343475,0.001532002,0.0014575162,0.0012576663,0.0004957932],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043355118,0.00040770372,0.6766713,0.0009792821,0.0014434888,0.00016390075,0.010539354,0.0019344487,0.0059457524,0.012415307,0.0027137138,0.28635216],"study_design_scores_gemma":[0.00009685137,0.0011642884,0.95013994,0.0008020418,0.0006359096,0.00023720838,0.009455514,0.010595437,0.0068713943,0.008523124,0.011336553,0.00014174684],"about_ca_topic_score_codex":0.0052034534,"about_ca_topic_score_gemma":0.008446845,"teacher_disagreement_score":0.975085,"about_ca_system_score_codex":0.0012239984,"about_ca_system_score_gemma":0.0027875274,"threshold_uncertainty_score":0.13176465},"labels":[],"label_agreement":null},{"id":"W4309232742","doi":"10.21449/ijate.1124382","title":"Automatic story and item generation for reading comprehension assessments with transformers","year":2022,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Topic Modeling","field":"Computer Science","cited_by":30,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University of Edmonton; University of Alberta","funders":"University of Alberta","keywords":"Fluency; Reading comprehension; Computer science; Comprehension; Literacy; Reading (process); Mathematics education; Multimedia; Psychology; Pedagogy; Linguistics","score_opus":0.04583102892320276,"score_gpt":0.3728767693014102,"score_spread":0.32704574037820744,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4309232742","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10672842,0.00012755574,0.8482456,0.0001174348,0.000102521284,0.00085578306,0.002273449,0.03776142,0.0037877972],"genre_scores_gemma":[0.39646822,0.00009370769,0.5943442,0.000051443454,0.000022507826,0.0010468789,0.0045336364,0.0013642772,0.0020751285],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.997273,0.0013882989,0.000310145,0.00052363455,0.00042451144,0.000080288555],"domain_scores_gemma":[0.98727137,0.008587195,0.0005099711,0.0013653706,0.0020204287,0.0002457183],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002884775,0.0011876706,0.000641768,0.0020629673,0.00032147823,0.0017987638,0.0012864015,0.00079552067,0.0085713845],"category_scores_gemma":[0.025113447,0.0004978523,0.0008321128,0.0012328271,0.0003329142,0.0028965934,0.0016909826,0.0008385849,0.0038193986],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010455959,0.0005025618,0.015986908,0.0006811723,0.0001447017,0.0005826881,0.0030845448,0.02409746,0.040167272,0.005469442,0.011679709,0.89655787],"study_design_scores_gemma":[0.00028984685,0.00065198634,0.012898557,0.00011939548,0.00013098729,0.0007524031,0.001241709,0.87789565,0.07065073,0.011852963,0.023383224,0.00013247461],"about_ca_topic_score_codex":0.0013592726,"about_ca_topic_score_gemma":0.0018380581,"teacher_disagreement_score":0.0085713845,"about_ca_system_score_codex":0.00052075397,"about_ca_system_score_gemma":0.00071688317,"threshold_uncertainty_score":0.028674126},"labels":[],"label_agreement":null},{"id":"W4323355119","doi":"10.21449/ijate.1212539","title":"The bibliometric journey of IJATE from local to global","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Evaluation of Teaching Practices","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Publish or perish; Citation impact; Citation; Library science; Bibliometrics; Web of science; Impact factor; Publication; Visibility; Scopus; Citation analysis; Computer science; Political science; Publishing; Geography; MEDLINE; Law","score_opus":0.1766345083418794,"score_gpt":0.5757474426469738,"score_spread":0.3991129343050943,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4323355119","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8334666,0.0144432,0.0049453597,0.017278004,0.00048496612,0.00021879855,0.009282858,0.0005376303,0.1193426],"genre_scores_gemma":[0.9646001,0.010632043,0.007708157,0.00079581887,0.00052108534,0.000249098,0.004763872,0.00020855456,0.010521208],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9878632,0.0027589437,0.001667069,0.000994038,0.0061172578,0.00059953815],"domain_scores_gemma":[0.9500969,0.014807983,0.010686117,0.0028493798,0.01895005,0.0026095586],"candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.008871812,0.0003631259,0.0010934315,0.0409553,0.0025587743,0.014561755,0.00064798805,0.00076111144,0.004595672],"category_scores_gemma":[0.050646044,0.00023741856,0.0006767903,0.09841547,0.0012599779,0.0093181785,0.004084912,0.0009440653,0.0021702969],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019255788,0.00016488077,0.48642877,0.0025149,0.0004102082,0.00073025975,0.049220905,0.0010611152,0.0015793759,0.02234644,0.028956823,0.40639377],"study_design_scores_gemma":[0.000014793277,0.00022368103,0.6846687,0.0014670487,0.00023330082,0.0012459981,0.07217387,0.0021098068,0.0025908446,0.007007273,0.22810952,0.00015507222],"about_ca_topic_score_codex":0.0054571237,"about_ca_topic_score_gemma":0.0104045775,"teacher_disagreement_score":0.9590447,"about_ca_system_score_codex":0.004196491,"about_ca_system_score_gemma":0.004875043,"threshold_uncertainty_score":0.046919167},"labels":[],"label_agreement":null},{"id":"W4379929879","doi":"10.21449/ijate.1249297","title":"Automatic item generation for online measurement and evaluation: Turkish literature items","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Educational Technology and Assessment","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Turkish; Computer science; Field (mathematics); Test (biology); Item bank; Item analysis; Subject-matter expert; Subject matter; Item response theory; Data science; Artificial intelligence; Statistics; Psychometrics; Curriculum; Expert system; Psychology; Mathematics","score_opus":0.10478086886775079,"score_gpt":0.4375316124065066,"score_spread":0.33275074353875583,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4379929879","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.57674587,0.0014145644,0.36301896,0.0009154749,0.0006681514,0.023728058,0.0051430115,0.0038122025,0.024553709],"genre_scores_gemma":[0.52332646,0.0005589654,0.44331038,0.00016398623,0.00008130272,0.021923218,0.0066320314,0.00036315588,0.0036405278],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.97971904,0.011198444,0.003979807,0.0013400622,0.0032004854,0.0005621973],"domain_scores_gemma":[0.9613953,0.013550426,0.0019604242,0.0041859206,0.018601388,0.00030635993],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.015529928,0.0012461636,0.001001037,0.0061311875,0.0009967891,0.0014001962,0.0013268996,0.00060842256,0.0067131156],"category_scores_gemma":[0.05633269,0.0005881862,0.001299735,0.005073262,0.00067648955,0.0015372465,0.0017567648,0.00077986013,0.0033605448],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013372406,0.0010715728,0.041579183,0.0022757817,0.00017666683,0.00037492038,0.0041793995,0.0033092839,0.014960924,0.004148552,0.014448185,0.9121382],"study_design_scores_gemma":[0.0022232512,0.008177832,0.5890786,0.0032252579,0.0013694742,0.0026666652,0.013588148,0.104049504,0.104905754,0.020055495,0.1497973,0.00086269743],"about_ca_topic_score_codex":0.001957287,"about_ca_topic_score_gemma":0.0019942475,"teacher_disagreement_score":0.015529928,"about_ca_system_score_codex":0.0014026626,"about_ca_system_score_gemma":0.0024535006,"threshold_uncertainty_score":0.08213109},"labels":[],"label_agreement":null},{"id":"W4389915531","doi":"10.21449/ijate.1321061","title":"A data pipeline for e-large-scale assessments: Better automation, quality assurance, and efficiency","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Mental Health Research Topics","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Northern Alberta Institute of Technology","funders":"International Atomic Energy Agency","keywords":"Workflow; Computer science; Pipeline (software); Scale (ratio); Quality assurance; Automation; Interface (matter); Quality (philosophy); Data science; Data quality; Risk analysis (engineering); Data mining; Database; Engineering; Operations management; Metric (unit)","score_opus":0.16544671294430488,"score_gpt":0.5848930899388985,"score_spread":0.41944637699459364,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389915531","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00822758,0.00032684964,0.88602376,0.0032461814,0.000282909,0.003309236,0.0061687822,0.088493995,0.003920744],"genre_scores_gemma":[0.04205591,0.00032538336,0.933937,0.000795547,0.00014882765,0.0020670018,0.01051835,0.0075846603,0.0025673371],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.976834,0.0085329935,0.003414843,0.0031815178,0.007053092,0.0009835496],"domain_scores_gemma":[0.8532255,0.05763989,0.0054714484,0.04790611,0.029601168,0.0061559402],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04225607,0.002302454,0.0015891546,0.005623942,0.0017223204,0.009209383,0.0038382716,0.0016314851,0.015994783],"category_scores_gemma":[0.12154807,0.0022910633,0.0020251097,0.005277465,0.0015071757,0.01128094,0.007990595,0.0048016817,0.014686491],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0019261591,0.00096857746,0.012683624,0.0015898347,0.00019600026,0.00071733753,0.0042495616,0.0063381596,0.023943884,0.021838382,0.13175517,0.79379326],"study_design_scores_gemma":[0.0014883924,0.0012346338,0.027167175,0.0020786133,0.00021128218,0.0013116377,0.002438376,0.15255184,0.07341775,0.10251241,0.63450354,0.001084316],"about_ca_topic_score_codex":0.0067793312,"about_ca_topic_score_gemma":0.0036334328,"teacher_disagreement_score":0.04225607,"about_ca_system_score_codex":0.002145598,"about_ca_system_score_gemma":0.010569257,"threshold_uncertainty_score":0.22347414},"labels":[],"label_agreement":null},{"id":"W4389923528","doi":"10.21449/ijate.1394194","title":"Language models in automated essay scoring: Insights for the Turkish language","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Topic Modeling","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Turkish; Transformative learning; Computer science; Language model; Artificial intelligence; Natural language processing; Intersection (aeronautics); Transformer; Linguistics; Sociology; Engineering","score_opus":0.0407797704534206,"score_gpt":0.39349338321123484,"score_spread":0.3527136127578142,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389923528","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.56087387,0.001829608,0.40815893,0.0053223073,0.00009407947,0.00015556903,0.00048059385,0.0005325463,0.022552513],"genre_scores_gemma":[0.96676666,0.00022775384,0.03166266,0.00007667572,0.000030466528,0.000045386594,0.00013725461,0.00004370776,0.0010094739],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9956204,0.0035116693,0.00013729776,0.00027492552,0.0003478659,0.000107799126],"domain_scores_gemma":[0.9829196,0.013808279,0.0010234237,0.0006548136,0.0013622552,0.00023173571],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0041127484,0.00045092576,0.00034520368,0.0014497007,0.0005865339,0.003842706,0.00064413546,0.0005667455,0.001729318],"category_scores_gemma":[0.024966124,0.00021494308,0.00041694657,0.0012795365,0.0010416211,0.004149931,0.0013650202,0.0011479935,0.0006754607],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005091795,0.00030945975,0.052394904,0.00046196915,0.00014042233,0.0011471998,0.016004875,0.16363727,0.006191288,0.33971298,0.0055290046,0.41396144],"study_design_scores_gemma":[0.000022137809,0.0001222591,0.010400089,0.0001166214,0.000046999434,0.00041938323,0.004952389,0.7994181,0.0016920537,0.16885717,0.013877441,0.00007542494],"about_ca_topic_score_codex":0.007036024,"about_ca_topic_score_gemma":0.009395199,"teacher_disagreement_score":0.007036024,"about_ca_system_score_codex":0.0016897974,"about_ca_system_score_gemma":0.0017548074,"threshold_uncertainty_score":0.02175057},"labels":[],"label_agreement":null},{"id":"W4389925007","doi":"10.21449/ijate.1359348","title":"Automatic item generation for non-verbal reasoning items","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Educational Assessment and Pedagogy","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Verbal reasoning; Computer science; Test (biology); Item analysis; Cognition; Item response theory; Homogeneous; Subject-matter expert; Natural language processing; Artificial intelligence; Subject matter; Psychology; Cognitive psychology; Psychometrics; Pedagogy; Expert system; Mathematics; Developmental psychology","score_opus":0.08817372903914804,"score_gpt":0.4972479358557301,"score_spread":0.4090742068165821,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4389925007","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.19559264,0.00032962035,0.77293223,0.00025823023,0.000338698,0.01394805,0.0028932758,0.008202627,0.0055046366],"genre_scores_gemma":[0.18672924,0.00017496297,0.78942525,0.00015234819,0.0000638622,0.014153721,0.006707145,0.0006653521,0.001928042],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9789555,0.012874784,0.0024383909,0.0017537832,0.0036703649,0.00030720836],"domain_scores_gemma":[0.88523436,0.07012389,0.0052733794,0.01595028,0.022867173,0.00055089],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023361562,0.0017584171,0.0015431246,0.0046380935,0.0005493676,0.0015953409,0.002544604,0.0010260576,0.005750282],"category_scores_gemma":[0.09864897,0.0006700027,0.001638967,0.0034327134,0.0006237978,0.0015400118,0.0018502736,0.0012339002,0.004555668],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011553599,0.0011997458,0.034439377,0.0012515618,0.00020162387,0.00039290794,0.0020447609,0.0057609524,0.017135222,0.0035005445,0.010830022,0.9220879],"study_design_scores_gemma":[0.0030031207,0.009654179,0.21866462,0.0019339474,0.0010872481,0.005309829,0.0062426687,0.43040028,0.19034557,0.044240918,0.08819952,0.0009181393],"about_ca_topic_score_codex":0.00046106428,"about_ca_topic_score_gemma":0.0006673317,"teacher_disagreement_score":0.023361562,"about_ca_system_score_codex":0.00071004586,"about_ca_system_score_gemma":0.0015129765,"threshold_uncertainty_score":0.12354922},"labels":[],"label_agreement":null},{"id":"W4390145121","doi":"10.21449/ijate.1266808","title":"The complexity of the grading system in Turkish higher education","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Educational Technology and Assessment","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Grading (engineering); Higher education; Concordance; Turkish; Mathematics education; Quarter (Canadian coin); Psychology; Medical education; Medicine; Engineering; Political science","score_opus":0.06223638291745076,"score_gpt":0.39129005974478154,"score_spread":0.3290536768273308,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390145121","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8773587,0.0019169056,0.076740235,0.0018158058,0.0006482208,0.0005631861,0.0005478867,0.0003797202,0.04002926],"genre_scores_gemma":[0.9692351,0.0003821171,0.028091364,0.00010208313,0.0000743409,0.00016172961,0.0002916029,0.00003921774,0.0016224511],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.9757549,0.013327406,0.0030403105,0.0017213956,0.0054112785,0.0007446762],"domain_scores_gemma":[0.98355246,0.0060513704,0.0024523444,0.0016566041,0.005859442,0.00042771993],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011490517,0.00032146534,0.00038476934,0.0030746316,0.0014032939,0.0035571558,0.0010971506,0.0005266846,0.0014285266],"category_scores_gemma":[0.028818972,0.00026032538,0.0003972686,0.0042586555,0.0016693264,0.0015144777,0.0011470552,0.00071507704,0.0004953225],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007746112,0.00025168972,0.15302572,0.0007592243,0.000114780625,0.0005906747,0.008961873,0.014991913,0.0075049014,0.046246905,0.01228703,0.7544906],"study_design_scores_gemma":[0.00014512072,0.0017104914,0.7139331,0.0006329854,0.00018783995,0.0027307195,0.0135857565,0.07224349,0.009631623,0.07773437,0.10681412,0.0006503363],"about_ca_topic_score_codex":0.007649116,"about_ca_topic_score_gemma":0.0069671962,"teacher_disagreement_score":0.011490517,"about_ca_system_score_codex":0.0034127792,"about_ca_system_score_gemma":0.00282961,"threshold_uncertainty_score":0.060768425},"labels":[],"label_agreement":null},{"id":"W4390265350","doi":"10.21449/ijate.1406304","title":"A dialectic on validity: Explanation-focused and the many ways of being human","year":2023,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Social Sciences and Humanities Research Council of Canada; Canada Research Chairs; University of Cambridge","keywords":"Test (biology); External validity; Classical test theory; Test validity; Epistemology; Construct validity; Psychology; Variation (astronomy); Dialectic; Predictive validity; Cognitive psychology; Item response theory; Social psychology; Psychometrics","score_opus":0.10254702649635265,"score_gpt":0.44019930065982515,"score_spread":0.3376522741634725,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390265350","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009452422,0.06638568,0.14838627,0.6978333,0.008435838,0.00013546077,0.000077613695,0.0002089242,0.0690846],"genre_scores_gemma":[0.699786,0.041133504,0.11429255,0.112000026,0.016466375,0.0009999733,0.00014966955,0.00071622606,0.014455594],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.8537795,0.12222459,0.0036294449,0.0036219223,0.014531076,0.002213455],"domain_scores_gemma":[0.70500124,0.2702194,0.004790052,0.009859952,0.008003931,0.002125601],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.09125129,0.0011395639,0.0021007813,0.005506187,0.0065072593,0.024510155,0.0054279217,0.008669615,0.0026446506],"category_scores_gemma":[0.11629403,0.0008769141,0.0014928195,0.0035315007,0.14339815,0.036485214,0.012776552,0.021747172,0.0006657321],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000014466418,0.000015012314,0.00027021868,0.00022163677,0.000021133676,0.00005789311,0.030657258,0.00013758524,0.000047675738,0.94929814,0.0073634954,0.011895384],"study_design_scores_gemma":[0.000014125706,0.00002812524,0.00028230864,0.0008999738,0.000010537836,0.00014490735,0.011327698,0.0004436999,0.00010325145,0.9176889,0.069027,0.000029431236],"about_ca_topic_score_codex":0.0039545316,"about_ca_topic_score_gemma":0.00261889,"teacher_disagreement_score":0.09125129,"about_ca_system_score_codex":0.009232245,"about_ca_system_score_gemma":0.012228235,"threshold_uncertainty_score":0.4825887},"labels":[],"label_agreement":null},{"id":"W4396978444","doi":"10.21449/ijate.1376160","title":"The difference between estimated and perceived item difficulty: An empirical study","year":2024,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Psychology; Statistics; Empirical research; Econometrics; Mathematics education; Mathematics","score_opus":0.08975046533286718,"score_gpt":0.5107784354602035,"score_spread":0.42102797012733634,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4396978444","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99748516,0.000096576165,0.0014523165,0.00003407165,0.0000053339177,0.000034093748,0.00008361876,0.00000574964,0.0008029802],"genre_scores_gemma":[0.99877506,0.0000426758,0.0009050508,0.000011172618,0.0000041388553,0.00003577165,0.000080862505,0.000004804426,0.00014033524],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9867541,0.006271604,0.0016146905,0.0015110356,0.0034509532,0.00039755265],"domain_scores_gemma":[0.7186046,0.24009314,0.016625967,0.006829373,0.016071811,0.0017750589],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.014328685,0.00038766363,0.00045722327,0.0016981143,0.0003756679,0.0014314334,0.00080240815,0.0007078693,0.0026757163],"category_scores_gemma":[0.1241156,0.00035004492,0.00056109705,0.0015775738,0.0012652201,0.0020874557,0.0009099299,0.0012306555,0.00045851414],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015105198,0.00041378004,0.98351246,0.00009524104,0.000118951204,0.00013303531,0.0034224037,0.00035753677,0.00050714536,0.00019085204,0.00014271149,0.010954976],"study_design_scores_gemma":[0.000017595888,0.00058804854,0.9911004,0.000054737353,0.000060167287,0.00033542496,0.0031927056,0.0032590204,0.0007626127,0.00018342507,0.000418335,0.000027542652],"about_ca_topic_score_codex":0.0013614789,"about_ca_topic_score_gemma":0.0016487326,"teacher_disagreement_score":0.014328685,"about_ca_system_score_codex":0.0006575521,"about_ca_system_score_gemma":0.0005531189,"threshold_uncertainty_score":0.075778246},"labels":[],"label_agreement":null},{"id":"W4401920683","doi":"10.21449/ijate.1475980","title":"The mental imagery scale for art students: Building and validating a short form","year":2024,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Creativity in Education and Neuroscience","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Northern Alberta Institute of Technology","funders":"","keywords":"Creativity; Scale (ratio); Psychology; Reliability (semiconductor); Construct (python library); Cognition; Mental image; Content validity; Construct validity; Visual arts education; Criterion validity; Computer science; Cognitive psychology; Applied psychology; Mathematics education; Psychometrics; Social psychology; Clinical psychology","score_opus":0.04279848651872874,"score_gpt":0.5057800219547152,"score_spread":0.4629815354359864,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401920683","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9768652,0.00045284812,0.011154341,0.00037188455,0.00012328962,0.0038541076,0.0013078088,0.00011269766,0.005757862],"genre_scores_gemma":[0.8964045,0.0008817783,0.08454951,0.000296932,0.00007427867,0.0111833345,0.0032983636,0.000044977554,0.0032662381],"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99843043,0.00036839015,0.000361361,0.000110360066,0.0006513327,0.000078178826],"domain_scores_gemma":[0.99323845,0.0027582075,0.0015113959,0.00046789483,0.0015831833,0.00044078988],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028288458,0.0004233523,0.0005116469,0.0016465967,0.00039657424,0.0007879715,0.00064680097,0.0005240918,0.0024030188],"category_scores_gemma":[0.014259677,0.0002585997,0.00081267825,0.00095833925,0.00041645142,0.00080951286,0.0011319909,0.0011857139,0.0006855871],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007651933,0.0022021914,0.5382589,0.00087079307,0.00028366424,0.00046044678,0.005701908,0.0028116365,0.010867353,0.0029927047,0.009628919,0.42515627],"study_design_scores_gemma":[0.00023874438,0.0018068936,0.96678257,0.00022366825,0.00008154535,0.0011136383,0.0023120572,0.0070126522,0.0027708185,0.0025370037,0.015047076,0.00007340275],"about_ca_topic_score_codex":0.0006106712,"about_ca_topic_score_gemma":0.001572448,"teacher_disagreement_score":0.0028288458,"about_ca_system_score_codex":0.00040130672,"about_ca_system_score_gemma":0.0009670988,"threshold_uncertainty_score":0.014960587},"labels":[],"label_agreement":null},{"id":"W4410004709","doi":"10.21449/ijate.1602294","title":"A review of automatic item generation techniques leveraging large language models","year":2025,"lang":"en","type":"review","venue":"International Journal of Assessment Tools in Education","topic":"Topic Modeling","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Natural language processing; Data science","score_opus":0.07488583176221998,"score_gpt":0.4522201303716182,"score_spread":0.3773342986093982,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410004709","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013545714,0.9732526,0.02172538,0.00077938533,0.00021987618,0.00027109016,0.0003009002,0.00032981997,0.0017663927],"genre_scores_gemma":[0.02001863,0.90771514,0.068402626,0.0007257974,0.0004520812,0.0008182878,0.0009832553,0.0001278529,0.00075633824],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9903853,0.005451645,0.0013158119,0.0008204722,0.001901669,0.0001251643],"domain_scores_gemma":[0.9077246,0.083499305,0.002517563,0.0015544137,0.0044662147,0.0002378525],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017555421,0.0022525801,0.0030628778,0.010652651,0.00052805996,0.002730724,0.0026124674,0.0012970417,0.004696497],"category_scores_gemma":[0.06382826,0.001179525,0.0033540525,0.008911084,0.00083107356,0.004513082,0.001342273,0.001481896,0.0026667858],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007061646,0.000084986175,0.0009808944,0.049854238,0.0005192439,0.000057518944,0.00030022569,0.001150876,0.00033162968,0.0015638396,0.0057237176,0.9393622],"study_design_scores_gemma":[0.00031850257,0.0013983275,0.026676567,0.18947968,0.00941641,0.0027341084,0.0017268696,0.019248417,0.005946143,0.026285151,0.71619064,0.00057909195],"about_ca_topic_score_codex":0.003400883,"about_ca_topic_score_gemma":0.0049482863,"teacher_disagreement_score":0.017555421,"about_ca_system_score_codex":0.001147437,"about_ca_system_score_gemma":0.004008513,"threshold_uncertainty_score":0.092842996},"labels":[],"label_agreement":null},{"id":"W4414775956","doi":"10.21449/ijate.1566093","title":"Construction and validation of a multilingual diagnostic instrument for neuromyths and their origins","year":2025,"lang":"en","type":"article","venue":"International Journal of Assessment Tools in Education","topic":"Neuroscience, Education and Cognitive Function","field":"Neuroscience","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"Türkiye Bilimsel ve Teknolojik Araştırma Kurumu","keywords":"Relevance (law); Identification (biology); Robustness (evolution); Process (computing); Adaptation (eye); Key (lock); Qualitative research","score_opus":0.035631585674076316,"score_gpt":0.3779109001011886,"score_spread":0.3422793144271123,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414775956","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8628656,0.0011814275,0.10769795,0.0016116275,0.00033703595,0.008433428,0.001665863,0.0004872796,0.015719749],"genre_scores_gemma":[0.73472834,0.0010279779,0.24460316,0.00042081124,0.0000644308,0.014757698,0.0015762448,0.00007768555,0.0027436516],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.98793447,0.005323735,0.0023853718,0.0008440267,0.0030196572,0.00049277063],"domain_scores_gemma":[0.9580791,0.018716952,0.0038616895,0.002258309,0.015697582,0.0013863469],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.024164552,0.0005353323,0.0006838565,0.0054708207,0.0014073772,0.0017368575,0.0012280804,0.00068116916,0.0023884238],"category_scores_gemma":[0.061024107,0.00033774992,0.0009028617,0.0019288174,0.0012476238,0.0021262597,0.004052168,0.0013577563,0.00066677],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003569426,0.0010183633,0.33981562,0.002058208,0.00012710308,0.0008529778,0.0572585,0.0011046567,0.0079215765,0.00863375,0.003968401,0.57688385],"study_design_scores_gemma":[0.00029417357,0.0022681546,0.7964248,0.004424757,0.00032477098,0.0026952864,0.08894416,0.010249358,0.015177305,0.012326694,0.06646048,0.0004100282],"about_ca_topic_score_codex":0.003137859,"about_ca_topic_score_gemma":0.007096056,"teacher_disagreement_score":0.024164552,"about_ca_system_score_codex":0.002341423,"about_ca_system_score_gemma":0.010016763,"threshold_uncertainty_score":0.12779593},"labels":[],"label_agreement":null}]}