{"meta":{"query_hash":"a7f5fc1f824e","filters":{"venue":"ETS Research Report Series"},"cohort_total":10,"direct_labels_cover":0,"predictions_cover":10,"exported":10,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/a7f5fc1f824e","api":"https://metacan.xera.ac/api/v1/cohort?venue=ETS+Research+Report+Series"},"results":[{"id":"W1504933570","doi":"10.1002/ets2.12050","title":"Test Takers' Writing Activities During the<i><scp>TOEFL iBT</scp><sup>®</sup></i>Writing Tasks: A Stimulated Recall Study","year":2015,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"","keywords":"Test of English as a Foreign Language; Test (biology); Task (project management); Psychology; Second language writing; Mathematics education; Recall; English language; Cognitive psychology; Linguistics; Second language","score_opus":0.10971650210202191,"score_gpt":0.41728945131809386,"score_spread":0.3075729492160719,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1504933570","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.99949825,0.00003697646,0.00018328684,0.0000065280833,0.0000017826526,0.000020089645,0.00003253919,0.0000060276866,0.0002146141],"genre_scores_gemma":[0.9978655,0.00007787942,0.0005907115,0.000023752109,0.0000072096896,0.000078344405,0.00013038555,0.000007063664,0.0012191253],"study_design_codex":"observational","study_design_gemma":"qualitative","domain_scores_codex":[0.99832994,0.00049456244,0.0002570113,0.00028036232,0.0005015258,0.0001366107],"domain_scores_gemma":[0.9852903,0.0066988836,0.003289576,0.001277372,0.0022984464,0.001145316],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023988786,0.0006741873,0.0005210993,0.00084291224,0.00029854022,0.0009925038,0.0005830962,0.0006152428,0.0018614766],"category_scores_gemma":[0.018157182,0.0002871819,0.0004994615,0.00029202862,0.00045663596,0.0005133538,0.0007942815,0.00055385055,0.0006589097],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0037703495,0.004087184,0.70425445,0.000700368,0.000360038,0.0035826347,0.061625417,0.00052192516,0.102687314,0.00009032789,0.00065829034,0.11766166],"study_design_scores_gemma":[0.00007584482,0.010493025,0.9568303,0.00006515836,0.00011681545,0.0015060941,0.0117321145,0.00047172478,0.01699949,0.000087468856,0.0015464104,0.0000755505],"about_ca_topic_score_codex":0.00077866827,"about_ca_topic_score_gemma":0.0014574323,"teacher_disagreement_score":0.0023988786,"about_ca_system_score_codex":0.00019598784,"about_ca_system_score_gemma":0.00016506671,"threshold_uncertainty_score":0.01268661},"labels":[],"label_agreement":null},{"id":"W1964735878","doi":"10.1002/j.2333-8504.2005.tb01990.x","title":"ANALYSIS OF DISCOURSE FEATURES AND VERIFICATION OF SCORING LEVELS FOR INDEPENDENT AND INTEGRATED PROTOTYPE WRITTEN TASKS FOR THE NEW TOEFL®","year":2005,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Software Engineering Research","field":"Computer Science","cited_by":55,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Institute for Christian Studies; University of Toronto","funders":"","keywords":"Test of English as a Foreign Language; Computer science; Natural language processing; Psychology; Artificial intelligence; Mathematics education; Language assessment","score_opus":0.075963810214805,"score_gpt":0.39649939581488464,"score_spread":0.32053558560007966,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1964735878","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9983405,0.00003276816,0.0005350212,0.00001076389,0.0000045056754,0.000043902368,0.00010704889,0.000021539741,0.0009038528],"genre_scores_gemma":[0.9959709,0.000023340894,0.0021090158,0.000011154667,0.000008849248,0.00012138297,0.00030135945,0.00001788547,0.0014359755],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9955914,0.0013545477,0.0007100308,0.00087779795,0.0011951978,0.00027103603],"domain_scores_gemma":[0.89940584,0.06557185,0.010325213,0.006136184,0.016407277,0.0021536315],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0066179316,0.000700636,0.00049584,0.0036540332,0.000576063,0.0016028472,0.00059357745,0.0006446332,0.0028927922],"category_scores_gemma":[0.061495002,0.000299939,0.00032425777,0.001147506,0.0009802959,0.0010160679,0.001890846,0.0006020396,0.00055114005],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0039380896,0.0011697904,0.59408516,0.0005366832,0.0002360457,0.0012977193,0.042212665,0.0009733316,0.1607037,0.00069013296,0.0007542687,0.19340248],"study_design_scores_gemma":[0.000047538455,0.0012401845,0.97717834,0.000025084883,0.000028651744,0.0003675392,0.0035165,0.001064474,0.015397822,0.00020406445,0.00089159404,0.000038271224],"about_ca_topic_score_codex":0.0010869411,"about_ca_topic_score_gemma":0.0017051914,"teacher_disagreement_score":0.0066179316,"about_ca_system_score_codex":0.00065050024,"about_ca_system_score_gemma":0.00037827026,"threshold_uncertainty_score":0.03499937},"labels":[],"label_agreement":null},{"id":"W1971125305","doi":"10.1002/j.2333-8504.2003.tb01910.x","title":"INVESTIGATING THE VALIDITY OF TOEFL: A FEASIBILITY STUDY USING CONTENT AND CRITERION‐RELATED STRATEGIES","year":2003,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Test of English as a Foreign Language; Context (archaeology); Psychology; Test (biology); Content validity; Language proficiency; Test validity; Sample (material); Computer science; Mathematics education; Language assessment; Natural language processing; Psychometrics; Clinical psychology","score_opus":0.5438925237843821,"score_gpt":0.44627970010898965,"score_spread":0.09761282367539248,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1971125305","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.95665026,0.000059500668,0.027519519,0.00040615464,0.00008037399,0.01074959,0.00013545332,0.00009319208,0.004305913],"genre_scores_gemma":[0.90794617,0.00006231301,0.075777136,0.00029938066,0.000050276038,0.014824024,0.00018071425,0.000045670764,0.000814369],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.91743046,0.06027504,0.0064160484,0.0028072763,0.011319303,0.0017518391],"domain_scores_gemma":[0.59554684,0.31153947,0.014609388,0.017210213,0.058064435,0.00302969],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.13243978,0.0006538657,0.0006865063,0.002597116,0.0012935867,0.001841331,0.0018571289,0.0014126631,0.0020320157],"category_scores_gemma":[0.30439436,0.0007800232,0.0010910061,0.0011031007,0.001897815,0.0029592025,0.002967306,0.0014750256,0.0005935896],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.007634807,0.028055651,0.54881203,0.0012203576,0.0002737277,0.0007246249,0.019450456,0.004139605,0.022594444,0.0068164426,0.0015954342,0.35868245],"study_design_scores_gemma":[0.0070191906,0.10127308,0.67685205,0.0012468811,0.0005521363,0.0015858538,0.026819486,0.10232446,0.056265276,0.006242616,0.019400563,0.00041831814],"about_ca_topic_score_codex":0.0013141461,"about_ca_topic_score_gemma":0.0021389388,"teacher_disagreement_score":0.13243978,"about_ca_system_score_codex":0.0015902263,"about_ca_system_score_gemma":0.0054126857,"threshold_uncertainty_score":0.70041686},"labels":[],"label_agreement":null},{"id":"W1980407112","doi":"10.1002/j.2333-8504.2009.tb02187.x","title":"THE SPEAKING SECTION OF THE TOEFL IBT™ (SSTIBT): TEST‐TAKERS' REPORTED STRATEGIC BEHAVIORS","year":2009,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Victoria; York University; Institute for Christian Studies; University of Toronto","funders":"","keywords":"Test of English as a Foreign Language; Psychology; Test (biology); Metacognition; Construct (python library); Cognition; Variety (cybernetics); Social psychology; Cognitive psychology; Mathematics education; Applied psychology; Language assessment; Computer science; Artificial intelligence","score_opus":0.14434131607570233,"score_gpt":0.3729416411252792,"score_spread":0.2286003250495769,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1980407112","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9996834,0.000026178965,0.000040272615,0.000012622346,0.000002906206,0.0000069691528,0.00002584578,0.0000037310765,0.0001981819],"genre_scores_gemma":[0.99911934,0.000051369756,0.000107671985,0.000022282096,0.000004324276,0.000014291663,0.00008950121,0.0000021884978,0.00058912736],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99880886,0.00026195767,0.000204086,0.00009736997,0.00050032866,0.00012738253],"domain_scores_gemma":[0.9887473,0.0028920074,0.004686131,0.00057222246,0.0014816002,0.001620864],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019215624,0.0006283937,0.0005024907,0.0008390469,0.0003251682,0.0010949168,0.00043526446,0.00056688866,0.002201558],"category_scores_gemma":[0.011383502,0.0002537852,0.000672739,0.00039648218,0.00045991904,0.0004051715,0.0007382825,0.0007875087,0.0005022996],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0002081557,0.00048617204,0.9766173,0.00007531728,0.000107639346,0.00057592476,0.0045570284,0.00015194064,0.005156187,0.000021743152,0.00023368068,0.0118090855],"study_design_scores_gemma":[0.000012384648,0.0017426496,0.98901564,0.000026625718,0.00004415076,0.00046023482,0.005824511,0.00046995035,0.0019743764,0.000035292018,0.0003663995,0.000027751423],"about_ca_topic_score_codex":0.0025982526,"about_ca_topic_score_gemma":0.004327779,"teacher_disagreement_score":0.0025982526,"about_ca_system_score_codex":0.00032813067,"about_ca_system_score_gemma":0.00028884207,"threshold_uncertainty_score":0.0101623535},"labels":[],"label_agreement":null},{"id":"W2066488918","doi":"10.1002/j.2333-8504.2000.tb01828.x","title":"ASSESSING TIME TRENDS IN SEX DIFFERENCES IN SWIMMING AND RUNNING","year":2000,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Sports Analytics and Performance","field":"Economics, Econometrics and Finance","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"","keywords":"Measure (data warehouse); Event (particle physics); Statistics; Psychology; Econometrics; Demography; Computer science; Mathematics; Data mining","score_opus":0.13888090682913068,"score_gpt":0.3539880512241354,"score_spread":0.21510714439500472,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2066488918","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9960045,0.0001765986,0.00029521078,0.00009033074,0.00001100673,0.000005157786,0.0020661636,0.000008016598,0.0013430219],"genre_scores_gemma":[0.99762326,0.00006174201,0.00008139785,0.000008648735,0.000009323852,0.0000031220632,0.0016672409,0.0000032377009,0.00054206135],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99950325,0.00013977001,0.000051835443,0.00013217483,0.00009800326,0.000074906166],"domain_scores_gemma":[0.9939709,0.0021361695,0.002420863,0.00033249377,0.0007610213,0.000378518],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012498962,0.00012848977,0.00018667395,0.0012967002,0.0001288338,0.00052774267,0.0002616891,0.0002973835,0.0033947548],"category_scores_gemma":[0.005455703,0.00009983697,0.00025321046,0.0018613515,0.00017874107,0.00038657294,0.00032988374,0.00034689807,0.0005997982],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000094011855,0.000018944454,0.9954541,0.000008424247,0.000079968355,0.00002178153,0.00011015749,0.00018092284,0.00016813903,0.00015402197,0.00023265694,0.0034768835],"study_design_scores_gemma":[8.075161e-7,0.000027969358,0.99928385,0.0000018690291,0.000008983918,0.000010258879,0.00013870293,0.00024445436,0.00005899598,0.000041769155,0.00018082287,0.0000015822419],"about_ca_topic_score_codex":0.009705533,"about_ca_topic_score_gemma":0.0091224,"teacher_disagreement_score":0.009705533,"about_ca_system_score_codex":0.00016804037,"about_ca_system_score_gemma":0.0001538479,"threshold_uncertainty_score":0.019298077},"labels":[],"label_agreement":null},{"id":"W2069986276","doi":"10.1002/j.2333-8504.2004.tb01952.x","title":"TOWARD ACCESSIBLE COMPUTER‐BASED TESTS: PROTOTYPES FOR VISUAL AND OTHER DISABILITIES","year":2004,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Digital Accessibility for Disabilities","field":"Social Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"University of Toronto; Advanced Technology Research Council","keywords":"Formative assessment; Blindness; Psychology; Test (biology); Learning disability; Visual impairment; Medical education; Computerized adaptive testing; Applied psychology; Assistive technology; Computer science; Mathematics education; Human–computer interaction; Clinical psychology; Developmental psychology; Optometry; Psychometrics; Medicine","score_opus":0.18439558379315446,"score_gpt":0.4780755513786063,"score_spread":0.29367996758545184,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2069986276","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.8860674,0.00041683565,0.097460315,0.000841991,0.0001763934,0.005079202,0.0002086704,0.0010390336,0.0087102],"genre_scores_gemma":[0.6754227,0.00055771094,0.31527707,0.0002832102,0.000040489642,0.0029905115,0.00041883765,0.00010444811,0.0049049133],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9935888,0.004601718,0.00034898953,0.00019733241,0.0009522322,0.00031106596],"domain_scores_gemma":[0.9859195,0.010298702,0.0004141188,0.0007923063,0.0017125244,0.00086293474],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.010314183,0.0005146759,0.0002464581,0.0006827836,0.0003195763,0.0014052673,0.00187002,0.0011534304,0.0041306736],"category_scores_gemma":[0.027690498,0.00029161878,0.0005338928,0.00037310497,0.00091568666,0.0020591884,0.0012541829,0.0009010058,0.000662958],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002374977,0.020098906,0.029515343,0.002286071,0.000080593454,0.002167227,0.042389907,0.008665572,0.05673949,0.009186489,0.012238679,0.8142568],"study_design_scores_gemma":[0.008255014,0.13739215,0.18651326,0.0063448395,0.0007023209,0.012083952,0.056297477,0.08952656,0.18555656,0.035801336,0.28039202,0.0011345132],"about_ca_topic_score_codex":0.0016125859,"about_ca_topic_score_gemma":0.001924493,"teacher_disagreement_score":0.010314183,"about_ca_system_score_codex":0.0006639004,"about_ca_system_score_gemma":0.00074497436,"threshold_uncertainty_score":0.05454725},"labels":[],"label_agreement":null},{"id":"W2342001105","doi":"10.1002/ets2.12097","title":"The Prediction of Labor Force Status: Implications From International Adult Skill Assessments","year":2016,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Labor market dynamics and wage inequality","field":"Economics, Econometrics and Finance","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Literacy; Categorical variable; Educational attainment; Adult literacy; Probit model; Demographic economics; Psychology; Immigration; Regression analysis; Probit; Demography; Econometrics; Geography; Economics; Sociology; Economic growth; Statistics; Pedagogy","score_opus":0.06499529246291003,"score_gpt":0.3576600144154923,"score_spread":0.29266472195258225,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2342001105","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9860482,0.0004547218,0.0022795699,0.0013290148,0.000031746848,0.000018783552,0.001169446,0.000015303474,0.008653139],"genre_scores_gemma":[0.9987577,0.00009670149,0.00017263468,0.000028870214,0.000013203825,0.000005573422,0.00046330653,0.0000027382623,0.00045929835],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.999081,0.00046648268,0.000040590177,0.00016756957,0.00011178274,0.00013249523],"domain_scores_gemma":[0.9923327,0.004492749,0.001511088,0.00039437079,0.000715896,0.0005531459],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0032880236,0.00022225291,0.00026672037,0.0009980001,0.00037895277,0.0010823455,0.00033743258,0.00024592385,0.0032810178],"category_scores_gemma":[0.017167743,0.000110246736,0.00034455972,0.0014243238,0.0005943329,0.000903482,0.00097180565,0.00079429394,0.00044545167],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000028697143,0.000016076143,0.9937773,0.0000053242356,0.000016162845,0.000029282097,0.00017725388,0.00091501547,0.000031012947,0.00080907234,0.00025878416,0.0039362167],"study_design_scores_gemma":[0.0000043684986,0.00005170116,0.98866653,0.00005098156,0.000022211572,0.00003921969,0.0012065098,0.0073988396,0.00012205151,0.0013862576,0.0010441587,0.0000072178054],"about_ca_topic_score_codex":0.047109228,"about_ca_topic_score_gemma":0.037429865,"teacher_disagreement_score":0.047109228,"about_ca_system_score_codex":0.0003422507,"about_ca_system_score_gemma":0.00058456324,"threshold_uncertainty_score":0.09367001},"labels":[],"label_agreement":null},{"id":"W3082102071","doi":"10.1002/ets2.12303","title":"Perspectives on Social and Emotional Learning in Tertiary Education","year":2020,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Emotional Intelligence and Performance","field":"Psychology","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Numeracy; Complementarity (molecular biology); Higher education; Institution; Psychology; Social emotional learning; Literacy; Competition (biology); Mathematics education; Tertiary institution; Pedagogy; Sociology; Medical education; Developmental psychology; Economic growth; Social science; Economics","score_opus":0.18981148766693742,"score_gpt":0.4860659654415337,"score_spread":0.29625447777459624,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3082102071","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.095686264,0.026127085,0.002046512,0.4892152,0.0029284612,0.000021991513,0.00007166138,0.00002080503,0.38388202],"genre_scores_gemma":[0.9218213,0.015751148,0.0003408186,0.03385041,0.003902868,0.000037020072,0.000032598517,0.000022034405,0.02424185],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.9976544,0.001386859,0.000036053538,0.00011921765,0.00023976593,0.00056376413],"domain_scores_gemma":[0.9971328,0.0014533765,0.00017880986,0.00006311849,0.00026468685,0.00090723607],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003206166,0.00043422074,0.00022534886,0.0012719228,0.0064395485,0.009251285,0.0008600914,0.0035925936,0.0074183],"category_scores_gemma":[0.0021275654,0.0000912905,0.0003212071,0.001229506,0.018106697,0.004010952,0.0054680714,0.0054286476,0.00041876035],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000034949175,0.00007326909,0.0035014553,0.00019282455,0.0000057713705,0.00091325893,0.11461819,0.00031917525,0.00035506842,0.8277984,0.024834087,0.02735349],"study_design_scores_gemma":[0.000016280814,0.00011173244,0.010676977,0.0010897075,0.000009464111,0.0005865552,0.31991187,0.00040082706,0.00049612054,0.19224064,0.47442392,0.000035849178],"about_ca_topic_score_codex":0.009983024,"about_ca_topic_score_gemma":0.020842388,"teacher_disagreement_score":0.009983024,"about_ca_system_score_codex":0.008729827,"about_ca_system_score_gemma":0.0041418434,"threshold_uncertainty_score":0.06333965},"labels":[],"label_agreement":null},{"id":"W3088847275","doi":"10.1002/ets2.12307","title":"Reflections on<scp>Equity‐Centered</scp>Design","year":2020,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Higher Education Learning Practices","field":"Social Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Lethbridge","funders":"","keywords":"Verisimilitude; Equity (law); Relevance (law); Test (biology); Management science; Computer science; Psychology; Political science; Economics","score_opus":0.5692019926705136,"score_gpt":0.6024174074277371,"score_spread":0.03321541475722345,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3088847275","genre_codex":"commentary","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0037661053,0.0017898154,0.097007275,0.8285185,0.0029659253,0.0015747884,0.00012960311,0.00023886633,0.06400917],"genre_scores_gemma":[0.18690287,0.005277302,0.27477857,0.47970444,0.0024177246,0.011575888,0.00020395,0.00071332126,0.038425945],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.698559,0.24386348,0.006659383,0.005270953,0.038653992,0.006993274],"domain_scores_gemma":[0.6402324,0.2782092,0.0058174934,0.018954538,0.046647772,0.01013864],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.28871664,0.0011920978,0.00076657365,0.0015136861,0.008681102,0.018409513,0.0049882918,0.014168623,0.012852182],"category_scores_gemma":[0.20457423,0.0015003355,0.0019718327,0.002278525,0.036644638,0.01726477,0.013767095,0.026078343,0.002539689],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007408528,0.00021131538,0.001328903,0.0009696379,0.000036635687,0.00030271633,0.03922147,0.00233931,0.000543595,0.6191245,0.20600143,0.1298464],"study_design_scores_gemma":[0.00012305017,0.0003162745,0.0011146078,0.003020563,0.000028505723,0.00031961256,0.018685551,0.0016215701,0.0011762235,0.29668793,0.6768113,0.000094771756],"about_ca_topic_score_codex":0.019132772,"about_ca_topic_score_gemma":0.022604793,"teacher_disagreement_score":0.28871664,"about_ca_system_score_codex":0.019831955,"about_ca_system_score_gemma":0.07595224,"threshold_uncertainty_score":0.87713903},"labels":[],"label_agreement":null},{"id":"W4307159924","doi":"10.1002/ets2.12357","title":"Mapping<i>TOEFL</i>®<i>Essentials</i>™ Test Scores to the Canadian Language Benchmarks","year":2022,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Educational Assessment and Pedagogy","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Test of English as a Foreign Language; Test (biology); Construct (python library); Psychology; Mathematics education; Computer science; Language assessment; English language; Test score; Natural language processing; Standardized test; Programming language","score_opus":0.09859811587093853,"score_gpt":0.46174099106829725,"score_spread":0.3631428751973587,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4307159924","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.88879544,0.00043483614,0.020075629,0.00090018986,0.00019383362,0.0026083712,0.0078056566,0.00036758874,0.07881845],"genre_scores_gemma":[0.9616278,0.0003311472,0.02703123,0.00013760538,0.000020063218,0.0014589046,0.0034497576,0.00008457853,0.0058589885],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.99182194,0.0010688083,0.00036167924,0.00053924025,0.0053408905,0.0008674165],"domain_scores_gemma":[0.9832523,0.0025600484,0.0015681658,0.00067317166,0.011152693,0.000793619],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0062030526,0.00069289125,0.00041032207,0.0060640685,0.0014637196,0.0016367073,0.0014342476,0.00034001857,0.0028143264],"category_scores_gemma":[0.033428844,0.00021304452,0.0007281815,0.0044530216,0.0010830418,0.0008149349,0.001936032,0.0011213201,0.0005722762],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021828711,0.00036830417,0.5553228,0.0004400772,0.000117295174,0.00017238395,0.01189254,0.0019793438,0.0023124507,0.0054594423,0.012082039,0.40963495],"study_design_scores_gemma":[0.00002487964,0.0003185618,0.96954465,0.00013207992,0.000044512635,0.00010968549,0.0069744783,0.0021949394,0.0036152764,0.0006565702,0.016286878,0.00009753574],"about_ca_topic_score_codex":0.8693554,"about_ca_topic_score_gemma":0.90328234,"teacher_disagreement_score":0.13064462,"about_ca_system_score_codex":0.012828174,"about_ca_system_score_gemma":0.033281963,"threshold_uncertainty_score":0.262828},"labels":[],"label_agreement":null}]}