{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":10,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":10,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"a7f5fc1f824e","filters":{"venue":"ETS Research Report Series"}},"results":[{"id":"W1964735878","doi":"10.1002/j.2333-8504.2005.tb01990.x","title":"ANALYSIS OF DISCOURSE FEATURES AND VERIFICATION OF SCORING LEVELS FOR INDEPENDENT AND INTEGRATED PROTOTYPE WRITTEN TASKS FOR THE NEW TOEFL®","year":2005,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Software Engineering Research","field":"Computer Science","cited_by":55,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Institute for Christian Studies; University of Toronto","funders":"","keywords":"Test of English as a Foreign Language; Computer science; Natural language processing; Psychology; Artificial intelligence; Mathematics education; Language assessment","authors":[{"name":"Alister Cumming","is_ca":true},{"name":"Robert Kantor","is_ca":false},{"name":"Kyoko Baba","is_ca":true},{"name":"Keanre Eouanzoui","is_ca":true},{"name":"Usman Erdosy","is_ca":true},{"name":"Mark Jamse","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.075963810214805,"gpt":0.3964993958148846,"spread":0.3205355856000797,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006617932,0.000700636,0.00049584,0.003654033,0.000576063,0.001602847,0.0005935775,0.0006446332,0.002892792],"category_scores_gemma":[0.061495,0.000299939,0.0003242578,0.001147506,0.0009802959,0.001016068,0.001890846,0.0006020396,0.0005511401],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006505002,"about_ca_system_score_gemma":0.0003782703,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001086941,"about_ca_topic_score_gemma":0.001705191,"domain_scores_codex":[0.9955914,0.001354548,0.0007100308,0.000877798,0.001195198,0.000271036],"domain_scores_gemma":[0.8994058,0.06557185,0.01032521,0.006136184,0.01640728,0.002153632],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00393809,0.00116979,0.5940852,0.0005366832,0.0002360457,0.001297719,0.04221267,0.0009733316,0.1607037,0.000690133,0.0007542687,0.1934025],"study_design_scores_gemma":[0.00004753845,0.001240185,0.9771783,0.00002508488,0.00002865174,0.0003675392,0.0035165,0.001064474,0.01539782,0.0002040644,0.000891594,0.00003827122],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9983405,0.00003276816,0.0005350212,0.00001076389,0.000004505675,0.00004390237,0.0001070489,0.00002153974,0.0009038528],"genre_scores_gemma":[0.9959709,0.00002334089,0.002109016,0.00001115467,0.000008849248,0.000121383,0.0003013595,0.00001788547,0.001435976],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.006617932,"threshold_uncertainty_score":0.03499937,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1980407112","doi":"10.1002/j.2333-8504.2009.tb02187.x","title":"THE SPEAKING SECTION OF THE TOEFL IBT™ (SSTIBT): TEST‐TAKERS' REPORTED STRATEGIC BEHAVIORS","year":2009,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":32,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Victoria; York University; Institute for Christian Studies; University of Toronto","funders":"","keywords":"Test of English as a Foreign Language; Psychology; Test (biology); Metacognition; Construct (python library); Cognition; Variety (cybernetics); Social psychology; Cognitive psychology; Mathematics education; Applied psychology; Language assessment; Computer science; Artificial intelligence","authors":[{"name":"Merrill Swain","is_ca":true},{"name":"Li‐Shih Huang","is_ca":true},{"name":"Khaled Barkaoui","is_ca":true},{"name":"Lindsay Brooks","is_ca":true},{"name":"Sharon Lapkin","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1443413160757023,"gpt":0.3729416411252792,"spread":0.2286003250495769,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001921562,0.0006283937,0.0005024907,0.0008390469,0.0003251682,0.001094917,0.0004352645,0.0005668887,0.002201558],"category_scores_gemma":[0.0113835,0.0002537852,0.000672739,0.0003964822,0.000459919,0.0004051715,0.0007382825,0.0007875087,0.0005022996],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003281307,"about_ca_system_score_gemma":0.0002888421,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002598253,"about_ca_topic_score_gemma":0.004327779,"domain_scores_codex":[0.9988089,0.0002619577,0.000204086,0.00009736997,0.0005003287,0.0001273825],"domain_scores_gemma":[0.9887473,0.002892007,0.004686131,0.0005722225,0.0014816,0.001620864],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002081557,0.000486172,0.9766173,0.00007531728,0.0001076393,0.0005759248,0.004557028,0.0001519406,0.005156187,0.00002174315,0.0002336807,0.01180909],"study_design_scores_gemma":[0.00001238465,0.00174265,0.9890156,0.00002662572,0.00004415076,0.0004602348,0.005824511,0.0004699503,0.001974376,0.00003529202,0.0003663995,0.00002775142],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9996834,0.00002617896,0.00004027261,0.00001262235,0.000002906206,0.000006969153,0.00002584578,0.000003731077,0.0001981819],"genre_scores_gemma":[0.9991193,0.00005136976,0.000107672,0.0000222821,0.000004324276,0.00001429166,0.00008950121,0.000002188498,0.0005891274],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.002598253,"threshold_uncertainty_score":0.01016235,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1504933570","doi":"10.1002/ets2.12050","title":"Test Takers' Writing Activities During the<i><scp>TOEFL iBT</scp><sup>®</sup></i>Writing Tasks: A Stimulated Recall Study","year":2015,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Writing and Handwriting Education","field":"Social Sciences","cited_by":29,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"York University","funders":"","keywords":"Test of English as a Foreign Language; Test (biology); Task (project management); Psychology; Second language writing; Mathematics education; Recall; English language; Cognitive psychology; Linguistics; Second language","authors":[{"name":"Khaled Barkaoui","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1097165021020219,"gpt":0.4172894513180939,"spread":0.3075729492160719,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002398879,0.0006741873,0.0005210993,0.0008429122,0.0002985402,0.0009925038,0.0005830962,0.0006152428,0.001861477],"category_scores_gemma":[0.01815718,0.0002871819,0.0004994615,0.0002920286,0.000456636,0.0005133538,0.0007942815,0.0005538506,0.0006589097],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001959878,"about_ca_system_score_gemma":0.0001650667,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007786683,"about_ca_topic_score_gemma":0.001457432,"domain_scores_codex":[0.9983299,0.0004945624,0.0002570113,0.0002803623,0.0005015258,0.0001366107],"domain_scores_gemma":[0.9852903,0.006698884,0.003289576,0.001277372,0.002298446,0.001145316],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.00377035,0.004087184,0.7042544,0.000700368,0.000360038,0.003582635,0.06162542,0.0005219252,0.1026873,0.00009032789,0.0006582903,0.1176617],"study_design_scores_gemma":[0.00007584482,0.01049303,0.9568303,0.00006515836,0.0001168154,0.001506094,0.01173211,0.0004717248,0.01699949,0.00008746886,0.00154641,0.0000755505],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9994982,0.00003697646,0.0001832868,0.000006528083,0.000001782653,0.00002008964,0.00003253919,0.000006027687,0.0002146141],"genre_scores_gemma":[0.9978655,0.00007787942,0.0005907115,0.00002375211,0.00000720969,0.0000783444,0.0001303856,0.000007063664,0.001219125],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.002398879,"threshold_uncertainty_score":0.01268661,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2069986276","doi":"10.1002/j.2333-8504.2004.tb01952.x","title":"TOWARD ACCESSIBLE COMPUTER‐BASED TESTS: PROTOTYPES FOR VISUAL AND OTHER DISABILITIES","year":2004,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Digital Accessibility for Disabilities","field":"Social Sciences","cited_by":13,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"University of Toronto; Advanced Technology Research Council","keywords":"Formative assessment; Blindness; Psychology; Test (biology); Learning disability; Visual impairment; Medical education; Computerized adaptive testing; Applied psychology; Assistive technology; Computer science; Mathematics education; Human–computer interaction; Clinical psychology; Developmental psychology; Optometry; Psychometrics; Medicine","authors":[{"name":"Eric G. Hansen","is_ca":false},{"name":"Douglas C. Forer","is_ca":false},{"name":"Moon J. Lee","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1843955837931545,"gpt":0.4780755513786063,"spread":0.2936799675854518,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01031418,0.0005146759,0.0002464581,0.0006827836,0.0003195763,0.001405267,0.00187002,0.00115343,0.004130674],"category_scores_gemma":[0.0276905,0.0002916188,0.0005338928,0.000373105,0.0009156867,0.002059188,0.001254183,0.0009010058,0.000662958],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006639004,"about_ca_system_score_gemma":0.0007449744,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001612586,"about_ca_topic_score_gemma":0.001924493,"domain_scores_codex":[0.9935888,0.004601718,0.0003489895,0.0001973324,0.0009522322,0.000311066],"domain_scores_gemma":[0.9859195,0.0102987,0.0004141188,0.0007923063,0.001712524,0.0008629347],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002374977,0.02009891,0.02951534,0.002286071,0.00008059345,0.002167227,0.04238991,0.008665572,0.05673949,0.009186489,0.01223868,0.8142568],"study_design_scores_gemma":[0.008255014,0.1373921,0.1865133,0.006344839,0.0007023209,0.01208395,0.05629748,0.08952656,0.1855566,0.03580134,0.280392,0.001134513],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8860674,0.0004168357,0.09746031,0.000841991,0.0001763934,0.005079202,0.0002086704,0.001039034,0.0087102],"genre_scores_gemma":[0.6754227,0.0005577109,0.3152771,0.0002832102,0.00004048964,0.002990511,0.0004188376,0.0001044481,0.004904913],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01031418,"threshold_uncertainty_score":0.05454725,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3088847275","doi":"10.1002/ets2.12307","title":"Reflections on<scp>Equity‐Centered</scp>Design","year":2020,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Higher Education Learning Practices","field":"Social Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Lethbridge","funders":"","keywords":"Verisimilitude; Equity (law); Relevance (law); Test (biology); Management science; Computer science; Psychology; Political science; Economics","authors":[{"name":"María Elena Oliveri","is_ca":false},{"name":"Jessica Nastal","is_ca":false},{"name":"David Slomp","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5692019926705136,"gpt":0.6024174074277371,"spread":0.03321541475722345,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2887166,0.001192098,0.0007665736,0.001513686,0.008681102,0.01840951,0.004988292,0.01416862,0.01285218],"category_scores_gemma":[0.2045742,0.001500336,0.001971833,0.002278525,0.03664464,0.01726477,0.0137671,0.02607834,0.002539689],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01983196,"about_ca_system_score_gemma":0.07595224,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01913277,"about_ca_topic_score_gemma":0.02260479,"domain_scores_codex":[0.698559,0.2438635,0.006659383,0.005270953,0.03865399,0.006993274],"domain_scores_gemma":[0.6402324,0.2782092,0.005817493,0.01895454,0.04664777,0.01013864],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","study_design_scores_codex":[0.00007408528,0.0002113154,0.001328903,0.0009696379,0.00003663569,0.0003027163,0.03922147,0.00233931,0.000543595,0.6191245,0.2060014,0.1298464],"study_design_scores_gemma":[0.0001230502,0.0003162745,0.001114608,0.003020563,0.00002850572,0.0003196126,0.01868555,0.00162157,0.001176224,0.2966879,0.6768113,0.00009477176],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.003766105,0.001789815,0.09700727,0.8285185,0.002965925,0.001574788,0.0001296031,0.0002388663,0.06400917],"genre_scores_gemma":[0.1869029,0.005277302,0.2747786,0.4797044,0.002417725,0.01157589,0.00020395,0.0007133213,0.03842594],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2887166,"threshold_uncertainty_score":0.877139,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3082102071","doi":"10.1002/ets2.12303","title":"Perspectives on Social and Emotional Learning in Tertiary Education","year":2020,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Emotional Intelligence and Performance","field":"Psychology","cited_by":8,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Numeracy; Complementarity (molecular biology); Higher education; Institution; Psychology; Social emotional learning; Literacy; Competition (biology); Mathematics education; Tertiary institution; Pedagogy; Sociology; Medical education; Developmental psychology; Economic growth; Social science; Economics","authors":[{"name":"Catherine M. Millett","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1898114876669374,"gpt":0.4860659654415337,"spread":0.2962544777745962,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003206166,0.0004342207,0.0002253489,0.001271923,0.006439548,0.009251285,0.0008600914,0.003592594,0.0074183],"category_scores_gemma":[0.002127565,0.0000912905,0.0003212071,0.001229506,0.0181067,0.004010952,0.005468071,0.005428648,0.0004187603],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008729827,"about_ca_system_score_gemma":0.004141843,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009983024,"about_ca_topic_score_gemma":0.02084239,"domain_scores_codex":[0.9976544,0.001386859,0.00003605354,0.0001192176,0.0002397659,0.0005637641],"domain_scores_gemma":[0.9971328,0.001453376,0.0001788099,0.00006311849,0.0002646869,0.0009072361],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","study_design_scores_codex":[0.00003494917,0.00007326909,0.003501455,0.0001928245,0.000005771371,0.0009132589,0.1146182,0.0003191752,0.0003550684,0.8277984,0.02483409,0.02735349],"study_design_scores_gemma":[0.00001628081,0.0001117324,0.01067698,0.001089707,0.000009464111,0.0005865552,0.3199119,0.0004008271,0.0004961205,0.1922406,0.4744239,0.00003584918],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.09568626,0.02612709,0.002046512,0.4892152,0.002928461,0.00002199151,0.00007166138,0.00002080503,0.383882],"genre_scores_gemma":[0.9218213,0.01575115,0.0003408186,0.03385041,0.003902868,0.00003702007,0.00003259852,0.0000220344,0.02424185],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009983024,"threshold_uncertainty_score":0.06333965,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1971125305","doi":"10.1002/j.2333-8504.2003.tb01910.x","title":"INVESTIGATING THE VALIDITY OF TOEFL: A FEASIBILITY STUDY USING CONTENT AND CRITERION‐RELATED STRATEGIES","year":2003,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":6,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Test of English as a Foreign Language; Context (archaeology); Psychology; Test (biology); Content validity; Language proficiency; Test validity; Sample (material); Computer science; Mathematics education; Language assessment; Natural language processing; Psychometrics; Clinical psychology","authors":[{"name":"Michael Rosenfeld","is_ca":false},{"name":"Philip K. Oltman","is_ca":false},{"name":"Ken Sheppard","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5438925237843821,"gpt":0.4462797001089897,"spread":0.09761282367539248,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1324398,0.0006538657,0.0006865063,0.002597116,0.001293587,0.001841331,0.001857129,0.001412663,0.002032016],"category_scores_gemma":[0.3043944,0.0007800232,0.001091006,0.001103101,0.001897815,0.002959203,0.002967306,0.001475026,0.0005935896],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001590226,"about_ca_system_score_gemma":0.005412686,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001314146,"about_ca_topic_score_gemma":0.002138939,"domain_scores_codex":[0.9174305,0.06027504,0.006416048,0.002807276,0.0113193,0.001751839],"domain_scores_gemma":[0.5955468,0.3115395,0.01460939,0.01721021,0.05806443,0.00302969],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.007634807,0.02805565,0.548812,0.001220358,0.0002737277,0.0007246249,0.01945046,0.004139605,0.02259444,0.006816443,0.001595434,0.3586825],"study_design_scores_gemma":[0.007019191,0.1012731,0.676852,0.001246881,0.0005521363,0.001585854,0.02681949,0.1023245,0.05626528,0.006242616,0.01940056,0.0004183181],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9566503,0.00005950067,0.02751952,0.0004061546,0.00008037399,0.01074959,0.0001354533,0.00009319208,0.004305913],"genre_scores_gemma":[0.9079462,0.00006231301,0.07577714,0.0002993807,0.00005027604,0.01482402,0.0001807143,0.00004567076,0.000814369],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1324398,"threshold_uncertainty_score":0.7004169,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4307159924","doi":"10.1002/ets2.12357","title":"Mapping<i>TOEFL</i>®<i>Essentials</i>™ Test Scores to the Canadian Language Benchmarks","year":2022,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Educational Assessment and Pedagogy","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Test of English as a Foreign Language; Test (biology); Construct (python library); Psychology; Mathematics education; Computer science; Language assessment; English language; Test score; Natural language processing; Standardized test; Programming language","authors":[{"name":"Spiros Papageorgiou","is_ca":false},{"name":"Larry Davis","is_ca":false},{"name":"Renka Ohta","is_ca":false},{"name":"Pablo Garcia Gomez","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09859811587093853,"gpt":0.4617409910682972,"spread":0.3631428751973587,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006203053,0.0006928912,0.0004103221,0.006064069,0.00146372,0.001636707,0.001434248,0.0003400186,0.002814326],"category_scores_gemma":[0.03342884,0.0002130445,0.0007281815,0.004453022,0.001083042,0.0008149349,0.001936032,0.00112132,0.0005722762],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01282817,"about_ca_system_score_gemma":0.03328196,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.8693554,"about_ca_topic_score_gemma":0.9032823,"domain_scores_codex":[0.9918219,0.001068808,0.0003616792,0.0005392403,0.00534089,0.0008674165],"domain_scores_gemma":[0.9832523,0.002560048,0.001568166,0.0006731717,0.01115269,0.000793619],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002182871,0.0003683042,0.5553228,0.0004400772,0.0001172952,0.000172384,0.01189254,0.001979344,0.002312451,0.005459442,0.01208204,0.4096349],"study_design_scores_gemma":[0.00002487964,0.0003185618,0.9695446,0.0001320799,0.00004451264,0.0001096855,0.006974478,0.002194939,0.003615276,0.0006565702,0.01628688,0.00009753574],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8887954,0.0004348361,0.02007563,0.0009001899,0.0001938336,0.002608371,0.007805657,0.0003675887,0.07881845],"genre_scores_gemma":[0.9616278,0.0003311472,0.02703123,0.0001376054,0.00002006322,0.001458905,0.003449758,0.00008457853,0.005858989],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1306446,"threshold_uncertainty_score":0.262828,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2342001105","doi":"10.1002/ets2.12097","title":"The Prediction of Labor Force Status: Implications From International Adult Skill Assessments","year":2016,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Labor market dynamics and wage inequality","field":"Economics, Econometrics and Finance","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Literacy; Categorical variable; Educational attainment; Adult literacy; Probit model; Demographic economics; Psychology; Immigration; Regression analysis; Probit; Demography; Econometrics; Geography; Economics; Sociology; Economic growth; Statistics; Pedagogy","authors":[{"name":"Tongyun Li","is_ca":false},{"name":"Matthias von Davier","is_ca":false},{"name":"Gregory R. Hancock","is_ca":false},{"name":"Irwin S. Kirsch","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06499529246291003,"gpt":0.3576600144154923,"spread":0.2926647219525823,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003288024,0.0002222529,0.0002667204,0.0009980001,0.0003789528,0.001082345,0.0003374326,0.0002459238,0.003281018],"category_scores_gemma":[0.01716774,0.0001102467,0.0003445597,0.001424324,0.0005943329,0.000903482,0.0009718057,0.0007942939,0.0004454517],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003422507,"about_ca_system_score_gemma":0.0005845632,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.04710923,"about_ca_topic_score_gemma":0.03742987,"domain_scores_codex":[0.999081,0.0004664827,0.00004059018,0.0001675696,0.0001117827,0.0001324952],"domain_scores_gemma":[0.9923327,0.004492749,0.001511088,0.0003943708,0.000715896,0.0005531459],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00002869714,0.00001607614,0.9937773,0.000005324236,0.00001616284,0.0000292821,0.0001772539,0.0009150155,0.00003101295,0.0008090723,0.0002587842,0.003936217],"study_design_scores_gemma":[0.000004368499,0.00005170116,0.9886665,0.00005098156,0.00002221157,0.00003921969,0.00120651,0.00739884,0.0001220515,0.001386258,0.001044159,0.000007217805],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9860482,0.0004547218,0.00227957,0.001329015,0.00003174685,0.00001878355,0.001169446,0.00001530347,0.008653139],"genre_scores_gemma":[0.9987577,0.00009670149,0.0001726347,0.00002887021,0.00001320382,0.000005573422,0.0004633065,0.000002738262,0.0004592983],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.04710923,"threshold_uncertainty_score":0.09367001,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2066488918","doi":"10.1002/j.2333-8504.2000.tb01828.x","title":"ASSESSING TIME TRENDS IN SEX DIFFERENCES IN SWIMMING AND RUNNING","year":2000,"lang":"en","type":"article","venue":"ETS Research Report Series","topic":"Sports Analytics and Performance","field":"Economics, Econometrics and Finance","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Manitoba","funders":"","keywords":"Measure (data warehouse); Event (particle physics); Statistics; Psychology; Econometrics; Demography; Computer science; Mathematics; Data mining","authors":[{"name":"Howard Wainer","is_ca":false},{"name":"Catherine Njue","is_ca":true},{"name":"Samuel Palmer","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1388809068291307,"gpt":0.3539880512241354,"spread":0.2151071443950047,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001249896,0.0001284898,0.0001866739,0.0012967,0.0001288338,0.0005277427,0.0002616891,0.0002973835,0.003394755],"category_scores_gemma":[0.005455703,0.00009983697,0.0002532105,0.001861352,0.0001787411,0.0003865729,0.0003298837,0.0003468981,0.0005997982],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001680404,"about_ca_system_score_gemma":0.0001538479,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009705533,"about_ca_topic_score_gemma":0.0091224,"domain_scores_codex":[0.9995033,0.00013977,0.00005183544,0.0001321748,0.00009800326,0.00007490617],"domain_scores_gemma":[0.9939709,0.002136169,0.002420863,0.0003324938,0.0007610213,0.000378518],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00009401186,0.00001894445,0.9954541,0.000008424247,0.00007996835,0.00002178153,0.0001101575,0.0001809228,0.000168139,0.000154022,0.0002326569,0.003476884],"study_design_scores_gemma":[8.075161e-7,0.00002796936,0.9992839,0.000001869029,0.000008983918,0.00001025888,0.0001387029,0.0002444544,0.00005899598,0.00004176916,0.0001808229,0.000001582242],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9960045,0.0001765986,0.0002952108,0.00009033074,0.00001100673,0.000005157786,0.002066164,0.000008016598,0.001343022],"genre_scores_gemma":[0.9976233,0.00006174201,0.00008139785,0.000008648735,0.000009323852,0.000003122063,0.001667241,0.000003237701,0.0005420613],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009705533,"threshold_uncertainty_score":0.01929808,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}