{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":5,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":5,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"8795a77f2e6a","filters":{"venue":"TalkBank"}},"results":[{"id":"W6963629377","doi":"10.21415/t5t59n","title":"CABank French CallFriend Corpus","year":2004,"lang":"en","type":"dataset","venue":"TalkBank","topic":"","field":"","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Set (abstract data type); Feature (linguistics); Subject (documents); Corpus linguistics","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.01421893178979903,"gpt":0.2631932828954394,"spread":0.2489743511056403,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001284482,0.003651466,0.002235223,0.006110528,0.00432462,0.002947457,0.003411443,0.003187599,0.04362912],"category_scores_gemma":[0.003745138,0.0009348918,0.00137093,0.005988769,0.00118407,0.001132395,0.001961506,0.002543938,0.04045393],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006472023,"about_ca_system_score_gemma":0.01332949,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.6639426,"about_ca_topic_score_gemma":0.7481521,"domain_scores_codex":[0.9979177,0.0004065235,0.0001077198,0.0005114976,0.0005793761,0.0004771566],"domain_scores_gemma":[0.9969842,0.0006500015,0.0001240698,0.0005376889,0.001307882,0.0003962275],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0004000888,0.000157003,0.00135112,0.0004185464,0.00007869476,0.0002460632,0.0003574075,0.000837102,0.00183941,0.0009220939,0.9793452,0.01404719],"study_design_scores_gemma":[0.0004276292,0.00007569206,0.03667824,0.0002245507,0.0001528793,0.0005661323,0.0008951955,0.003780566,0.00350325,0.0005323726,0.9530181,0.0001453995],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01333687,0.000713808,0.00111712,0.0003846426,0.0002051983,0.0001596316,0.9708609,0.003901585,0.009320379],"genre_scores_gemma":[0.006954368,0.0001343426,0.001061236,0.00007771423,0.0000388428,0.0001932912,0.9831519,0.0003427906,0.008045591],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.6639426,"threshold_uncertainty_score":0.676073,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W6888699979","doi":"10.21415/t5r61b","title":"CHILDES French-English GNP Corpus","year":2004,"lang":"de","type":"dataset","venue":"TalkBank","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Feature (linguistics); Term (time); Context (archaeology); Set (abstract data type)","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.01013941122469043,"gpt":0.2351207589173482,"spread":0.2249813476926578,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009899206,0.002625275,0.001356712,0.004983991,0.001841661,0.001447736,0.002961223,0.001369944,0.06356829],"category_scores_gemma":[0.00297541,0.0008439457,0.0009093947,0.005178929,0.0009618959,0.00112356,0.001835116,0.001387697,0.0232306],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008138808,"about_ca_system_score_gemma":0.01142987,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.7435341,"about_ca_topic_score_gemma":0.8387276,"domain_scores_codex":[0.999074,0.0001844861,0.00005272607,0.0002738124,0.0002185051,0.0001963839],"domain_scores_gemma":[0.9983768,0.0004181335,0.00009079286,0.0002514331,0.0006133572,0.0002493785],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003734733,0.00007244722,0.004686354,0.0005854262,0.0001076513,0.0004112231,0.0006005971,0.001055024,0.001673056,0.002314694,0.969428,0.01869209],"study_design_scores_gemma":[0.0004402697,0.00005997257,0.1065542,0.000273351,0.0001771387,0.0005537544,0.001133691,0.002489792,0.002914154,0.001202663,0.8840293,0.0001717195],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01168952,0.0004671334,0.0009078666,0.0003002291,0.00006177358,0.0001062303,0.974903,0.002225612,0.009338534],"genre_scores_gemma":[0.01827261,0.000207778,0.002100492,0.00009110348,0.00001970897,0.0003529664,0.9682614,0.0004270543,0.01026688],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.7435341,"threshold_uncertainty_score":0.5159525,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W6945082095","doi":"10.21415/t5x01t","title":"SLABank Spanish Liceras Corpus","year":2010,"lang":"en","type":"dataset","venue":"TalkBank","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Set (abstract data type); Feature (linguistics); Natural language; Subject (documents)","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.01519800879836604,"gpt":0.2429923328285662,"spread":0.2277943240302001,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001058754,0.002203931,0.001071693,0.003847853,0.00153649,0.001854608,0.002532808,0.001859898,0.05852282],"category_scores_gemma":[0.003886813,0.0007899819,0.000730383,0.004575195,0.0009541647,0.001136489,0.002897795,0.001834762,0.05977386],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003289105,"about_ca_system_score_gemma":0.006441248,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.353936,"about_ca_topic_score_gemma":0.5232665,"domain_scores_codex":[0.9992957,0.0001314627,0.00005870725,0.0001912849,0.0001775843,0.0001451936],"domain_scores_gemma":[0.9974159,0.0007323972,0.0001317852,0.0004390153,0.0009014781,0.0003794667],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002021624,0.00005225246,0.002067599,0.0005536176,0.00004258365,0.0001052052,0.0006055481,0.0003364289,0.0005528461,0.0004570645,0.9884704,0.006554127],"study_design_scores_gemma":[0.0002605903,0.00002401791,0.03520812,0.0002908953,0.00006803275,0.0001478673,0.001459553,0.0006103248,0.001194391,0.0005967072,0.9600638,0.00007580264],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.003585134,0.0001322485,0.0001218656,0.0001225812,0.00004207924,0.00003003768,0.9924037,0.0004644225,0.003097936],"genre_scores_gemma":[0.00289257,0.00005349428,0.0002732597,0.00003072858,0.000006573413,0.0001404111,0.9922811,0.000123296,0.004198596],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.353936,"threshold_uncertainty_score":0.7037517,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W6944952617","doi":"10.21415/t5nk63","title":"CHILDES French York Corpus","year":2004,"lang":"en","type":"dataset","venue":"TalkBank","topic":"Cell Image Analysis Techniques","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Corpus linguistics; Feature (linguistics); Context (archaeology); Subject (documents)","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.00608254786747934,"gpt":0.2465219452571228,"spread":0.2404393973896435,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001233351,0.002434555,0.00132366,0.008939399,0.00194037,0.00218466,0.001827734,0.001860246,0.04683461],"category_scores_gemma":[0.004883162,0.0005966275,0.001058679,0.008113983,0.0008156932,0.001282907,0.001686467,0.001439671,0.027738],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006199855,"about_ca_system_score_gemma":0.007940811,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.6531593,"about_ca_topic_score_gemma":0.7170843,"domain_scores_codex":[0.9986151,0.0002502228,0.0001014861,0.0004931648,0.0003132484,0.0002266643],"domain_scores_gemma":[0.9965876,0.001110551,0.000158942,0.0004618896,0.001416184,0.0002648892],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003084243,0.00005383872,0.002990558,0.0006118205,0.0001132952,0.0002338944,0.0003663801,0.0008568023,0.001010294,0.001754538,0.977037,0.01466319],"study_design_scores_gemma":[0.000222113,0.00002653483,0.04812972,0.0002660404,0.0001120101,0.0003373615,0.0007595949,0.001443479,0.001852749,0.0006523528,0.9461174,0.00008059474],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.008331631,0.0007681159,0.0003435988,0.0002445812,0.0000624366,0.0000384445,0.9831055,0.00090163,0.00620405],"genre_scores_gemma":[0.006927119,0.0001691423,0.0006417694,0.00004674788,0.00001443965,0.0001002492,0.9875203,0.0002112989,0.004368914],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.6531593,"threshold_uncertainty_score":0.6977667,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W6926263748","doi":"10.21415/t5161t","title":"ClassBank English Roth Corpus","year":2004,"lang":"en","type":"dataset","venue":"TalkBank","topic":"Scientific Computing and Data Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Subject (documents); Feature (linguistics); Corpus linguistics","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.1021480648467456,"gpt":0.3757745092181958,"spread":0.2736264443714502,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001677384,0.002788404,0.001648853,0.006886689,0.001828815,0.00360249,0.002545023,0.00237879,0.238348],"category_scores_gemma":[0.00645546,0.001266772,0.0009480878,0.01027484,0.0007861003,0.002400588,0.002472772,0.002530213,0.2103311],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002980599,"about_ca_system_score_gemma":0.005281334,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.06464174,"about_ca_topic_score_gemma":0.0804514,"domain_scores_codex":[0.9984493,0.0003273058,0.0001844723,0.0004881658,0.0003487781,0.0002020076],"domain_scores_gemma":[0.9965093,0.001135758,0.0001901525,0.0008761497,0.001006718,0.0002819136],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00005150116,0.00001793367,0.0001109232,0.0001687116,0.000008063192,0.0000156277,0.00002820182,0.0001146221,0.0001573216,0.0007120172,0.9963464,0.00226869],"study_design_scores_gemma":[0.0001545462,0.0000113554,0.002562536,0.0001266098,0.00002514082,0.00004538958,0.0001352206,0.0003975724,0.0007292336,0.001212587,0.9945722,0.00002758042],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0004121511,0.0001058656,0.0002822737,0.0001503799,0.00009272232,0.00002387272,0.9924874,0.0007159639,0.005729362],"genre_scores_gemma":[0.001030772,0.00006699663,0.0004749369,0.00004914333,0.00001616671,0.0001340361,0.992826,0.0004438388,0.004958168],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.238348,"threshold_uncertainty_score":0.7973534,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}