{"meta":{"query_hash":"8795a77f2e6a","filters":{"venue":"TalkBank"},"cohort_total":5,"direct_labels_cover":0,"predictions_cover":5,"exported":5,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/8795a77f2e6a","api":"https://metacan.xera.ac/api/v1/cohort?venue=TalkBank"},"results":[{"id":"W6888699979","doi":"10.21415/t5r61b","title":"CHILDES French-English GNP Corpus","year":2004,"lang":"de","type":"dataset","venue":"TalkBank","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Feature (linguistics); Term (time); Context (archaeology); Set (abstract data type)","score_opus":0.010139411224690425,"score_gpt":0.2351207589173482,"score_spread":0.2249813476926578,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6888699979","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011689522,0.0004671334,0.0009078666,0.00030022906,0.00006177358,0.000106230276,0.97490305,0.0022256123,0.009338534],"genre_scores_gemma":[0.01827261,0.00020777802,0.0021004921,0.00009110348,0.000019708974,0.0003529664,0.96826136,0.00042705433,0.01026688],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.999074,0.00018448614,0.000052726075,0.00027381242,0.00021850514,0.0001963839],"domain_scores_gemma":[0.99837685,0.00041813348,0.000090792855,0.00025143314,0.0006133572,0.00024937847],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009899206,0.002625275,0.0013567118,0.004983991,0.0018416606,0.0014477362,0.0029612235,0.0013699437,0.06356829],"category_scores_gemma":[0.0029754103,0.00084394566,0.0009093947,0.005178929,0.0009618959,0.0011235595,0.0018351156,0.001387697,0.023230605],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00037347333,0.00007244722,0.0046863537,0.00058542617,0.00010765129,0.0004112231,0.0006005971,0.0010550235,0.0016730558,0.0023146945,0.969428,0.018692086],"study_design_scores_gemma":[0.00044026968,0.00005997257,0.106554195,0.00027335103,0.00017713873,0.00055375445,0.0011336912,0.0024897917,0.0029141542,0.0012026632,0.8840293,0.00017171953],"about_ca_topic_score_codex":0.74353415,"about_ca_topic_score_gemma":0.8387276,"teacher_disagreement_score":0.74353415,"about_ca_system_score_codex":0.008138808,"about_ca_system_score_gemma":0.011429869,"threshold_uncertainty_score":0.51595247},"labels":[],"label_agreement":null},{"id":"W6926263748","doi":"10.21415/t5161t","title":"ClassBank English Roth Corpus","year":2004,"lang":"en","type":"dataset","venue":"TalkBank","topic":"Scientific Computing and Data Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Subject (documents); Feature (linguistics); Corpus linguistics","score_opus":0.10214806484674559,"score_gpt":0.37577450921819583,"score_spread":0.27362644437145023,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6926263748","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00041215107,0.00010586565,0.00028227366,0.00015037993,0.000092722315,0.000023872724,0.99248743,0.00071596395,0.005729362],"genre_scores_gemma":[0.0010307723,0.00006699663,0.00047493685,0.00004914333,0.000016166712,0.00013403613,0.992826,0.0004438388,0.0049581677],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9984493,0.0003273058,0.00018447229,0.00048816582,0.0003487781,0.00020200758],"domain_scores_gemma":[0.99650925,0.0011357581,0.00019015254,0.00087614974,0.0010067179,0.00028191358],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0016773839,0.0027884038,0.0016488526,0.006886689,0.001828815,0.0036024903,0.0025450226,0.0023787902,0.23834799],"category_scores_gemma":[0.0064554596,0.0012667719,0.0009480878,0.010274837,0.0007861003,0.0024005875,0.0024727723,0.0025302132,0.2103311],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000051501156,0.000017933675,0.0001109232,0.00016871159,0.000008063192,0.0000156277,0.000028201823,0.000114622104,0.00015732158,0.0007120172,0.9963464,0.0022686902],"study_design_scores_gemma":[0.00015454617,0.000011355395,0.0025625364,0.00012660981,0.00002514082,0.00004538958,0.00013522063,0.00039757238,0.00072923355,0.0012125869,0.9945722,0.000027580418],"about_ca_topic_score_codex":0.06464174,"about_ca_topic_score_gemma":0.0804514,"teacher_disagreement_score":0.23834799,"about_ca_system_score_codex":0.0029805992,"about_ca_system_score_gemma":0.005281334,"threshold_uncertainty_score":0.79735345},"labels":[],"label_agreement":null},{"id":"W6944952617","doi":"10.21415/t5nk63","title":"CHILDES French York Corpus","year":2004,"lang":"en","type":"dataset","venue":"TalkBank","topic":"Cell Image Analysis Techniques","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Corpus linguistics; Feature (linguistics); Context (archaeology); Subject (documents)","score_opus":0.00608254786747934,"score_gpt":0.24652194525712284,"score_spread":0.2404393973896435,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6944952617","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.008331631,0.00076811586,0.00034359883,0.00024458117,0.0000624366,0.000038444505,0.9831055,0.00090163,0.0062040496],"genre_scores_gemma":[0.0069271186,0.00016914234,0.0006417694,0.000046747882,0.000014439646,0.00010024917,0.98752034,0.00021129893,0.0043689143],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.99861515,0.0002502228,0.00010148614,0.0004931648,0.0003132484,0.0002266643],"domain_scores_gemma":[0.99658763,0.0011105513,0.00015894196,0.0004618896,0.0014161845,0.00026488924],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001233351,0.0024345547,0.0013236596,0.008939399,0.0019403703,0.0021846604,0.0018277343,0.0018602463,0.046834607],"category_scores_gemma":[0.004883162,0.00059662753,0.0010586788,0.008113983,0.0008156932,0.0012829065,0.0016864665,0.0014396714,0.027737997],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00030842426,0.00005383872,0.002990558,0.00061182055,0.000113295246,0.0002338944,0.00036638006,0.0008568023,0.0010102942,0.0017545377,0.977037,0.014663186],"study_design_scores_gemma":[0.00022211303,0.000026534828,0.048129715,0.0002660404,0.00011201013,0.0003373615,0.0007595949,0.0014434787,0.0018527486,0.0006523528,0.9461174,0.00008059474],"about_ca_topic_score_codex":0.65315926,"about_ca_topic_score_gemma":0.7170843,"teacher_disagreement_score":0.65315926,"about_ca_system_score_codex":0.006199855,"about_ca_system_score_gemma":0.007940811,"threshold_uncertainty_score":0.69776666},"labels":[],"label_agreement":null},{"id":"W6945082095","doi":"10.21415/t5x01t","title":"SLABank Spanish Liceras Corpus","year":2010,"lang":"en","type":"dataset","venue":"TalkBank","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Set (abstract data type); Feature (linguistics); Natural language; Subject (documents)","score_opus":0.01519800879836604,"score_gpt":0.24299233282856617,"score_spread":0.2277943240302001,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6945082095","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0035851344,0.00013224849,0.00012186555,0.00012258123,0.00004207924,0.000030037678,0.99240375,0.00046442254,0.0030979358],"genre_scores_gemma":[0.0028925699,0.000053494277,0.0002732597,0.000030728585,0.0000065734134,0.00014041114,0.99228114,0.000123296,0.004198596],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9992957,0.0001314627,0.000058707246,0.00019128494,0.00017758425,0.00014519364],"domain_scores_gemma":[0.9974159,0.0007323972,0.00013178524,0.00043901528,0.0009014781,0.00037946674],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001058754,0.0022039309,0.0010716935,0.0038478533,0.00153649,0.0018546077,0.002532808,0.0018598976,0.058522824],"category_scores_gemma":[0.003886813,0.00078998186,0.000730383,0.0045751953,0.00095416466,0.0011364893,0.0028977948,0.0018347619,0.05977386],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020216241,0.00005225246,0.0020675987,0.0005536176,0.00004258365,0.00010520525,0.0006055481,0.0003364289,0.00055284606,0.00045706445,0.98847044,0.006554127],"study_design_scores_gemma":[0.00026059034,0.000024017914,0.035208117,0.0002908953,0.00006803275,0.00014786732,0.0014595526,0.00061032485,0.0011943907,0.00059670716,0.96006376,0.000075802636],"about_ca_topic_score_codex":0.35393596,"about_ca_topic_score_gemma":0.5232665,"teacher_disagreement_score":0.35393596,"about_ca_system_score_codex":0.0032891051,"about_ca_system_score_gemma":0.006441248,"threshold_uncertainty_score":0.7037517},"labels":[],"label_agreement":null},{"id":"W6963629377","doi":"10.21415/t5t59n","title":"CABank French CallFriend Corpus","year":2004,"lang":"en","type":"dataset","venue":"TalkBank","topic":"","field":"","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"","keywords":"Set (abstract data type); Feature (linguistics); Subject (documents); Corpus linguistics","score_opus":0.014218931789799029,"score_gpt":0.26319328289543936,"score_spread":0.24897435110564034,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W6963629377","genre_codex":"dataset","genre_gemma":"dataset","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"dataset","genre_consensus":"dataset","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.013336866,0.000713808,0.0011171198,0.00038464257,0.00020519827,0.00015963157,0.9708609,0.0039015845,0.009320379],"genre_scores_gemma":[0.006954368,0.0001343426,0.0010612359,0.000077714234,0.0000388428,0.00019329123,0.9831519,0.0003427906,0.008045591],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9979177,0.00040652353,0.00010771976,0.0005114976,0.00057937606,0.00047715663],"domain_scores_gemma":[0.9969842,0.00065000146,0.00012406979,0.0005376889,0.001307882,0.0003962275],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0012844824,0.0036514665,0.0022352226,0.006110528,0.00432462,0.0029474574,0.0034114427,0.0031875991,0.04362912],"category_scores_gemma":[0.0037451377,0.00093489175,0.0013709298,0.005988769,0.0011840701,0.0011323952,0.0019615055,0.0025439383,0.04045393],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00040008881,0.00015700296,0.0013511198,0.00041854643,0.00007869476,0.0002460632,0.00035740747,0.000837102,0.0018394102,0.0009220939,0.9793452,0.014047186],"study_design_scores_gemma":[0.0004276292,0.00007569206,0.03667824,0.00022455068,0.00015287926,0.0005661323,0.00089519547,0.0037805664,0.00350325,0.00053237256,0.95301807,0.00014539952],"about_ca_topic_score_codex":0.66394264,"about_ca_topic_score_gemma":0.7481521,"teacher_disagreement_score":0.66394264,"about_ca_system_score_codex":0.006472023,"about_ca_system_score_gemma":0.013329493,"threshold_uncertainty_score":0.67607296},"labels":[],"label_agreement":null}]}