{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":2,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":2,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"add399e4d669","filters":{"venue":"Linguistic Data Consortium Catalog"}},"results":[{"id":"W7104390420","doi":"10.35111/5b6x-2e75","title":"LORELEI Ilocano Incident Language Pack","year":2025,"lang":"","type":"dataset","venue":"Linguistic Data Consortium Catalog","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Context (archaeology); Resource (disambiguation); Natural language; Language technology; Language identification; Event (particle physics); Information extraction","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.02692544569742328,"gpt":0.3228691225035973,"spread":0.295943676806174,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005045874,0.001058892,0.000726147,0.002335825,0.001609904,0.003001187,0.00228499,0.001026766,0.1214663],"category_scores_gemma":[0.01222573,0.0008222414,0.0004862691,0.00165954,0.000844127,0.004371448,0.003992337,0.002330973,0.08633213],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002195725,"about_ca_system_score_gemma":0.003419498,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01908165,"about_ca_topic_score_gemma":0.01880484,"domain_scores_codex":[0.9963661,0.0009734045,0.0003070294,0.0004760773,0.001603451,0.0002737908],"domain_scores_gemma":[0.9897583,0.001934815,0.0003406903,0.001712001,0.005706435,0.0005478588],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0004840009,0.0001878163,0.001222601,0.0005331404,0.00001183162,0.0002057952,0.0009757393,0.0006164578,0.004759135,0.003719558,0.9200239,0.06725996],"study_design_scores_gemma":[0.0001314874,0.0001533745,0.00279139,0.0001568024,0.00001277433,0.0002301932,0.00139148,0.00299089,0.009612032,0.001901995,0.9805377,0.00008987542],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.04298235,0.0005192096,0.07597896,0.006985287,0.002504914,0.008123074,0.3851765,0.1141159,0.3636138],"genre_scores_gemma":[0.06602241,0.0003436512,0.1008435,0.002721413,0.0003525377,0.0065219,0.6870985,0.01373578,0.1223603],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.1214663,"threshold_uncertainty_score":0.4063453,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3186788573","doi":"10.35111/srvm-p675","title":"LORELEI Akan Representative Language Pack","year":2021,"lang":"en","type":"dataset","venue":"Linguistic Data Consortium Catalog","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Computer science; Annotation; Natural language processing; XML; Artificial intelligence; Context (archaeology); Resource (disambiguation); Sentence; Lemmatisation; Information retrieval; World Wide Web","authors":[{"name":"Jennifer Tracey","is_ca":false},{"name":"Stephanie Strassel","is_ca":false},{"name":"David Graff","is_ca":false},{"name":"Jonathan Wright","is_ca":false},{"name":"Chen Song","is_ca":false},{"name":"Neville Ryant","is_ca":false},{"name":"Seth Kulick","is_ca":false},{"name":"Kira Griffitt","is_ca":false},{"name":"Dana Delgado","is_ca":false},{"name":"Michael Arrigo","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02960889486193685,"gpt":0.3335016712738956,"spread":0.3038927764119588,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.003045092,0.001373664,0.000937717,0.005037313,0.001521139,0.00439326,0.002005257,0.0007898976,0.30194],"category_scores_gemma":[0.009225233,0.0009789636,0.000515877,0.005111583,0.0007246207,0.005877991,0.004186717,0.001689443,0.2748518],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001864814,"about_ca_system_score_gemma":0.002793196,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01326982,"about_ca_topic_score_gemma":0.01276855,"domain_scores_codex":[0.9972004,0.0006159556,0.0002963838,0.0006403611,0.001029043,0.0002179546],"domain_scores_gemma":[0.9888527,0.002393277,0.0005769805,0.002597003,0.00503947,0.0005403791],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002347462,0.0000449861,0.0007070818,0.0004402121,0.000009297602,0.0001877583,0.0006234452,0.0002212784,0.003292623,0.003243646,0.896374,0.09462098],"study_design_scores_gemma":[0.00001431512,0.0000158082,0.0009552281,0.00007740709,0.000003815332,0.0001357782,0.0002902258,0.0004418933,0.002056052,0.0007523025,0.995233,0.00002419712],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"other","genre_gemma":"dataset","genre_scores_codex":[0.01383552,0.001617411,0.0464054,0.00488804,0.001995478,0.001682039,0.3872791,0.08344302,0.458854],"genre_scores_gemma":[0.03299748,0.001199231,0.06673688,0.001504821,0.0006293324,0.002793233,0.5173878,0.0193678,0.3573834],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.30194,"threshold_uncertainty_score":0.9956979,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}