{"id":"W4308014181","doi":"10.1590/2176-4573e55831","title":"Creating a Large-Scale Audio-Aligned Parsed Corpus of Bilingual Russian Child and Child-Directed Speech (BiRCh): Challenges, Solutions, and Implications for Research","year":2022,"lang":"en","type":"article","venue":"Bakhtiniana Revista de Estudos do Discurso","topic":"Language Development and Disorders","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Parsing; Linguistics; Computer science; Corpus linguistics; Natural language processing; Speech corpus; Artificial intelligence; Speech recognition; Speech synthesis","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts"],"consensus_categories":[],"category_scores_codex":[0.002518583,0.0002595362,0.0004606385,0.0003314034,0.00163639,0.00009338542,0.0003381006,0.0001152901,0.0002852164],"category_scores_gemma":[0.000487707,0.0002496416,0.0001091446,0.0006427999,0.00023771,0.00006834354,0.0003710346,0.0003426945,0.000004514254],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008998956,"about_ca_system_score_gemma":0.0001836933,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001768444,"about_ca_topic_score_gemma":0.0002933707,"domain_scores_codex":[0.996889,0.0006163677,0.0005528,0.0007770185,0.000316114,0.0008486796],"domain_scores_gemma":[0.9983987,0.0004402759,0.0002437778,0.0005931582,0.0001142434,0.0002098162],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","study_design_scores_codex":[0.001140034,0.003831567,0.2507542,0.001085407,0.001022595,0.00005599655,0.1444061,0.000005850362,0.0005972778,0.4620132,0.008678534,0.1264091],"study_design_scores_gemma":[0.006616981,0.0007355169,0.8455003,0.0003189471,0.0002441985,0.0003391457,0.07240338,0.000166594,0.00003810241,0.002599209,0.07011137,0.0009261903],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8739498,0.07341614,0.0002258669,0.01292073,0.000219708,0.003757874,0.001123126,0.0003202005,0.03406657],"genre_scores_gemma":[0.995588,0.0007966802,0.001824023,0.0001236321,0.0001246434,0.0007559725,0.0002415177,0.00006688046,0.000478624],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5947461,"threshold_uncertainty_score":0.9999956,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04875747048879389,"score_gpt":0.3515538431071518,"score_spread":0.3027963726183579,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}