{"id":"W4399001331","doi":"10.7910/dvn/x8qjjv","title":"Corpus of North American Spoken English","year":2021,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"American English; Linguistics; Corpus linguistics; History; Natural language processing; Computer science; Philosophy","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001337094,0.001629651,0.001183027,0.00332673,0.002498396,0.001869582,0.002650565,0.00133275,0.03068257],"category_scores_gemma":[0.004076821,0.000533314,0.0006696258,0.004951487,0.0009742458,0.001378569,0.002796852,0.002026684,0.04387107],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001599048,"about_ca_system_score_gemma":0.002858114,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.04788924,"about_ca_topic_score_gemma":0.07989077,"domain_scores_codex":[0.9979717,0.0005952018,0.0002789245,0.0005206408,0.0004333817,0.0002000498],"domain_scores_gemma":[0.9966725,0.0008254517,0.0001610336,0.0006181705,0.00144633,0.0002764967],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002278769,0.0001599374,0.001536301,0.001003163,0.00003667417,0.0003763431,0.00054063,0.0003717401,0.001220298,0.001088106,0.9765578,0.01688105],"study_design_scores_gemma":[0.0002637221,0.00004759902,0.02420627,0.0002918832,0.00005711038,0.0006195417,0.001469753,0.001807389,0.001638679,0.001050727,0.9684566,0.00009069971],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01380563,0.0007897218,0.001398018,0.0005046191,0.0002679759,0.0003502841,0.9724818,0.001374527,0.009027483],"genre_scores_gemma":[0.004981909,0.0001449479,0.001470967,0.0001037826,0.00003188276,0.0007470031,0.9896152,0.0001402786,0.002763942],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.04788924,"threshold_uncertainty_score":0.1026434,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009078403576490207,"score_gpt":0.2389357158101126,"score_spread":0.2298573122336224,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}