{"id":"W2327588828","doi":"10.1515/cllt.2011.008","title":"Safe harbour: Ethics and accessibility in sociolinguistic corpus building","year":2011,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Globe; Corpus linguistics; Linguistics; Computer science; Applied linguistics; Computational linguistics; Sociology; Data sharing; Natural language processing; Psychology; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.0769566,0.0004990534,0.0006306929,0.003994546,0.009099717,0.01130363,0.002507004,0.003255495,0.004696524],"category_scores_gemma":[0.1437834,0.001178595,0.000492123,0.003850345,0.02836335,0.02011409,0.01597708,0.004823613,0.001069912],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003469441,"about_ca_system_score_gemma":0.008102502,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003441803,"about_ca_topic_score_gemma":0.004946674,"domain_scores_codex":[0.8815413,0.1062841,0.003011544,0.003240609,0.005018994,0.0009035373],"domain_scores_gemma":[0.8403632,0.1164399,0.00460575,0.02834436,0.008282952,0.001963956],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00006835554,0.00006499829,0.001882301,0.0002215767,0.00001505492,0.0004522931,0.0890399,0.002070119,0.001196903,0.8446196,0.003942955,0.05642598],"study_design_scores_gemma":[0.00003393067,0.00005417289,0.001187615,0.0006198585,0.00001793646,0.0005696744,0.03073915,0.01154721,0.003523467,0.8011368,0.1505052,0.00006507122],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02922508,0.0005501023,0.923438,0.01053818,0.0002368401,0.0008586567,0.0002020562,0.0002842992,0.03466664],"genre_scores_gemma":[0.4612247,0.0005705252,0.5246264,0.001000196,0.0002169306,0.002969128,0.0004359157,0.0005265759,0.008429626],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9967445,"threshold_uncertainty_score":0.4069903,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03852763765365219,"score_gpt":0.3088898463052056,"score_spread":0.2703622086515534,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}