{"id":"W830770281","doi":"10.4000/trajectoires.2157","title":"Construction de corpus généraux et spécialisés à partir du Web (Ad hoc and general-purpose corpus construction from web sources)","year":2016,"lang":"fr","type":"article","venue":"Tr@jectoires","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Barrie Urology Group","funders":"","keywords":"Humanities; Corpus linguistics; Art; Philosophy; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003132667,0.001031293,0.0009016121,0.01113059,0.002717313,0.00318784,0.00136852,0.001264378,0.01308955],"category_scores_gemma":[0.01445678,0.0009954026,0.001117375,0.008076438,0.001692304,0.003278672,0.003722299,0.001795859,0.006140036],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001169957,"about_ca_system_score_gemma":0.003862606,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003277754,"about_ca_topic_score_gemma":0.005175614,"domain_scores_codex":[0.9963312,0.001198909,0.0005122457,0.0009800204,0.0008077854,0.0001699568],"domain_scores_gemma":[0.9887577,0.006032248,0.0005099874,0.002095084,0.002357906,0.0002471544],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0006465568,0.0003151696,0.007493494,0.004174763,0.0002018854,0.003212017,0.01240198,0.005878876,0.1166637,0.07380717,0.06608447,0.7091199],"study_design_scores_gemma":[0.0001762775,0.0003149348,0.01751217,0.0008547363,0.0003689321,0.003412242,0.006795644,0.06464841,0.1437029,0.04085044,0.7211719,0.0001915019],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1016907,0.001592031,0.8111696,0.0009812455,0.0007722058,0.003584694,0.02792452,0.01355192,0.03873307],"genre_scores_gemma":[0.1167537,0.001090941,0.7941478,0.0002111657,0.0002246959,0.004855736,0.05982592,0.003483847,0.01940626],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01308955,"threshold_uncertainty_score":0.04378885,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01616006285433942,"score_gpt":0.255013822750617,"score_spread":0.2388537598962775,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}