{"id":"W2606816378","doi":"10.3366/cor.2017.0108","title":"Subtopic annotation and automatic segmentation for news texts in Brazilian Portuguese","year":2017,"lang":"en","type":"article","venue":"Corpora","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Conselho Nacional de Desenvolvimento Científico e Tecnológico; Fundação de Amparo à Pesquisa do Estado de São Paulo","keywords":"Annotation; Computer science; Segmentation; Natural language processing; Portuguese; Artificial intelligence; Process (computing); Rhetorical question; Computational linguistics; Brazilian Portuguese; Linguistics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002296836,0.0006252937,0.0005383834,0.005475695,0.002273316,0.001520173,0.0006314571,0.0006191866,0.002932023],"category_scores_gemma":[0.01973695,0.0004849783,0.0003789311,0.004679099,0.001138305,0.001610097,0.001612125,0.0007802087,0.0008519304],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001327701,"about_ca_system_score_gemma":0.001719589,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01028505,"about_ca_topic_score_gemma":0.01685056,"domain_scores_codex":[0.9972292,0.001256613,0.0002957184,0.000646111,0.0004599247,0.0001123603],"domain_scores_gemma":[0.9845588,0.01028089,0.001294017,0.001261719,0.002327778,0.0002768279],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.001670755,0.0004039287,0.01421999,0.008394782,0.00008434681,0.003973095,0.1018887,0.006932846,0.1729766,0.0237,0.02706179,0.6386932],"study_design_scores_gemma":[0.000275418,0.0006038432,0.1578133,0.002487716,0.0003145382,0.00384638,0.04631741,0.09339608,0.1458811,0.01946096,0.5291846,0.0004186535],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7801127,0.005109657,0.1639031,0.001836758,0.0005291325,0.001232371,0.01519308,0.002700132,0.02938308],"genre_scores_gemma":[0.7440562,0.001985593,0.2173753,0.0001095783,0.0002110602,0.001384754,0.02605464,0.0008375862,0.00798521],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01028505,"threshold_uncertainty_score":0.02045035,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02239593382287337,"score_gpt":0.309573640430716,"score_spread":0.2871777066078426,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}