{"id":"W2250713394","doi":"10.3115/v1/w15-0705","title":"GutenTag: an NLP-driven Tool for Digital Humanities Research in the Project Gutenberg Corpus","year":2015,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":49,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Guelph","funders":"Natural Sciences and Engineering Research Council of Canada; Mitacs; University of Guelph","keywords":"Disk formatting; Metadata; Computer science; Digital humanities; Variety (cybernetics); Corpus linguistics; Natural language processing; World Wide Web; Software; Digital library; Artificial intelligence; Linguistics; Information retrieval; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006755293,0.00144547,0.001109004,0.009005688,0.002713979,0.005420538,0.002136003,0.001546753,0.04315591],"category_scores_gemma":[0.02240218,0.001475996,0.001222251,0.005944128,0.002002345,0.00813828,0.007390114,0.00292282,0.01294098],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001565292,"about_ca_system_score_gemma":0.004043123,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003852595,"about_ca_topic_score_gemma":0.005622163,"domain_scores_codex":[0.9966338,0.001396869,0.0003830124,0.0005989399,0.0008503082,0.0001370846],"domain_scores_gemma":[0.987927,0.00849448,0.0005205539,0.001762525,0.0008904053,0.0004049434],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005903705,0.0001822964,0.002792396,0.003084996,0.0002153609,0.001728938,0.01165598,0.005807428,0.02490014,0.1172362,0.3059878,0.5258181],"study_design_scores_gemma":[0.0001850118,0.00006146655,0.00172268,0.0004343781,0.00005988604,0.001014855,0.001740266,0.02356109,0.01742234,0.05693624,0.8966569,0.0002049244],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"software","genre_scores_codex":[0.007844079,0.0004945595,0.7523372,0.001536477,0.0004421098,0.001124774,0.02161955,0.186261,0.02834023],"genre_scores_gemma":[0.03756109,0.0005039815,0.8743688,0.0004343793,0.0001520646,0.002900278,0.03794365,0.03539218,0.01074344],"genre_candidate":"software","genre_consensus":null,"teacher_disagreement_score":0.04315591,"threshold_uncertainty_score":0.1443709,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2177205030712601,"score_gpt":0.4128816687996297,"score_spread":0.1951611657283696,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}