{"id":"W4323076538","doi":"10.48550/arxiv.2303.01410","title":"NLP Workbench: Efficient and Extensible Integration of State-of-the-art Text Mining Tools","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Alliance de recherche numérique du Canada","keywords":"Workbench; Computer science; Parsing; Extensibility; License; MIT License; Artificial intelligence; Architecture; Sentiment analysis; Natural language processing; Information retrieval; Visualization; Programming language","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002884344,0.002262995,0.001243922,0.004837975,0.001045676,0.003371469,0.003412203,0.001237802,0.01484363],"category_scores_gemma":[0.008679477,0.001353894,0.001500566,0.003391456,0.0008516929,0.006230066,0.004396885,0.001946899,0.01325499],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008233242,"about_ca_system_score_gemma":0.002248125,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00423219,"about_ca_topic_score_gemma":0.004850595,"domain_scores_codex":[0.9979785,0.0003189288,0.0002792495,0.0006075756,0.0006881356,0.000127628],"domain_scores_gemma":[0.9966142,0.001592326,0.0001766593,0.0007916372,0.0005727214,0.0002524377],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00111319,0.0005914471,0.003942317,0.001443933,0.0004198038,0.001820073,0.001528522,0.01071071,0.03384821,0.01527986,0.3750771,0.5542249],"study_design_scores_gemma":[0.0005534535,0.0003253028,0.003314633,0.0003462173,0.0001841257,0.001142703,0.0007693145,0.3847057,0.07255174,0.04844322,0.487355,0.0003085514],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"software","genre_scores_codex":[0.007475762,0.0005222841,0.6325516,0.0005570353,0.0003084802,0.000864651,0.01375074,0.3352414,0.008727998],"genre_scores_gemma":[0.07480907,0.001176318,0.7574185,0.0007486045,0.0002835525,0.002144431,0.1118647,0.03393842,0.01761638],"genre_candidate":"software","genre_consensus":null,"teacher_disagreement_score":0.01484363,"threshold_uncertainty_score":0.04965693,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1328943223983594,"score_gpt":0.2043208972299189,"score_spread":0.07142657483155954,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}