{"id":"W4388184947","doi":"10.48550/arxiv.2310.20558","title":"Breaking the Token Barrier: Chunking and Convolution for Efficient Long Text Classification with BERT","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research; Alliance de recherche numérique du Canada","keywords":"Computer science; Chunking (psychology); Inference; Security token; Artificial intelligence; Benchmark (surveying); Machine learning","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004331319,0.0001961947,0.0001779543,0.0001469713,0.000370572,0.000186496,0.0009035985,0.000144463,0.000001507642],"category_scores_gemma":[0.00003337211,0.0001692986,0.00007444849,0.0002950164,0.00009805222,0.000161773,0.0009151851,0.0002884784,0.000007091365],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001805833,"about_ca_system_score_gemma":0.0001330176,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001745174,"about_ca_topic_score_gemma":0.0001267798,"domain_scores_codex":[0.9984896,0.00007190499,0.0001557352,0.0009039515,0.0001031014,0.0002757495],"domain_scores_gemma":[0.9984942,0.0002082569,0.0002178504,0.0008642852,0.0001412476,0.00007414333],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003229424,0.00002233393,0.008775083,0.0001228763,0.00007892982,0.00002695223,0.001075764,0.7681407,0.00005877525,0.2172974,0.0000426014,0.004326306],"study_design_scores_gemma":[0.0002900876,0.00002150983,0.01245102,0.0001332043,0.00005233356,0.000005231584,0.0001550324,0.9817247,0.00003284091,0.004783292,0.0001355884,0.0002151786],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2516098,0.00003735663,0.7469495,0.0003241005,0.000272762,0.0004474005,0.000004578412,0.0001711869,0.0001833216],"genre_scores_gemma":[0.9969178,0.00003110825,0.002395406,0.0000523303,0.00007632895,0.000005792159,0.000008989311,0.00001713337,0.0004950591],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.745308,"threshold_uncertainty_score":0.6903795,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1038989451188537,"score_gpt":0.199709248229643,"score_spread":0.09581030311078935,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}