{"id":"W4385573611","doi":"10.18653/v1/2022.emnlp-main.620","title":"Sequence Models for Document Structure Identification in an Undeciphered Script","year":2022,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada; Ministère de la Défense Nationale","keywords":"Computer science; Header; Natural language processing; Domain (mathematical analysis); Identification (biology); Artificial intelligence; Meaning (existential); Feature (linguistics); Information retrieval; Sequence (biology); Linguistics; Psychology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002183187,0.0006412984,0.0005665087,0.002286797,0.0006147163,0.001533863,0.001201947,0.001275501,0.003728704],"category_scores_gemma":[0.009909154,0.0004814021,0.0009358088,0.001632252,0.0008545524,0.002923985,0.0006940021,0.001895342,0.001979078],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001817455,"about_ca_system_score_gemma":0.001117697,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009691208,"about_ca_topic_score_gemma":0.0156779,"domain_scores_codex":[0.9992106,0.000332015,0.00004907797,0.0002534548,0.0000964259,0.00005830044],"domain_scores_gemma":[0.991796,0.006283554,0.0007021696,0.0004850822,0.0005908465,0.0001424959],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0004820045,0.0002233823,0.01048804,0.0002744457,0.000121433,0.0004196847,0.001356309,0.7237296,0.006401208,0.1065487,0.005719864,0.1442354],"study_design_scores_gemma":[0.000006134265,0.00001453975,0.0004790674,0.00001081612,0.000005858265,0.00003015814,0.00003031518,0.9739645,0.000441248,0.02420513,0.0008050489,0.000007202505],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1402631,0.0007817711,0.8492609,0.001040719,0.00008513033,0.0001736054,0.001803649,0.001784735,0.004806469],"genre_scores_gemma":[0.7552058,0.0005751143,0.2238409,0.0002963847,0.0001694904,0.000475476,0.004935931,0.000408706,0.01409209],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009691208,"threshold_uncertainty_score":0.01926959,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03701979092510937,"score_gpt":0.3200339211502506,"score_spread":0.2830141302251412,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}