{"id":"W2027081355","doi":"10.3115/1699648.1699697","title":"Character-level analysis of semi-structured documents for set expansion","year":2009,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":40,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Association of Canadian Universities for Research in Astronomy","keywords":"Set (abstract data type); Seal (emblem); Computer science; Character (mathematics); Independence (probability theory); Artificial intelligence; Character encoding; Natural language processing; Programming language; Mathematics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001237078,0.0006140267,0.000439674,0.004192177,0.0005125114,0.00131631,0.0005655891,0.0005315877,0.003630955],"category_scores_gemma":[0.008608109,0.0002149404,0.0006217583,0.003208796,0.0003739558,0.002731076,0.0006830735,0.0008580568,0.002967746],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006606612,"about_ca_system_score_gemma":0.0007703537,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00104091,"about_ca_topic_score_gemma":0.001815639,"domain_scores_codex":[0.9985813,0.0002953457,0.0001939301,0.0003016394,0.0005493925,0.00007844249],"domain_scores_gemma":[0.9918227,0.00410631,0.0007650748,0.001164429,0.001907263,0.0002342595],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006311464,0.0004265184,0.01792121,0.001213606,0.0001509837,0.0009167262,0.001296391,0.01533032,0.09480721,0.01280063,0.03058967,0.8239156],"study_design_scores_gemma":[0.00007149537,0.0003996231,0.03009316,0.0002310354,0.0001486615,0.002082726,0.001098329,0.7002153,0.1742351,0.01676229,0.07451085,0.000151453],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2277024,0.00153789,0.7113314,0.0007516298,0.0002796509,0.0009884002,0.01433642,0.03029257,0.01277965],"genre_scores_gemma":[0.3622825,0.0004312177,0.6170447,0.0001277028,0.0001116896,0.0003522572,0.01573407,0.0006815684,0.003234274],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004192177,"threshold_uncertainty_score":0.01214677,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02246672517775284,"score_gpt":0.3147622950714681,"score_spread":0.2922955698937153,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}