{"id":"W2026355363","doi":"10.1145/1871437.1871527","title":"Index structures for efficiently searching natural language text","year":2010,"lang":"en","type":"article","venue":"","topic":"Algorithms and Data Compression","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Parsing; Index (typography); Scalability; Class (philosophy); Phrase; Natural language; Construct (python library); Granularity; Information retrieval; Question answering; Parse tree; Word (group theory); Term (time); Natural language processing; Artificial intelligence; Data mining; Database; World Wide Web; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002060571,0.0009480679,0.001391862,0.005659436,0.001395424,0.002714468,0.001927712,0.00109291,0.005326321],"category_scores_gemma":[0.01691903,0.0007387791,0.000693386,0.01225771,0.0009820042,0.009206203,0.00229147,0.001477023,0.004221992],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001003698,"about_ca_system_score_gemma":0.002060967,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002534186,"about_ca_topic_score_gemma":0.003093845,"domain_scores_codex":[0.9973496,0.0004355905,0.0004079255,0.0002962241,0.001397328,0.0001132492],"domain_scores_gemma":[0.9902111,0.004065773,0.0009627669,0.00261482,0.001936966,0.00020856],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005594261,0.0002974998,0.003340768,0.001412514,0.0001332961,0.0002554373,0.001040006,0.01070632,0.02288524,0.06167987,0.08325681,0.8144329],"study_design_scores_gemma":[0.0004797127,0.0009619999,0.004362592,0.0004521911,0.0002360831,0.002162649,0.001071699,0.3911722,0.074182,0.3105802,0.2140462,0.0002925138],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0356519,0.005799709,0.9085342,0.001099982,0.0003598733,0.001067352,0.0102827,0.02911931,0.008084986],"genre_scores_gemma":[0.09285698,0.002339639,0.8794253,0.000356065,0.0003279558,0.001016981,0.01829359,0.001358199,0.004025252],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005659436,"threshold_uncertainty_score":0.01781833,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.006454486159736561,"score_gpt":0.2758822414130412,"score_spread":0.2694277552533047,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}