{"id":"W2158403176","doi":"10.1109/nlpke.2009.5313839","title":"Managing the Google Web 1T 5-gram data set","year":2009,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; n-gram; Set (abstract data type); Task (project management); Word (group theory); Measure (data warehouse); Information retrieval; World Wide Web; Database; Artificial intelligence; Programming language; Language model; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002077434,0.002095062,0.002000768,0.005772924,0.001854306,0.00330298,0.002392707,0.001376145,0.003284154],"category_scores_gemma":[0.01462742,0.0008404969,0.001267199,0.007039246,0.0008639737,0.007941964,0.003785155,0.002187526,0.004860999],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00146342,"about_ca_system_score_gemma":0.002540374,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01197451,"about_ca_topic_score_gemma":0.01127688,"domain_scores_codex":[0.9955146,0.000529173,0.000562282,0.0006962226,0.002275757,0.0004220021],"domain_scores_gemma":[0.9903527,0.002458538,0.0005508988,0.003504416,0.00274866,0.0003848644],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.004818313,0.0009825937,0.02842578,0.002283136,0.0004715851,0.003590857,0.002287111,0.02528059,0.09296758,0.0112035,0.2529789,0.5747101],"study_design_scores_gemma":[0.0004594055,0.0007668393,0.04328334,0.0003866395,0.0003482448,0.002499724,0.003321472,0.3004727,0.2440221,0.04153739,0.3618609,0.001041274],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4513521,0.002693255,0.1075064,0.003674701,0.001273471,0.002243236,0.2126714,0.1939544,0.02463114],"genre_scores_gemma":[0.4597346,0.001030298,0.203939,0.0005455076,0.0003429957,0.001363656,0.3201191,0.007212763,0.005712117],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01197451,"threshold_uncertainty_score":0.02380961,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03315036882611155,"score_gpt":0.3142550993607125,"score_spread":0.2811047305346009,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}