{"id":"W2579773546","doi":"","title":"Reddit Temporal N-gram Corpus and its Applications on Paraphrase and Semantic Similarity in Social Media using a Topic-based Latent Semantic Analysis.","year":2016,"lang":"en","type":"article","venue":"International Conference on Computational Linguistics","topic":"Topic Modeling","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Paraphrase; Computer science; Latent semantic analysis; SemEval; Natural language processing; Artificial intelligence; Social media; Semantic similarity; Similarity (geometry); n-gram; Probabilistic latent semantic analysis; Text corpus; Information retrieval; Language model; World Wide Web","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001464942,0.000792904,0.0005350296,0.004571416,0.001705727,0.001096527,0.001106884,0.0009626879,0.005859961],"category_scores_gemma":[0.01249801,0.0002878903,0.0005627694,0.004906395,0.0007282395,0.002960093,0.002502844,0.001221627,0.003157371],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007703181,"about_ca_system_score_gemma":0.001119867,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004380808,"about_ca_topic_score_gemma":0.009902752,"domain_scores_codex":[0.9981389,0.0008981363,0.0001549295,0.0003037885,0.0004250725,0.00007927178],"domain_scores_gemma":[0.9943094,0.002971546,0.0003299818,0.001066025,0.001126189,0.0001968366],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002106715,0.001324917,0.01241132,0.003177935,0.0002507954,0.002362316,0.004167434,0.01667503,0.0612298,0.0300867,0.1402463,0.7259607],"study_design_scores_gemma":[0.0003820535,0.0007674061,0.04463049,0.0004854846,0.0001678691,0.003390463,0.004385207,0.6219219,0.06434038,0.04279044,0.2164014,0.000336938],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.441826,0.004779739,0.4074822,0.002483645,0.001251,0.001784258,0.09786966,0.01639821,0.02612524],"genre_scores_gemma":[0.5147017,0.0009896682,0.3390464,0.0002622823,0.0003332823,0.002542671,0.1337813,0.0009644694,0.007378113],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005859961,"threshold_uncertainty_score":0.01960355,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08700156074749933,"score_gpt":0.3337642859727162,"score_spread":0.2467627252252169,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}