{"id":"W2398419065","doi":"","title":"Characterizing In-text Citations using N-gram Distributions","year":2015,"lang":"en","type":"preprint","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Citation; Rhetorical question; Computer science; Information retrieval; Metadata; Natural language processing; Linguistics; Citation analysis; Artificial intelligence; World Wide Web; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.003981722,0.00125279,0.001996689,0.01172961,0.002006192,0.004670087,0.001249572,0.00309956,0.004649213],"category_scores_gemma":[0.04828792,0.0005151599,0.001105832,0.01171421,0.001023794,0.006825316,0.00208733,0.002094299,0.004080205],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001355812,"about_ca_system_score_gemma":0.001594706,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002428343,"about_ca_topic_score_gemma":0.003831486,"domain_scores_codex":[0.995865,0.001688501,0.0003745155,0.0007517153,0.0009346995,0.000385595],"domain_scores_gemma":[0.9434935,0.04521718,0.003436325,0.002349535,0.004208138,0.001295338],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002230546,0.001174438,0.1035707,0.002584446,0.0008684678,0.002422588,0.002483007,0.09817161,0.04715884,0.08774626,0.0604879,0.5911013],"study_design_scores_gemma":[0.00008412635,0.0002728758,0.02187784,0.0001884784,0.0002394426,0.001074478,0.0005421806,0.8199065,0.01003237,0.1307346,0.01493268,0.0001143541],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4184772,0.009979811,0.5377139,0.005701274,0.001245199,0.0002731854,0.009282138,0.005439568,0.01188764],"genre_scores_gemma":[0.9425687,0.003028095,0.03627842,0.0004091677,0.002816295,0.000203432,0.00676366,0.0005002593,0.00743207],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9960183,"threshold_uncertainty_score":0.02105761,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04274793880720133,"score_gpt":0.2711949104622968,"score_spread":0.2284469716550955,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}