{"id":"W2965484644","doi":"10.48550/arxiv.1907.11843","title":"Analyzing Linguistic Complexity and Scientific Impact","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Citation; Proxy (statistics); Scientific literature; Scientific writing; Context (archaeology); Scientific communication; Linguistics; Linguistic context; Linguistic sequence complexity; Linguistic analysis; Psychology; Computer science; Library science; History; Biology; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0004253107,0.0002693284,0.0003392299,0.0003574789,0.0002465829,0.0005272964,0.001513605,0.0001688483,0.00001890473],"category_scores_gemma":[0.00007616178,0.0002968453,0.0001730496,0.0004664506,0.0002047857,0.0002384806,0.002955227,0.0005052986,0.00006088116],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002127729,"about_ca_system_score_gemma":0.0002889285,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003333897,"about_ca_topic_score_gemma":0.00004776994,"domain_scores_codex":[0.9978472,0.00009913423,0.0001782856,0.001411568,0.00009396457,0.0003698434],"domain_scores_gemma":[0.9977039,0.00009183217,0.0001966482,0.001635689,0.0001835495,0.0001884502],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001307213,0.00006030534,0.04596511,0.0001907542,0.000132378,0.0002099304,0.0008076987,0.5724089,0.00005485717,0.3791069,0.0001137009,0.0009364113],"study_design_scores_gemma":[0.0001877657,0.00001733354,0.004533009,0.00007536056,0.00003467739,0.000004192171,0.00001325666,0.9182514,0.00001014448,0.07646394,0.0001033272,0.0003055696],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4621366,0.0001211707,0.5359655,0.00002093313,0.0007386501,0.0001314158,0.000008278414,0.0001159832,0.0007614631],"genre_scores_gemma":[0.9939121,0.00002230936,0.004907118,0.00001374951,0.00007452934,1.571838e-7,0.00001025285,0.0000110586,0.00104873],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.5317755,"threshold_uncertainty_score":0.9999484,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1372479509848239,"score_gpt":0.2273120980192345,"score_spread":0.0900641470344106,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}