{"id":"W2860074735","doi":"10.1371/journal.pone.0197775","title":"Words by the tail: Assessing lexical diversity in scholarly titles using frequency-rank distribution tail fits","year":2018,"lang":"en","type":"article","venue":"PLoS ONE","topic":"scientometrics and bibliometrics research","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Montréal; Université de Montréal","funders":"","keywords":"Zipf's law; Word lists by frequency; Discipline; Scientometrics; Microdata (statistics); Rank (graph theory); Diversity (politics); Computer science; Statistics; Social science; Natural language processing; Mathematics; Sociology; Library science; Population; Demography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","bibliometrics","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.01081955,0.0001123051,0.0002223587,0.00555535,0.00100426,0.004039407,0.001729061,0.0001350074,0.0006192611],"category_scores_gemma":[0.0230588,0.00007281365,0.00006344404,0.06483669,0.0003803896,0.001966419,0.001233418,0.0004496445,0.0003491214],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002763224,"about_ca_system_score_gemma":0.0001499927,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007959965,"about_ca_topic_score_gemma":0.000102799,"domain_scores_codex":[0.9918067,0.0003215212,0.0003783129,0.0004998389,0.006493252,0.0005003159],"domain_scores_gemma":[0.9959375,0.001381028,0.0001479947,0.0005130005,0.001819478,0.0002009961],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00002185272,0.0009976517,0.9316332,0.000007302168,0.00003734446,0.00001218257,0.0002585727,0.000002410319,0.03956505,0.0005414305,0.008738434,0.01818455],"study_design_scores_gemma":[0.001336115,0.0003685207,0.9061773,0.00020706,0.00006597401,0.000005941981,0.001304353,0.03484369,0.02770216,0.02355316,0.003770682,0.000665033],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9904807,0.0004313676,0.004821667,0.001090281,0.0001231717,0.0001591643,0.00009061061,0.00001911466,0.002783885],"genre_scores_gemma":[0.9979662,0.00004047587,0.001154963,0.0000955817,0.0001219984,0.000002273397,0.00001121421,0.000006091522,0.0006012181],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05928134,"threshold_uncertainty_score":0.9969945,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.686871493058404,"score_gpt":0.5087649493474646,"score_spread":0.1781065437109394,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}