{"id":"W4411174920","doi":"10.1007/s11192-025-05339-6","title":"Mapping the unseen in practice: comparing latent Dirichlet allocation and BERTopic for navigating topic spaces","year":2025,"lang":"en","type":"article","venue":"Scientometrics","topic":"Computational and Text Analysis Methods","field":"Social Sciences","cited_by":6,"is_retracted":false,"has_abstract":false,"ca_institutions":"Université du Québec à Montréal; Université de Montréal","funders":"Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung","keywords":"Latent Dirichlet allocation; Topic model; Computer science; Data science; Information retrieval","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["bibliometrics"],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.02142833,0.001439344,0.00173252,0.007230429,0.001602567,0.004057971,0.002861492,0.003307279,0.002958966],"category_scores_gemma":[0.1333465,0.0007000196,0.00173345,0.003615439,0.002114123,0.01245547,0.006525296,0.003588392,0.000978166],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002152982,"about_ca_system_score_gemma":0.002247107,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01449412,"about_ca_topic_score_gemma":0.01254631,"domain_scores_codex":[0.9877117,0.009398458,0.0004839997,0.001425155,0.0006939408,0.0002866803],"domain_scores_gemma":[0.8546899,0.1339334,0.00162218,0.006268909,0.002212046,0.001273624],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.009958333,0.001827415,0.04296476,0.002833538,0.001964236,0.0001526851,0.006855904,0.3216303,0.002649803,0.0412706,0.007914989,0.5599775],"study_design_scores_gemma":[0.0002095138,0.0004651734,0.004302834,0.0001277809,0.0002190873,0.00007269226,0.001143955,0.9307411,0.00110321,0.06000768,0.001516865,0.00009014075],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.4122415,0.005557707,0.571501,0.001643022,0.000238663,0.0004242992,0.001182571,0.002560852,0.00465036],"genre_scores_gemma":[0.8682662,0.001057362,0.1254942,0.0002005295,0.0001445139,0.0003351706,0.002516707,0.0004617503,0.001523671],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9927696,"threshold_uncertainty_score":0.1133252,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1049383044834109,"score_gpt":0.4485186821781035,"score_spread":0.3435803776946926,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}