{"id":"W1979786964","doi":"10.1109/scam.2010.22","title":"Estimating the Optimal Number of Latent Concepts in Source Code Analysis","year":2010,"lang":"en","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":61,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Latent Dirichlet allocation; Computer science; Source code; Latent variable; Code (set theory); Topic model; Latent semantic analysis; Software; Natural language processing; Data mining; Artificial intelligence; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01699813,0.00144488,0.002805508,0.003444801,0.002327067,0.003734952,0.003802265,0.004708469,0.001412913],"category_scores_gemma":[0.09411599,0.002229939,0.00273088,0.003068541,0.004078613,0.01058156,0.004663153,0.00632225,0.0009075566],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002878911,"about_ca_system_score_gemma":0.003027292,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007541207,"about_ca_topic_score_gemma":0.008112636,"domain_scores_codex":[0.9880553,0.007348182,0.0005870724,0.002449513,0.0008877083,0.0006722877],"domain_scores_gemma":[0.9058748,0.08205476,0.002477566,0.005592824,0.002615715,0.001384322],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003571478,0.001570084,0.03426526,0.0008556098,0.0005396176,0.0003650379,0.003874918,0.6229728,0.01231813,0.04896594,0.006878625,0.2638225],"study_design_scores_gemma":[0.0001644449,0.00009290792,0.001822687,0.0000692534,0.00006193743,0.00007637085,0.0002829067,0.9375305,0.002208162,0.05701046,0.0006214863,0.00005880291],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2352991,0.0008679708,0.7600635,0.001158542,0.00004699319,0.0002462009,0.0005658463,0.001076847,0.0006750573],"genre_scores_gemma":[0.5985008,0.0004779832,0.3967328,0.0003314372,0.0001084433,0.0006588862,0.002135999,0.0003473086,0.0007063224],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01699813,"threshold_uncertainty_score":0.08989578,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01564829991397315,"score_gpt":0.3161577286747401,"score_spread":0.3005094287607669,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}