{"id":"W2113772893","doi":"10.1016/j.scico.2013.03.015","title":"Using heuristics to estimate an appropriate number of latent topics in source code analysis","year":2013,"lang":"en","type":"article","venue":"Science of Computer Programming","topic":"Software Engineering Research","field":"Computer Science","cited_by":39,"is_retracted":false,"has_abstract":false,"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Latent Dirichlet allocation; Source code; Topic model; Heuristics; Set (abstract data type); Locality; Cluster analysis; Code review; Code (set theory); KPI-driven code analysis; Software; Programming language; Theoretical computer science; Information retrieval; Static program analysis; Software development; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006223495,0.001541678,0.001999658,0.005413289,0.001719794,0.003174651,0.002280052,0.002720847,0.001654401],"category_scores_gemma":[0.03925086,0.001448033,0.002053682,0.003823862,0.001318767,0.004389585,0.00190302,0.003874375,0.0007225],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001833752,"about_ca_system_score_gemma":0.003327069,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01149352,"about_ca_topic_score_gemma":0.01797255,"domain_scores_codex":[0.9950288,0.002604074,0.0003225575,0.001087149,0.000532651,0.0004248293],"domain_scores_gemma":[0.9615428,0.03343609,0.001110277,0.001454951,0.001932054,0.0005239409],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00215426,0.001252885,0.03564565,0.0008120415,0.0008286635,0.0002937843,0.002005057,0.2527653,0.01981872,0.02619516,0.01466198,0.6435665],"study_design_scores_gemma":[0.000140466,0.00005520409,0.00267795,0.00004209265,0.0001140143,0.00006486457,0.0001818426,0.9671396,0.002837802,0.02600445,0.0007042755,0.00003749715],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05945667,0.0004781093,0.9372499,0.0002595281,0.00004116278,0.0001513719,0.0003178031,0.001621816,0.0004237025],"genre_scores_gemma":[0.4295899,0.0002581458,0.5659839,0.0002020913,0.00008717525,0.0005339192,0.002292583,0.0003777079,0.0006745976],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01149352,"threshold_uncertainty_score":0.03291339,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03221342878942683,"score_gpt":0.3421796663322614,"score_spread":0.3099662375428346,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}