{"id":"W2952404326","doi":"10.48550/arxiv.1212.0146","title":"Efficient Community Detection in Large Networks using Content and Links","year":2012,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Complex Network Analysis Techniques","field":"Physics and Astronomy","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Science Foundation","keywords":"Jaccard index; Computer science; Data mining; Cosine similarity; False positive paradox; False positives and false negatives; Graph; Link analysis; Similarity (geometry); Cluster analysis; Information retrieval; Theoretical computer science; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001898512,0.001216031,0.001348635,0.005673498,0.001323629,0.001841274,0.002411028,0.001880795,0.001087263],"category_scores_gemma":[0.01244208,0.0007693875,0.0009545098,0.003762026,0.0009299939,0.004643155,0.002388802,0.001274025,0.001229576],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001029966,"about_ca_system_score_gemma":0.0009608334,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00308009,"about_ca_topic_score_gemma":0.005153271,"domain_scores_codex":[0.9977914,0.0005629631,0.00009207771,0.0005737392,0.0008304834,0.0001493397],"domain_scores_gemma":[0.9933457,0.003826983,0.0008125094,0.001021234,0.0007502754,0.0002433728],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004771145,0.000393072,0.01665944,0.0008296066,0.000440434,0.0008248393,0.0009031113,0.2974182,0.05282374,0.04291146,0.00946611,0.5768528],"study_design_scores_gemma":[0.00002512619,0.00005608157,0.001501935,0.00003261238,0.00003701177,0.0003036796,0.0001598871,0.9392865,0.009582483,0.04530013,0.003687653,0.00002685691],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02272263,0.0004017075,0.9738203,0.0001928795,0.00002833524,0.0001406226,0.0003002041,0.001429649,0.0009637428],"genre_scores_gemma":[0.2561494,0.0004054747,0.739485,0.0001661626,0.0001104167,0.0002415066,0.001657464,0.0002434144,0.001541235],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005673498,"threshold_uncertainty_score":0.0100404,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1054689615358689,"score_gpt":0.2158235239983439,"score_spread":0.1103545624624749,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}