{"id":"W7134898377","doi":"10.1109/icdmw69685.2025.00152","title":"SBAN: A Framework &amp; Multi-Dimensional Dataset for Large Language Model Pre-Training and Software Code Mining","year":2025,"lang":"","type":"article","venue":"","topic":"Software Engineering Research","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of New Brunswick","funders":"","keywords":"Software; Code (set theory); Source code; Software system; Modeling language; Key (lock); Data modeling","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00312803,0.002739734,0.0009801044,0.004912974,0.001339357,0.001955855,0.004566094,0.002429512,0.004681749],"category_scores_gemma":[0.01515767,0.0008831607,0.002291973,0.003527551,0.001100517,0.003326552,0.004566981,0.003722525,0.005634453],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001839275,"about_ca_system_score_gemma":0.002891321,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01466902,"about_ca_topic_score_gemma":0.03272391,"domain_scores_codex":[0.9973351,0.000743694,0.0002994121,0.0007469302,0.000673186,0.0002016265],"domain_scores_gemma":[0.9954159,0.002051664,0.0003416275,0.001267739,0.0006641623,0.000258922],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007664424,0.001079564,0.01738783,0.002087294,0.0005383673,0.0007272964,0.0007070299,0.0526114,0.009869468,0.02038156,0.5943213,0.2995225],"study_design_scores_gemma":[0.0004584305,0.0004104587,0.009889265,0.0003434398,0.0001557918,0.000796427,0.000585538,0.625846,0.01555108,0.05175665,0.293952,0.0002549097],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"methods","genre_scores_codex":[0.03891606,0.00210953,0.3913822,0.003250582,0.0007567847,0.001721201,0.4389115,0.116586,0.006366088],"genre_scores_gemma":[0.05182604,0.000440727,0.3194504,0.000745365,0.0001005723,0.002583693,0.6210698,0.001678765,0.002104577],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01466902,"threshold_uncertainty_score":0.02916729,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05074200444759836,"score_gpt":0.3609476775261825,"score_spread":0.3102056730785841,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}