{"id":"W4415600217","doi":"10.20944/preprints202510.2064.v1","title":"Monosemantic Feature Neurons: A Sparse Autoencoding Layer for Interpretable, Steerable Transformer Features","year":2025,"lang":"","type":"preprint","venue":"Preprints.org","topic":"Generative Adversarial Networks and Image Synthesis","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Bell (Canada)","funders":"","keywords":"Interpretability; Transformer; Heuristics; Bottleneck; Computation; Residual; ENCODE; Pattern recognition (psychology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":["metaepi_narrow"],"category_scores_codex":[0.002215399,0.001898985,0.002228273,0.0006792006,0.001220165,0.0008380018,0.004909407,0.001292657,0.0006092495],"category_scores_gemma":[0.0009341512,0.001916493,0.001776862,0.001064598,0.0003092558,0.001434894,0.00323924,0.003048811,0.0003378467],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004013086,"about_ca_system_score_gemma":0.00118803,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004173766,"about_ca_topic_score_gemma":0.0001391842,"domain_scores_codex":[0.9896308,0.0009153557,0.001644492,0.004752635,0.0009003056,0.002156381],"domain_scores_gemma":[0.992612,0.001029836,0.0008874121,0.004012774,0.0009125677,0.0005454217],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002876121,0.003058508,0.03946399,0.00780534,0.007222235,0.0002302834,0.03115869,0.6602193,0.1006485,0.01565104,0.02537062,0.1062954],"study_design_scores_gemma":[0.002993481,0.0003034525,0.03643285,0.004976316,0.00157592,0.00006429694,0.0004234517,0.6281726,0.1960773,0.006241936,0.1188337,0.003904775],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0165715,0.002599278,0.9292746,0.008591649,0.0113321,0.006933949,0.0003088733,0.0005351203,0.02385298],"genre_scores_gemma":[0.9086381,0.002004676,0.03020047,0.001473047,0.0009573063,0.001249105,0.00005964639,0.000120425,0.05529721],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8990741,"threshold_uncertainty_score":0.9993754,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09834803971921124,"score_gpt":0.3331170462294064,"score_spread":0.2347690065101952,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}