{"id":"W4415898436","doi":"10.48550/arxiv.2503.06211","title":"Late Fusion and Multi-Level Fission Amplify Cross-Modal Transfer in Text-Speech LMs","year":2025,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Speech Recognition and Synthesis","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Principle of compositionality; Feature (linguistics); Representation (politics); Process (computing); Hierarchy; Modality (human–computer interaction); Transfer (computing)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003235913,0.0003357507,0.0003706447,0.0005465238,0.0001726063,0.0002053161,0.001007302,0.0005325663,0.00009752309],"category_scores_gemma":[0.00004716701,0.0003646277,0.000151574,0.0005693472,0.0001101943,0.0003511255,0.001147005,0.0006857465,0.00005296397],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001358866,"about_ca_system_score_gemma":0.0001551786,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003388295,"about_ca_topic_score_gemma":0.0003146679,"domain_scores_codex":[0.9978992,0.0001663085,0.0002647445,0.001219297,0.00009956152,0.0003509321],"domain_scores_gemma":[0.9987783,0.0001731505,0.00007113517,0.0006877393,0.0001164118,0.000173219],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000784929,0.002418974,0.08371036,0.001430565,0.0004618592,0.003985883,0.003932747,0.02628531,0.004619989,0.06927523,0.000931414,0.8021628],"study_design_scores_gemma":[0.002916465,0.00005456999,0.08140884,0.0007555294,0.0000624576,0.00001459218,0.00008174092,0.8956287,0.003666238,0.01265107,0.00163115,0.001128651],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.620824,0.00006302082,0.3761752,0.0001255891,0.0003608759,0.0003231011,0.00007303851,0.0001676248,0.001887466],"genre_scores_gemma":[0.9832122,0.0007033765,0.009752463,0.0002393943,0.00002599695,0.000001949677,0.00002047176,0.00001297961,0.006031138],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8693434,"threshold_uncertainty_score":0.9998806,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1290470316641667,"score_gpt":0.2367942662393476,"score_spread":0.1077472345751809,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}