{"id":"W4407251405","doi":"10.2139/ssrn.5128348","title":"Fasttalker: An Unified Framework for Generating Speech and Conversational Gestures from Text","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Speech and dialogue systems","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Gesture; Computer science; Speech recognition; Linguistics; Communication; Natural language processing; Psychology; Artificial intelligence; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.001509947,0.0003405832,0.0004209699,0.000206083,0.0003705539,0.0007621207,0.001203124,0.0004741035,0.0000068223],"category_scores_gemma":[0.0002393918,0.0003230684,0.0001691766,0.0001356127,0.00004507682,0.0002845354,0.0004566218,0.002938063,0.000004229033],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005310684,"about_ca_system_score_gemma":0.005048301,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004617948,"about_ca_topic_score_gemma":0.000785691,"domain_scores_codex":[0.9966998,0.0002000829,0.0004871118,0.0007263807,0.000394596,0.0014921],"domain_scores_gemma":[0.9982401,0.0003908828,0.00041264,0.0005578017,0.0002291816,0.0001694372],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00006406808,0.0000610244,0.0007450478,0.000044613,0.000441471,0.000008125363,0.0009875641,0.0007527522,0.000315051,0.9187452,0.0003825482,0.07745259],"study_design_scores_gemma":[0.0006013831,0.000187874,0.0002940073,0.0001485358,0.00004413775,0.0001116155,0.0004818905,0.02359575,0.0003211288,0.9731302,0.0007145191,0.0003689994],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05124527,0.004930065,0.9396709,0.001154113,0.002185037,0.0004355598,0.00006772945,0.00009817955,0.0002131428],"genre_scores_gemma":[0.6069502,0.00151135,0.3851169,0.0007343562,0.004531518,0.00006684165,0.000215912,0.00003955467,0.0008334184],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5557049,"threshold_uncertainty_score":0.9999222,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01667713250356856,"score_gpt":0.2719421316703564,"score_spread":0.2552649991667879,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}