{"id":"W4408345963","doi":"10.1109/icassp49660.2025.10889667","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping","year":2025,"lang":"en","type":"article","venue":"","topic":"Face recognition and analysis","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Face (sociological concept); Computer science; Speech recognition; Speech synthesis; Zero (linguistics); Shot (pellet); Artificial intelligence; Computer vision; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003129077,0.0004855437,0.0003002623,0.0002307022,0.0001133047,0.0003267312,0.0004764078,0.0004169438,0.003517886],"category_scores_gemma":[0.0009037456,0.0001253229,0.0003921242,0.000111468,0.0002175212,0.0005068888,0.0005184129,0.0003832061,0.001456661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000155223,"about_ca_system_score_gemma":0.0001880764,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006212155,"about_ca_topic_score_gemma":0.000873572,"domain_scores_codex":[0.9998499,0.00003674722,0.000006414738,0.00004002232,0.00005538481,0.00001139129],"domain_scores_gemma":[0.9997495,0.0001296223,0.00001358571,0.00004034586,0.0000487515,0.00001816854],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0006772878,0.0002023448,0.0007672865,0.0002041406,0.00006575623,0.0002664708,0.000165886,0.07977175,0.3123097,0.004373378,0.003500839,0.5976951],"study_design_scores_gemma":[0.00003858321,0.0003370933,0.0009024423,0.00001406711,0.00003114354,0.000376443,0.00004560552,0.8459849,0.143775,0.002891388,0.005575486,0.00002778808],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.057293,0.0002960312,0.9356705,0.0001287203,0.0001452352,0.00007544725,0.0002006087,0.002151178,0.004039165],"genre_scores_gemma":[0.5548826,0.0004195257,0.4312997,0.0002607644,0.0001134373,0.0001887514,0.0008803474,0.0004989865,0.01145594],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003517886,"threshold_uncertainty_score":0.01176852,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01777450166422592,"score_gpt":0.2459365036945091,"score_spread":0.2281620020302831,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}