{"id":"W4293053484","doi":"10.1109/civemsa53371.2022.9853712","title":"Towards a Vowel Formant Based Quality Metric for Text-to-Speech Systems: Measuring Monophthong Naturalness","year":2022,"lang":"en","type":"article","venue":"","topic":"Speech and Audio Processing","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Formant; Naturalness; Computer science; Metric (unit); Vowel; Speech recognition; Quality (philosophy); Set (abstract data type); Variation (astronomy); Mean opinion score; Sound quality; Psychoacoustics; Artificial intelligence; Perception","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002253387,0.0002165046,0.0003324437,0.000500431,0.0007470836,0.0004658049,0.001474175,0.00004563699,0.00002340818],"category_scores_gemma":[0.0002637459,0.0001903192,0.0001486323,0.002008541,0.00001222967,0.0006074207,0.000605121,0.0002199585,0.00001384259],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000316046,"about_ca_system_score_gemma":0.0002759334,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002755327,"about_ca_topic_score_gemma":0.00001217527,"domain_scores_codex":[0.9972914,0.0001427985,0.0004679609,0.0006213791,0.0008921273,0.0005842808],"domain_scores_gemma":[0.9986098,0.0002067942,0.0001749353,0.0005850742,0.000231349,0.0001920214],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000270252,0.0005926253,0.001627409,0.001520056,0.0001495167,0.0001013058,0.002427687,0.033817,0.02276333,0.01285912,0.006207654,0.9176641],"study_design_scores_gemma":[0.002833589,0.0005400676,0.006076269,0.0001204394,0.00003404226,0.0001393008,0.001277599,0.5514097,0.4157956,0.001926295,0.01816491,0.001682155],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04616589,0.000485312,0.9480045,0.001218671,0.001045022,0.0007263803,0.00001411704,0.0004452517,0.001894895],"genre_scores_gemma":[0.8580005,5.652549e-7,0.1400661,0.000868644,0.00007294994,0.0003665108,0.000004177816,0.00001743285,0.0006031278],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9159819,"threshold_uncertainty_score":0.7760993,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05318697439513604,"score_gpt":0.3007061767012467,"score_spread":0.2475192023061107,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}