{"id":"W3088789516","doi":"10.3390/s20195559","title":"Fusing Visual Attention CNN and Bag of Visual Words for Cross-Corpus Speech Emotion Recognition","year":2020,"lang":"en","type":"article","venue":"Sensors","topic":"Emotion and Mood Recognition","field":"Psychology","cited_by":34,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institute for Information and Communications Technology Promotion; Ministry of Science and ICT, South Korea; Iran Telecommunication Research Center","keywords":"Computer science; Convolutional neural network; Utterance; Spectrogram; Speech recognition; Artificial intelligence; Feature (linguistics); Pattern recognition (psychology); Bag-of-words model in computer vision; Channel (broadcasting); Generalization; Histogram; Natural language processing; Visual Word; Image (mathematics); Image retrieval; Mathematics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006044703,0.002024873,0.001010084,0.001176951,0.0002670685,0.0006385007,0.001108758,0.0007201682,0.002557623],"category_scores_gemma":[0.001213043,0.0003132334,0.0007609504,0.0006323936,0.000271788,0.001348854,0.001279542,0.0008601651,0.001615112],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006835359,"about_ca_system_score_gemma":0.0005182909,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00945526,"about_ca_topic_score_gemma":0.0146463,"domain_scores_codex":[0.9994351,0.00005856344,0.00003130278,0.0002394339,0.000127956,0.0001075284],"domain_scores_gemma":[0.9996321,0.00007609471,0.00003109793,0.00007185468,0.0001582653,0.00003060734],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006632749,0.000382731,0.003453673,0.0001835577,0.0002303664,0.0002347031,0.0001056641,0.02527022,0.06404507,0.0008202214,0.01199885,0.8926116],"study_design_scores_gemma":[0.00004487735,0.0003637137,0.007405548,0.00003974556,0.0002084728,0.0002380457,0.0001429176,0.9449664,0.0380315,0.002415495,0.006091687,0.0000516154],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3550504,0.007591441,0.5965343,0.0006375507,0.001313528,0.00039438,0.002580547,0.01918277,0.01671508],"genre_scores_gemma":[0.8701001,0.001227056,0.1038435,0.000822935,0.0002405236,0.0002477143,0.007949414,0.0003774981,0.01519126],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00945526,"threshold_uncertainty_score":0.01880044,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05612792339920404,"score_gpt":0.3633029550649556,"score_spread":0.3071750316657516,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}