{"id":"W4413230213","doi":"10.18280/isi.300606","title":"Performance Evaluation of Text Embedding Models for Ambiguity Classification in Indonesian News Corpus: A Comparative Study of TF-IDF, Word2Vec, FastText BERT, and GPT","year":2025,"lang":"en","type":"article","venue":"Ingénierie des systèmes d information","topic":"Data Mining and Machine Learning Applications","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Word2vec; Ambiguity; Indonesian; Artificial intelligence; Natural language processing; Computer science; Information retrieval; Embedding; Linguistics; Philosophy","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004734387,0.002128669,0.001432717,0.00306652,0.0006190617,0.001305365,0.0008545601,0.001163466,0.0007511518],"category_scores_gemma":[0.01118303,0.0003442898,0.001016375,0.001976881,0.0004434141,0.002894534,0.0008761428,0.001351752,0.001001266],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009530739,"about_ca_system_score_gemma":0.001038579,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01256311,"about_ca_topic_score_gemma":0.01091859,"domain_scores_codex":[0.9974869,0.001058409,0.0002637493,0.000528633,0.0004741479,0.0001881847],"domain_scores_gemma":[0.9930065,0.004558431,0.0003448859,0.0004628702,0.001354134,0.0002733312],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003420597,0.001412131,0.03668641,0.001191851,0.0008524642,0.0003377515,0.0005453118,0.1084484,0.01084422,0.001150665,0.01859862,0.8165116],"study_design_scores_gemma":[0.00007086019,0.0006137121,0.008275332,0.00005834656,0.0001547506,0.0001726549,0.0002878642,0.9803377,0.007897675,0.000633645,0.001445096,0.00005232157],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8967138,0.009677062,0.07773753,0.0009323825,0.0007604168,0.0002275208,0.003382692,0.006390336,0.004178157],"genre_scores_gemma":[0.8982944,0.002221337,0.081469,0.0001829288,0.0002200031,0.0002148373,0.01450407,0.0002500071,0.002643529],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01256311,"threshold_uncertainty_score":0.02503812,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05522518239788383,"score_gpt":0.330857235527801,"score_spread":0.2756320531299172,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}