MétaCan
Menu
Retour à la cohorte
Enregistrement W7160593040 · doi:10.53842/juki.v6i2.681

Analisis Sentimen Berbasis Jaringan LSTM dan BERT terhadap Diskusi Twitter tentang Pemilu 2024

2024· article· W7160593040 sur OpenAlexaff
Muammar Khadapi, Victor Maruli Pakpahan

Notice bibliographique

RevueJUKI Jurnal Komputer dan Informatika · 2024
Typearticle
Langue
DomaineComputer Science
ThématiqueSentiment Analysis and Opinion Mining
Établissements canadiensKootenay Association for Science & Technology
Organismes subventionnairesnon disponible
Mots-clésDeep learning

Résumé

récupéré en direct d'OpenAlex

Pemilihan Umum (Pemilu) merupakan peristiwa politik penting yang memicu banyak diskusi di media sosial, terutama di platform seperti Twitter. Analisis sentimen dari diskusi ini dapat memberikan wawasan mengenai pandangan masyarakat terhadap calon, partai, serta isu-isu yang terkait. Penelitian ini berfokus pada penerapan dua model deep learning, yaitu Long Short-Term Memory (LSTM) dan Bidirectional Encoder Representations from Transformers (BERT), untuk menganalisis sentimen diskusi Twitter tentang Pemilu 2024. Kedua model ini dipilih karena kemampuan mereka dalam menangani data teks yang kompleks dan konteks bahasa alami. Dataset yang digunakan dalam penelitian ini terdiri dari ribuan tweet terkait Pemilu 2024, yang diklasifikasikan ke dalam tiga kategori sentimen, yaitu positif, negatif, dan netral. Data terlebih dahulu diproses melalui tahap pembersihan teks dan tokenisasi. Model LSTM dan BERT dilatih menggunakan dataset ini untuk memprediksi sentimen dengan fokus pada peningkatan akurasi prediksi. Hasil eksperimen menunjukkan bahwa model BERT secara konsisten memberikan performa yang lebih baik dibandingkan dengan LSTM. Model BERT berhasil mencapai akurasi validasi sebesar 76.48% pada epoch kedua, sedangkan model LSTM hanya mencapai akurasi maksimal 87 %. Meskipun demikian, model BERT mulai menunjukkan gejala overfitting pada epoch ketiga, dengan peningkatan nilai loss pada data validasi. Hal ini menunjukkan bahwa tuning lebih lanjut pada hyperparameter seperti jumlah epoch dan learning rate diperlukan untuk meningkatkan generalisasi model. Sementara itu, model LSTM menunjukkan stabilitas yang lebih baik, meskipun akurasinya lebih rendah, terutama dalam menangani dependensi konteks yang lebih sederhana. Secara keseluruhan, penelitian ini menegaskan bahwa model BERT lebih efektif dalam menangkap konteks kompleks pada teks Twitter terkait Pemilu 2024 dibandingkan dengan LSTM. Namun, tantangan seperti overfitting dan optimasi hyperparameter tetap menjadi perhatian utama. Untuk meningkatkan performa lebih lanjut, perlu dipertimbangkan teknik augmentasi data dan tuning hyperparameter yang lebih optimal. Penelitian ini juga membuka peluang untuk pengembangan model hibrida yang menggabungkan keunggulan LSTM dan BERT dalam analisis sentimen berbasis teks.

Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.

Comment cette classification a été obtenuedéplier

Prédiction machine sur la base complète

Imitation des enseignants

Ni prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.

score de la tête « metaresearch » (Codex)0,001
score de la tête « metaresearch » (Gemma)0,005
Version: metacan-v3-hybrid-931329e0061cStatut de validation: machine_predicted_unvalidated
Catégories candidatesaucune
Catégories consensuellesaucune
DomaineSignal candidat: aucune · Signal consensuel: aucune
Devis d'étudeSignal candidat: Simulation ou modélisation · Signal consensuel: aucune
GenreSignal candidat: Empirique · Signal consensuel: Empirique
Score de désaccord entre enseignants0,019
Score d'incertitude au seuil0,045

Scores du classifieur distillé par catégorie (deux têtes)

CatégorieCodexGemma
Métarecherche0,0010,005
Méta-épidémiologie (sens strict)0,0020,000
Méta-épidémiologie (sens large)0,0010,001
Bibliométrie0,0020,002
Études des sciences et des technologies0,0010,000
Communication savante0,0020,003
Science ouverte0,0010,001
Intégrité de la recherche0,0010,002
Charge utile insuffisante (le modèle a refusé de juger)0,0130,010

Scores machine (provisoires)

Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.

Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.

Tête enseignante Opus0,019
Tête enseignante GPT0,266
Écart entre enseignants0,247 · la distance entre les deux têtes enseignantes sur ce seul travail
Statut de validationscore_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découle

Classification

machine, non validée

Prédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.

Les modèles n’ont appliqué aucune catégorie : rien dans la taxonomie ne correspondait à ce travail.
Devis d'étudeSimulation ou modélisation
Domainenon disponible
GenreEmpirique

Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».

En bref

Citations0
Publié2024
Routes d'admission1
Résumé présentoui

Explorer davantage

Même revueJUKI Jurnal Komputer dan InformatikaMême sujetSentiment Analysis and Opinion MiningTravaux en français237 207