PENDEKATAN BARU STEMMING KATA DAN AUGMENTASI DATA TEKS PADA BAHASA LAMPUNG SEBAGAI LOW-RESOURCE LANGUAGE

Zaenal , Abidin (2026) PENDEKATAN BARU STEMMING KATA DAN AUGMENTASI DATA TEKS PADA BAHASA LAMPUNG SEBAGAI LOW-RESOURCE LANGUAGE. [Dataset]

[img]
Preview
Text (Abstrak)
13 ABSTRAK FINAL S PROMOSI.pdf

Download (239kB) | Preview
[img] Text (Disertasi)
FINAL OK Gabungan Semua 2026.pdf
Restricted to Repository staff only

Download (5MB) | Request a copy
[img]
Preview
Text (Disertasi Tanpa Bab 4)
FINAL OK Gabungan Semua 2026 Tanpa BAB 4.pdf

Download (4MB) | Preview

Abstract

Penelitian ini mengembangkan pendekatan natural language processing (NLP) untuk bahasa Lampung berfokus pada stemming kata dialek Tulang Bawang dan Lampung Language Dialect Identification (LLDI) pada dialek Api dan Nyo. Untuk stemming kata, lima modifikasi metode diuji secara komparatif: modifikasi Nazief-Adriani (MNA), modifikasi Confix-Stripping (MCS), MCS disertai N-Gram Stemming, Morphological-based, dan N-Gram Stemming. Eksperimen pada 500 kata data uji dan 200 kata independen menunjukkan MCS disertai N-Gram Stemming mencapai performa terbaik dengan nilai Gold Standard Assessment (GSA) 98,8%. Pendekatan terbaik dari stemming kata diimplementasikan pada aplikasi Direct Machine Translation (DMT) Tulang Bawang–Indonesia dan hasil pengujian penerjemahan menunjukan nilai Bilingual Evaluation Understudy (BLEU) mencapai 80,07%. Untuk identifikasi dialek, model LLDI dibangun menggunakan data set 3000 kalimat dialek Api dan 9078 kalimat dialek Nyo. Text Data Augmentation (TDA) melalui metode permutasi kalimat diterapkan untuk mengatasi ketidakseimbangan data, menghasilkan data set sintesis sebesar n! dari n token sebuah kalimat. Empat pendekatan klasifikasi—Naive Bayes, Logistic Regression, Support Vector Machine (SVM), dan Random Forest—dievaluasi menggunakan 5-fold cross validation. Hasil eksperimen menunjukkan SVM balanced class mencapai performa tertinggi dengan akurasi 97,4%, diikuti Random Forest balanced class dengan akurasi 96,9%. Penyeimbangan kelas terbukti meningkatkan deteksi dialek minoritas (Api) tanpa mengorbankan performa dialek mayoritas (Nyo). Sebaliknya, kondisi unbalanced menghasilkan precision tinggi namun recall rendah untuk dialek Api. Penelitian ini memberikan kontribusi awal yang signifikan dalam pengembangan Natural Language Understanding (NLU) pada bahasa Lampung dan berpotensi dilanjutkan pada penelitian fonologi, sintaksis, semantik dan pragmatik bahasa Lampung secara komputasi.

Item Type: Dataset
Subjects: ?? 005 ??
Divisions: ?? 21 ??
Depositing User: 2602966666 Digilib
Date Deposited: 30 Apr 2026 04:26
Last Modified: 30 Apr 2026 04:26
URI: http://digilib.unila.ac.id/id/eprint/98855

Actions (login required)

View Item View Item