EVALUASI PERFORMA TF-IDF, WORD2VEC, DAN INDOBERT PADA RETRIEVAL BERITA TOPIK ASTA CITA

Authors

  • Ayu Lintang Pratiwi UPN "Veteran" Jawa Timur
  • Abdul Rezha Efrat Najaf UPN "Veteran" Jawa Timur
  • Reisa Permatasari UPN "Veteran" Jawa Timur

DOI:

https://doi.org/10.32699/biner.v5i2.11549

Keywords:

Asta Cita, Representasi Teks, Evaluasi, Information Retrieval, Relevansi Dokumen

Abstract

Peningkatan pemberitaan digital mengenai Asta Cita menghasilkan beragamnya informasi, sehingga diperlukan proses retrieval untuk menghasilkan dokumen yang relevan sesuai dengan kebutuhan pencarian. Perbedaan karakteristik model representasi teks TF-IDF, Word2Vec, IndoBERT menjadi dasar dari penelitian ini untuk mengevaluasi dan membandingkan performa dari ketiga model tersebut pada korpus berita Asta Cita. Data yang digunakan berasal dari web scraping dengan jumlah 1338 dokumen berita dan rentang tahun 2024-2026. Data dilakukan  tahapan preprocessing dan diperoleh 1311 dokumen berita. Dokumen direpresentasikan menggunakan TF-IDF, Word2Vec, dan IndoBERT. Penghitungan kemiripan menggunakan metrik cosine similarity. Evaluasi dilakukan dengan lima skenario yaitu, perbandingan model, variasi jenis kueri, variasi panjang kueri, variasi jumlah hasil pencarian, dan variasi ruang pencarian. Evaluasi diukur dengan metrik precision, recall, dan Mean Average Precision (MAP). Hasil evaluasi menunjukkan Word2Vec memperoleh rata-rata MAP tertinggi sebesar 0,859 dibandingkan dengan TF-IDF sebesar 0,682 dan IndoBERT sebesar 0,646. Berdasarkan hasil tersebut, Word2Vec lebih konsisten dibandingkan kedua model lainnya karena unggul pada sebagian besar skenario. Hasil evaluasi tersebut memberikan gambaran mengenai performa masing-masing model representasi teks pada berbagai kondisi retrieval dan dapat menjadi pertimbangan pemilihan model representasi teks untuk pengembangan sistem informasi retrieval.

Downloads

Download data is not yet available.

References

[1] I. Cholissodin et al., “Pemeringkatan Pencarian Pada Buku Pedoman Akademik Filkom Ub Menuju Merdeka Belajar Dan Free E-Book Pembelajaran Sebagai Prototype Local Smart Micro Search Engine Menggunakan Algoritma Pagerank Dan Tf-Idf”, doi: 10.25126/jtiik.202184384.

[2] R. E. Sakti, “Astacita, Visi Pemerintahan Prabowo-Gibran Menuju Indonesia Emas 2045,” Kompas.id. Accessed: Dec. 08, 2025. [Online]. Available: https://www.kompas.id/artikel/astacita-visi-pemerintahan-prabowo-gibran-menuju-indonesia-emas-2045

[3] E. Prayitno, T. Suprawoto, and B. F. Riyanto, “Optimasi Hasil Pencarian Pada Web Scrapping Menggunakan Pembobotan Kata TF-IDF,” Journal of Innovation Research and Knowledge, vol. 1, no. 7, pp. 241–246, Dec. 2021.

[4] I. Putu Gede Hendra Suputra, I. Made Widhi Wirawan, D. Ketut Puri Trisnantya Aji, A. Agung Sinta Trisnajayanti, and F. Matematika dan Ilmu Pengetahuan Alam, “Sistem Temu Kembali Informasi Untuk Mendukung Layanan Frequently Asked Questions (Faq) Pada Platform Sistem Informasi Terintegrasi,” Jurnal Pendidikan Teknologi dan Kejuruan, vol. 22, no. 2, pp. 205–215, Jul. 2025.

[5] D. A. Suryaningrum, R. Syaifudin, and H. R. P. Putra, “Integrasi Word Embeddings Dan Inverse Book Frequency Dalam Pembobotan Term Untuk Peningkatan Pencarian Dokumen,” JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), vol. 9, no. 4, pp. 2529–2537, Dec. 2024, doi: 10.29100/jipi.v9i4.7557.

[6] N. S. Sunendar and I. Saputra, “Comparative Performance Of Transformer And LSTM Models For Indonesian Information Retrieval With IndoBERT,” Jurnal Pilar Nusa Mandiri, vol. 21, no. 2, pp. 228–233, Sep. 2025, doi: 10.33480/pilar.v21i2.6920.

[7] L. Tiara, H. Syaputra, W. Cholil, and A. H. Mirza, “Web Scraper Dan Graphql API Untuk Data Perguruan Tinggi Di Indonesia Berdasarkan Website Kementrian Ristekdikti,” Jurnal Nasional Ilmu Komputer, vol. 2, no. 3, Aug. 2021.

[8] D. Septiani and I. Isabela, “Analisis Term Frequency Inverse Document Frequency (Tf-Idf) Dalam Temu Kembali Informasi Pada Dokumen Teks,” SINTESIA: Jurnal Sistem dan Teknologi Informasi Indonesia, vol. 1, no. 2, Mar. 2022.

[9] Y. C. Gurning, S. C. Saragih, Y. Y. Lase, and J. Julham, “Perbandingan TextRank Berbasis TF-IDF dan Word2Vec dalam Peringkasan Teks Berita Bahasa Indonesia,” Jurnal Komputer Teknologi Informasi Sistem Informasi (JUKTISI), vol. 4, no. 2, pp. 922–928, Aug. 2025, doi: 10.62712/juktisi.v4i2.552.

[10] M. Dzikry Afandi, A. Homaidi, A. Ghofur, and A. Zubairi, “Penerapan Information Retrieval dalam Sistem Analisis Kemiripan Proposal Skripsi menggunakan Cosine Similarity,” JURNAL SWABUMI, vol. 12, no. 1, p. 2023, 2024.

[11] S. Bahri, “Aplikasi Pencarian Bahan Pustaka Di Perpustakaan Menggunakan Metode Vector Space Model,” JIMP-Jurnal Informatika Merdeka Pasuruan, vol. 5, 2020.

[12] D. Jurafsky and J. H. Martin, “Speech and Language Processing An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition with Language Models Third Edition draft.”

[13] A. A. Kalinin et al., “A versatile information retrieval framework for evaluating profile strength and similarity,” Nature Communications , vol. 16, no. 1, Dec. 2025, doi: 10.1038/s41467-025-60306-2.

Downloads

Published

31-07-2026

Issue

Section

Articles

How to Cite

[1]
“EVALUASI PERFORMA TF-IDF, WORD2VEC, DAN INDOBERT PADA RETRIEVAL BERITA TOPIK ASTA CITA”, biner : j. ilm. inform. dan komput., vol. 5, no. 2, pp. 139–147, Jul. 2026, doi: 10.32699/biner.v5i2.11549.