EVALUASI PERFORMA TF-IDF, WORD2VEC, DAN INDOBERT PADA RETRIEVAL BERITA TOPIK ASTA CITA
DOI:
https://doi.org/10.32699/biner.v5i2.11549Keywords:
Asta Cita, Representasi Teks, Evaluasi, Information Retrieval, Relevansi DokumenAbstract
Peningkatan pemberitaan digital mengenai Asta Cita menghasilkan beragamnya informasi, sehingga diperlukan proses retrieval untuk menghasilkan dokumen yang relevan sesuai dengan kebutuhan pencarian. Perbedaan karakteristik model representasi teks TF-IDF, Word2Vec, IndoBERT menjadi dasar dari penelitian ini untuk mengevaluasi dan membandingkan performa dari ketiga model tersebut pada korpus berita Asta Cita. Data yang digunakan berasal dari web scraping dengan jumlah 1338 dokumen berita dan rentang tahun 2024-2026. Data dilakukan tahapan preprocessing dan diperoleh 1311 dokumen berita. Dokumen direpresentasikan menggunakan TF-IDF, Word2Vec, dan IndoBERT. Penghitungan kemiripan menggunakan metrik cosine similarity. Evaluasi dilakukan dengan lima skenario yaitu, perbandingan model, variasi jenis kueri, variasi panjang kueri, variasi jumlah hasil pencarian, dan variasi ruang pencarian. Evaluasi diukur dengan metrik precision, recall, dan Mean Average Precision (MAP). Hasil evaluasi menunjukkan Word2Vec memperoleh rata-rata MAP tertinggi sebesar 0,859 dibandingkan dengan TF-IDF sebesar 0,682 dan IndoBERT sebesar 0,646. Berdasarkan hasil tersebut, Word2Vec lebih konsisten dibandingkan kedua model lainnya karena unggul pada sebagian besar skenario. Hasil evaluasi tersebut memberikan gambaran mengenai performa masing-masing model representasi teks pada berbagai kondisi retrieval dan dapat menjadi pertimbangan pemilihan model representasi teks untuk pengembangan sistem informasi retrieval.
Downloads
References
[1] I. Cholissodin et al., “Pemeringkatan Pencarian Pada Buku Pedoman Akademik Filkom Ub Menuju Merdeka Belajar Dan Free E-Book Pembelajaran Sebagai Prototype Local Smart Micro Search Engine Menggunakan Algoritma Pagerank Dan Tf-Idf”, doi: 10.25126/jtiik.202184384.
[2] R. E. Sakti, “Astacita, Visi Pemerintahan Prabowo-Gibran Menuju Indonesia Emas 2045,” Kompas.id. Accessed: Dec. 08, 2025. [Online]. Available: https://www.kompas.id/artikel/astacita-visi-pemerintahan-prabowo-gibran-menuju-indonesia-emas-2045
[3] E. Prayitno, T. Suprawoto, and B. F. Riyanto, “Optimasi Hasil Pencarian Pada Web Scrapping Menggunakan Pembobotan Kata TF-IDF,” Journal of Innovation Research and Knowledge, vol. 1, no. 7, pp. 241–246, Dec. 2021.
[4] I. Putu Gede Hendra Suputra, I. Made Widhi Wirawan, D. Ketut Puri Trisnantya Aji, A. Agung Sinta Trisnajayanti, and F. Matematika dan Ilmu Pengetahuan Alam, “Sistem Temu Kembali Informasi Untuk Mendukung Layanan Frequently Asked Questions (Faq) Pada Platform Sistem Informasi Terintegrasi,” Jurnal Pendidikan Teknologi dan Kejuruan, vol. 22, no. 2, pp. 205–215, Jul. 2025.
[5] D. A. Suryaningrum, R. Syaifudin, and H. R. P. Putra, “Integrasi Word Embeddings Dan Inverse Book Frequency Dalam Pembobotan Term Untuk Peningkatan Pencarian Dokumen,” JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika), vol. 9, no. 4, pp. 2529–2537, Dec. 2024, doi: 10.29100/jipi.v9i4.7557.
[6] N. S. Sunendar and I. Saputra, “Comparative Performance Of Transformer And LSTM Models For Indonesian Information Retrieval With IndoBERT,” Jurnal Pilar Nusa Mandiri, vol. 21, no. 2, pp. 228–233, Sep. 2025, doi: 10.33480/pilar.v21i2.6920.
[7] L. Tiara, H. Syaputra, W. Cholil, and A. H. Mirza, “Web Scraper Dan Graphql API Untuk Data Perguruan Tinggi Di Indonesia Berdasarkan Website Kementrian Ristekdikti,” Jurnal Nasional Ilmu Komputer, vol. 2, no. 3, Aug. 2021.
[8] D. Septiani and I. Isabela, “Analisis Term Frequency Inverse Document Frequency (Tf-Idf) Dalam Temu Kembali Informasi Pada Dokumen Teks,” SINTESIA: Jurnal Sistem dan Teknologi Informasi Indonesia, vol. 1, no. 2, Mar. 2022.
[9] Y. C. Gurning, S. C. Saragih, Y. Y. Lase, and J. Julham, “Perbandingan TextRank Berbasis TF-IDF dan Word2Vec dalam Peringkasan Teks Berita Bahasa Indonesia,” Jurnal Komputer Teknologi Informasi Sistem Informasi (JUKTISI), vol. 4, no. 2, pp. 922–928, Aug. 2025, doi: 10.62712/juktisi.v4i2.552.
[10] M. Dzikry Afandi, A. Homaidi, A. Ghofur, and A. Zubairi, “Penerapan Information Retrieval dalam Sistem Analisis Kemiripan Proposal Skripsi menggunakan Cosine Similarity,” JURNAL SWABUMI, vol. 12, no. 1, p. 2023, 2024.
[11] S. Bahri, “Aplikasi Pencarian Bahan Pustaka Di Perpustakaan Menggunakan Metode Vector Space Model,” JIMP-Jurnal Informatika Merdeka Pasuruan, vol. 5, 2020.
[12] D. Jurafsky and J. H. Martin, “Speech and Language Processing An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition with Language Models Third Edition draft.”
[13] A. A. Kalinin et al., “A versatile information retrieval framework for evaluating profile strength and similarity,” Nature Communications , vol. 16, no. 1, Dec. 2025, doi: 10.1038/s41467-025-60306-2.
Downloads
Published
Issue
Section
License
Copyright (c) 2026 Biner : Jurnal Ilmiah Informatika dan Komputer

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.
An author who publishes in this Journal agrees to the following terms:
- Author retains the copyright and grants the journal the right of first publication of the work simultaneously licensed under the Creative Commons Attribution-ShareAlike 4.0 License that allows others to share the work with an acknowledgement of the work's authorship and initial publication in this journal
- Author is able to enter into separate, additional contractual arrangements for the non-exclusive distribution of the journal's published version of the work (e.g., post it to an institutional repository or publish it in a book) with the acknowledgement of its initial publication in this journal.
- Author is permitted and encouraged to post his/her work online (e.g., in institutional repositories or on their website) prior to and during the submission process, as it can lead to productive exchanges, as well as earlier and greater citation of the published work (See The Effect of Open Access).









