Progressive Topic Formation: Framework Iteratif untuk Membangun Domain Knowledge Collection

Penulis

  • Maulana Aziz Assuja Institut Teknologi dan Bisnis Mesuji
  • Saniati Saniati Institut Teknologi dan Bisnis Mesuji
  • Yeni Agus Nurhuda Institut Bisnis dan Teknologi Kalimantan

DOI:

https://doi.org/10.55382/jurnalpustakaai.v6i2.2456

Kata Kunci:

Progressive Topic Formation, Semantic Retrieval, Progressive Document Clustering, Domain Knowledge Collection, Large Language Model

Abstrak

Topic modeling banyak digunakan untuk mengidentifikasi topik dari koleksi dokumen berskala besar. Namun, sebagian besar pendekatan masih menghasilkan label topik atau kumpulan kata representatif yang belum dapat dimanfaatkan sebagai pengetahuan terstruktur. Penelitian ini mengusulkan Progressive Topic Formation (PTF) sebagai framework untuk membangun Domain Knowledge Collection (DKC) dari koleksi dokumen tidak terstruktur. Framework yang diusulkan memperkenalkan Semantic Domain Prototype sebagai representasi awal domain yang diikuti oleh tahapan semantic retrieval, progressive document clustering, dan Domain Knowledge Construction untuk mentransformasikan cluster dokumen yang memiliki koherensi semantik menjadi knowledge object yang terstruktur. Evaluasi dilakukan menggunakan 599.059 artikel Wikipedia Bahasa Indonesia dengan Domain Pendidikan sebagai studi kasus. Hasil eksperimen menunjukkan bahwa PTF mampu memperoleh dokumen yang relevan secara semantik, membentuk cluster yang koheren, serta menghasilkan Domain Knowledge yang terdiri atas nama topik, ringkasan topik, representasi topik, kata kunci utama, dan dokumen pendukung. Dibandingkan dengan topic modeling konvensional, framework yang diusulkan menghasilkan Domain Knowledge Collection yang memiliki representasi semantik lebih kaya melalui transformasi cluster dokumen menjadi knowledge object yang dapat digunakan kembali. Hasil penelitian menunjukkan bahwa PTF memperluas konsep topic modeling menuju konstruksi pengetahuan domain, sehingga DKC yang dihasilkan berpotensi dimanfaatkan sebagai knowledge layer pada Knowledge Management System, semantic search, dan Retrieval-Augmented Generation (RAG).

Unduhan

Data unduhan belum tersedia.

Referensi

P. Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,” in Advances in Neural Information Processing Systems, Curran Associates, Inc., 2020, pp. 9459–9474.

Y. Gao et al., “Retrieval-Augmented Generation for Large Language Models: A Survey,” Mar. 27, 2024, arXiv: arXiv:2312.10997. doi: 10.48550/arXiv.2312.10997.

D. M. Blei, A. Y. Ng, and M. I. Jordan, “Latent Dirichlet Allocation,” Journal of Machine Learning Research, vol. 3, no. Jan, pp. 993–1022, 2003.

M. Grootendorst, “BERTopic: Neural topic modeling with a class-based TF-IDF procedure,” Mar. 11, 2022, arXiv: arXiv:2203.05794. doi: 10.48550/arXiv.2203.05794.

V. Karpukhin et al., “Dense Passage Retrieval for Open-Domain Question Answering,” in Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP), Online: Association for Computational Linguistics, 2020, pp. 6769–6781. doi: 10.18653/v1/2020.emnlp-main.550.

W. Hardi, “PENGELOMPOKAN TOPIK DOKUMEN BERBASIS TEXT MINING DENGAN ALGORITME K-MEANS: STUDI KASUS PADA DOKUMEN KEDUTAAN BESAR AUSTRALIA JAKARTA,” vol. 21, no. 1, 2019.

G. Patidar, A. Singh, and D. Singh, “An Approach for Document Clustering using Agglomerative Clustering and Hebbian-type Neural Network,” IJCA, vol. 75, no. 9, pp. 17–22, Aug. 2013, doi: 10.5120/13139-0532.

A. Eklund, M. Forsman, and F. Drewes, “An Empirical Configuration Study of a Common Document Clustering Pipeline,” Northern European Journal of Language Technology, vol. 9, 2023, doi: 10.3384/nejlt.2000-1533.2023.4396.

R. Gusmansyah, R. Rahmaddeni, R. Rohid, A. Rivaldi, and S. Daulay, “Perbandingan Metode Machine Learning untuk Klastering Penerima Bantuan Pendidikan Siswa,” Jurnal Pustaka AI, vol. 5, no. 2, pp. 193–203, Aug. 2025, doi: 10.55382/jurnalpustakaai.v5i2.1139.

R. J. G. B. Campello, D. Moulavi, and J. Sander, “Density-Based Clustering Based on Hierarchical Density Estimates,” in Advances in Knowledge Discovery and Data Mining, J. Pei, V. S. Tseng, L. Cao, H. Motoda, and G. Xu, Eds., Berlin, Heidelberg: Springer, 2013, pp. 160–172. doi: 10.1007/978-3-642-37456-2_14.

R. J. G. B. Campello, P. Kröger, J. Sander, and A. Zimek, “Density‐based clustering,” WIREs Data Min & Knowl, vol. 10, no. 2, p. e1343, Mar. 2020, doi: 10.1002/widm.1343.

“indonesian-nlp/wikipedia-id · Datasets at Hugging Face.” Accessed: Apr. 07, 2026. [Online]. Available: https://huggingface.co/datasets/indonesian-nlp/wikipedia-id

D. Mimno, H. Wallach, E. Talley, M. Leenders, and A. McCallum, “Optimizing Semantic Coherence in Topic Models”.

A. M. Ikotun, F. Habyarimana, and A. E. Ezugwu, “Cluster validity indices for automatic clustering: A comprehensive review,” Heliyon, vol. 11, no. 2, p. e41953, Jan. 2025, doi: 10.1016/j.heliyon.2025.e41953.

N. Reimers and I. Gurevych, “Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,” in Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), Hong Kong, China: Association for Computational Linguistics, 2019, pp. 3980–3990. doi: 10.18653/v1/D19-1410.

##submission.downloads##

Diterbitkan

2026-06-27

Cara Mengutip

Assuja, M. A., Saniati, S., & Nurhuda, Y. A. (2026). Progressive Topic Formation: Framework Iteratif untuk Membangun Domain Knowledge Collection. Jurnal Pustaka AI (Pusat Akses Kajian Teknologi Artificial Intelligence), 6(2), 265–275. https://doi.org/10.55382/jurnalpustakaai.v6i2.2456