Progressive Topic Formation: Framework Iteratif untuk Membangun Domain Knowledge Collection
DOI:
https://doi.org/10.55382/jurnalpustakaai.v6i2.2456Kata Kunci:
Progressive Topic Formation, Semantic Retrieval, Progressive Document Clustering, Domain Knowledge Collection, Large Language ModelAbstrak
Topic modeling banyak digunakan untuk mengidentifikasi topik dari koleksi dokumen berskala besar. Namun, sebagian besar pendekatan masih menghasilkan label topik atau kumpulan kata representatif yang belum dapat dimanfaatkan sebagai pengetahuan terstruktur. Penelitian ini mengusulkan Progressive Topic Formation (PTF) sebagai framework untuk membangun Domain Knowledge Collection (DKC) dari koleksi dokumen tidak terstruktur. Framework yang diusulkan memperkenalkan Semantic Domain Prototype sebagai representasi awal domain yang diikuti oleh tahapan semantic retrieval, progressive document clustering, dan Domain Knowledge Construction untuk mentransformasikan cluster dokumen yang memiliki koherensi semantik menjadi knowledge object yang terstruktur. Evaluasi dilakukan menggunakan 599.059 artikel Wikipedia Bahasa Indonesia dengan Domain Pendidikan sebagai studi kasus. Hasil eksperimen menunjukkan bahwa PTF mampu memperoleh dokumen yang relevan secara semantik, membentuk cluster yang koheren, serta menghasilkan Domain Knowledge yang terdiri atas nama topik, ringkasan topik, representasi topik, kata kunci utama, dan dokumen pendukung. Dibandingkan dengan topic modeling konvensional, framework yang diusulkan menghasilkan Domain Knowledge Collection yang memiliki representasi semantik lebih kaya melalui transformasi cluster dokumen menjadi knowledge object yang dapat digunakan kembali. Hasil penelitian menunjukkan bahwa PTF memperluas konsep topic modeling menuju konstruksi pengetahuan domain, sehingga DKC yang dihasilkan berpotensi dimanfaatkan sebagai knowledge layer pada Knowledge Management System, semantic search, dan Retrieval-Augmented Generation (RAG).
Unduhan
Referensi
P. Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,” in Advances in Neural Information Processing Systems, Curran Associates, Inc., 2020, pp. 9459–9474.
Y. Gao et al., “Retrieval-Augmented Generation for Large Language Models: A Survey,” Mar. 27, 2024, arXiv: arXiv:2312.10997. doi: 10.48550/arXiv.2312.10997.
D. M. Blei, A. Y. Ng, and M. I. Jordan, “Latent Dirichlet Allocation,” Journal of Machine Learning Research, vol. 3, no. Jan, pp. 993–1022, 2003.
M. Grootendorst, “BERTopic: Neural topic modeling with a class-based TF-IDF procedure,” Mar. 11, 2022, arXiv: arXiv:2203.05794. doi: 10.48550/arXiv.2203.05794.
V. Karpukhin et al., “Dense Passage Retrieval for Open-Domain Question Answering,” in Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP), Online: Association for Computational Linguistics, 2020, pp. 6769–6781. doi: 10.18653/v1/2020.emnlp-main.550.
W. Hardi, “PENGELOMPOKAN TOPIK DOKUMEN BERBASIS TEXT MINING DENGAN ALGORITME K-MEANS: STUDI KASUS PADA DOKUMEN KEDUTAAN BESAR AUSTRALIA JAKARTA,” vol. 21, no. 1, 2019.
G. Patidar, A. Singh, and D. Singh, “An Approach for Document Clustering using Agglomerative Clustering and Hebbian-type Neural Network,” IJCA, vol. 75, no. 9, pp. 17–22, Aug. 2013, doi: 10.5120/13139-0532.
A. Eklund, M. Forsman, and F. Drewes, “An Empirical Configuration Study of a Common Document Clustering Pipeline,” Northern European Journal of Language Technology, vol. 9, 2023, doi: 10.3384/nejlt.2000-1533.2023.4396.
R. Gusmansyah, R. Rahmaddeni, R. Rohid, A. Rivaldi, and S. Daulay, “Perbandingan Metode Machine Learning untuk Klastering Penerima Bantuan Pendidikan Siswa,” Jurnal Pustaka AI, vol. 5, no. 2, pp. 193–203, Aug. 2025, doi: 10.55382/jurnalpustakaai.v5i2.1139.
R. J. G. B. Campello, D. Moulavi, and J. Sander, “Density-Based Clustering Based on Hierarchical Density Estimates,” in Advances in Knowledge Discovery and Data Mining, J. Pei, V. S. Tseng, L. Cao, H. Motoda, and G. Xu, Eds., Berlin, Heidelberg: Springer, 2013, pp. 160–172. doi: 10.1007/978-3-642-37456-2_14.
R. J. G. B. Campello, P. Kröger, J. Sander, and A. Zimek, “Density‐based clustering,” WIREs Data Min & Knowl, vol. 10, no. 2, p. e1343, Mar. 2020, doi: 10.1002/widm.1343.
“indonesian-nlp/wikipedia-id · Datasets at Hugging Face.” Accessed: Apr. 07, 2026. [Online]. Available: https://huggingface.co/datasets/indonesian-nlp/wikipedia-id
D. Mimno, H. Wallach, E. Talley, M. Leenders, and A. McCallum, “Optimizing Semantic Coherence in Topic Models”.
A. M. Ikotun, F. Habyarimana, and A. E. Ezugwu, “Cluster validity indices for automatic clustering: A comprehensive review,” Heliyon, vol. 11, no. 2, p. e41953, Jan. 2025, doi: 10.1016/j.heliyon.2025.e41953.
N. Reimers and I. Gurevych, “Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,” in Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), Hong Kong, China: Association for Computational Linguistics, 2019, pp. 3980–3990. doi: 10.18653/v1/D19-1410.
##submission.downloads##
Diterbitkan
Cara Mengutip
Terbitan
Bagian
Lisensi
Hak Cipta (c) 2026 Maulana Aziz Assuja, Saniati Saniati, Yeni Agus Nurhuda

Artikel ini berlisensi Creative Commons Attribution 4.0 International License.




