This repository implements a pipeline to store various data of files from a large unstructured dataset. These fields are used for topic modeling (wordclouds, based on low-dimensional versions of embedding vectors, Named Entity Clustering and document-topic incidences). The information is aggregated and visualised using FCA.
elasticsearchvisualisationembeddingsdocumentsnertext-datafcatopics-modelingsentence-transformerstop2vectopic-aggregationner-clustering
-
Updated
Jan 17, 2026 - Python