Анализ базы заметок: темы, кластеры и недостающие связи
Показывает, о чём на самом деле ваша база заметок: какие темы в ней есть, что рядом по смыслу и какие связи стоит поставить.
Задача
База личных заметок через год превращается в архив: сотни файлов, в которых человек помнит только последние десять. Связи между заметками ставятся вручную, а значит — редко и бессистемно.
Вопрос, интересный с лингвистической точки зрения: можно ли увидеть структуру этой базы объективно — не по папкам, которые человек придумал, а по смыслу того, что там написано.
Что сделано
База собрана в единый набор данных. Все заметки с их текстами, датами и явными ссылками.
Тексты переведены в смысловые векторы. Каждая заметка получает числовое представление содержания. После этого «похожесть» перестаёт зависеть от совпадения слов: две заметки про одно и то же, написанные разными словами, оказываются рядом.
Выделены кластеры и названы темы. Заметки группируются по смысловой близости, каждая группа получает человеческое название. Часто это отрезвляет: реальные темы базы не совпадают с тем, что человек о ней думал.
Сделано предложение связей. Инструмент показывает пары заметок, которые близки по смыслу, но не связаны ссылкой — это и есть недостающие рёбра графа знаний.
Построен интерактивный граф. Его можно рассматривать: где плотное ядро, где одинокие заметки, где два кластера почти не соприкасаются.
Результат
Инструмент, который превращает архив в карту. Он же — основа для клиентской работы: тот же метод применяется к материалам заказчика, когда нужно понять, о чём накопленный контент и чего в нём не хватает.
Что дальше
Отслеживание изменений во времени: как смысловая структура базы меняется за месяцы работы.
Расскажите, что нужно сделать
Напишите в Telegram пару предложений о задаче: что за бизнес, что должно получиться и что уже пробовали. В ответ — понятный план и цена. Без брифов на десять страниц.