Написание продукта курсовой – программы на тему «Тематическое моделирование новостной ленты сайта» на python. Есть файл в формате csv (загрузился только как xlsl), как источник новос
Посмотрите тему, параметры и описание реального заказа. Если у вас похожее задание, разместите собственную заявку.
Информация о заказе
Основные параметры работы.
Описание заказа
Тема и требования к работе.
Написание продукта курсовой – программы на тему «Тематическое моделирование новостной ленты сайта» на python. Есть файл в формате csv (загрузился только как xlsl), как источник новостей. Его нужно считать, обработать текст в bag of words. Потом построить модель. Ключевой вопрос — на сколько тем распределять новости. Нужно попробовать несколько вариантов и сравнить качество моделей. Нужно попробовать как Gensim, так и bigARTM. Для них попробовать варьировать параметры модели (регуляризаторы), добиваясь лучшей когерентности. spaCy - Предобработка текста genism bigARTM pyQt5 - Интерфейс
Как проходит заказ на RuStud
Опишите задание, выберите исполнителя и общайтесь с ним в заказе.
Как подготовить такую работу
Основные этапы и полезные ориентиры.
Для выполнения курсовой работы по тематическому моделированию новостной ленты на Python, вам потребуется пройти несколько этапов, каждый из которых требует определенных знаний и навыков. Основные шаги включают в себя обработку данных, построение моделей и создание интерфейса.
Первым шагом будет загрузка данных из файла в формате CSV. Для этого вы можете использовать библиотеку pandas, которая позволит вам удобно работать с данными. Необходимо будет прочитать файл и преобразовать его в DataFrame. Обратите внимание на структуру данных: вам нужно будет извлечь текст новостей для дальнейшей обработки.
Следующий этап – предобработка текста. Для этого рекомендуется использовать библиотеку spaCy. Она поможет вам очистить текст от шумов, таких как знаки препинания и стоп-слова. Также стоит провести лемматизацию, чтобы привести слова к их базовым формам. Это значительно улучшит качество последующего тематического моделирования.
После предобработки данных можно переходить к построению моделей. Вам нужно будет попробовать несколько подходов, таких как Gensim и bigARTM. Для этого сначала создайте "мешок слов" (bag of words) из обработанных данных. Затем определитесь с количеством тем, на которые хотите распределить новости. Попробуйте разные варианты, чтобы определить, какое количество тем дает наилучший результат.
Важно варьировать параметры модели, такие как регуляризаторы, чтобы добиться лучшей когерентности. Это может потребовать нескольких итераций и сравнений результатов. Обратите внимание на метрики, которые используются для оценки качества моделей: когерентность тем и стабильность результатов.
Наконец, для создания интерфейса вы можете использовать библиотеку PyQt5. Это позволит вам создать графическое представление вашей программы, где пользователи смогут загружать файлы и получать результаты тематического моделирования. Вам нужно будет продумать, как отобразить полученные темы и связанные с ними новости.
Помните, что работа требует достаточного уровня знаний в области программирования на Python, а также понимания основ обработки естественного языка и машинного обучения. Не бойтесь экспериментировать и задавать вопросы, если что-то будет непонятно. Удачи в выполнении курсовой работы!
Перед началом уточните требования преподавателя и сверьтесь с методическими указаниями.
Отзывы студентов
Отзывы о выполненных заказах на RuStud.
Спасибо за выполнение, автор супер, рекомендую к заказу!
Спасибо за помощь, автор отличный!
ответственный автор
Не первый раз заказываю у данного автора работы , всегда работы выполнены в срок и в лучшем виде. Всем рекомендую!
Курсовая работа была написана в соответствии со всеми указанными параметрами досрочно. Возражений нет.
Отличный автор. Выполнила работу раньше срока на несколько дней, все выполнено отлично. Очень добросовестная и ответственная.
Не подстраивайте своё задание под чужое
Разместите собственные требования — тему, срок, методичку и нужный состав результата.