Классификация, кластеризация и оценка сходства текстов (Курс "Компьютерная лингвистика") [Архэ] [Александр Пиперски]

Vendetta

Администратор
Регистрация
16 Сен 2015
Сообщения
246.839
Реакции
426.072
**Складчина: Классификация, кластеризация и оценка сходства текстов (Курс "Компьютерная лингвистика") [Архэ] [Александр Пиперски]**

Компьютерная лингвистика – это сфера, постоянно развивающаяся на пересечении теории и практики. Этот направление оказывает влияние на нашу повседневную жизнь: от машинного перевода до поисковых систем в интернете, голосовых помощников и многого другого. За всем этим стоит серьезная работа лингвистов и программистов. В рамках курса мы рассмотрим историю компьютерной лингвистики, её основные методы и их применение в практике – от проверки орфографии до классификации новостей по темам.

**7. Классификация, кластеризация и оценка сходства текстов**

Важной задачей компьютерной лингвистики является группировка похожих текстов. Это может быть как разделение на заранее заданные категории (например, "Спорт", "Политика"), так и группировка на основе сходства текстов между собой. Например, новостные агрегаторы сначала объединяют похожие статьи в один материал, а затем присваивают его определенной категории. На занятии будет обсуждаться, как оценивать расстояние между текстами, различие между задачами классификации и кластеризации, а также методы их решения.

**Лектор:** Александр Чедович Пиперски, кандидат филологических наук, доцент Института лингвистики РГГУ, научный сотрудник Школы филологии НИУ ВШЭ.
 
Сверху