Новости

05.03.2024

В феврале мы существенно усовершенствовали Газетный корпус.

Корпус пополнен более чем на 49,6 млн словоформ. В него добавлены периодические издания 1990-х годов («Независимая газета», в том числе еженедельные приложения, «Московский комсомолец», «Санкт-Петербургские ведомости»).

Во всех текстах корпуса автоматически снята грамматическая омонимия и добавлена разметка синтаксических связей (напомним, что поле запроса появляется начиная со второго слова после нажатия ссылки «добавить условие»). Это делает доступными в Газетном корпусе центральных СМИ те новейшие функции, которые уже есть в меньших по объему Основном корпусе и Корпусе региональных СМИ: поиск по синтаксическим отношениям и свойствам, поиск коллокаций, частотный словарь, частотность выдачи.

Газетный корпус НКРЯ — теперь самый объемный в мире онлайн-корпус русского языка с возможностью поиска по синтаксическим связям!

В форме подкорпуса появилась возможность отбирать тексты по тематике и типу. Для разметки этих полей использована модель RuRoBERTa, дообученная на данных Регионального корпуса. Поля в форме подкорпуса и информации о тексте, значения которых сгенерированы НейроКРЯ, помечены специальным значком. При автоматической разметке возможны ошибки. Во всплывающем окне информации о тексте есть кнопка «Сообщить об ошибке». Сообщайте нам о всех неточностях и ошибках в определении тематики и типов.

05.03.2024

В Синтаксическом корпусе появилась возможность отбора подкорпуса по основным параметрам, таким как автор, название текста, дата его создания и год рождения автора, а также по жанрам и типам текстов и по дате разметки.

Следите за нашими новостями на сайте и в социальных сетях, в марте мы продолжим совершенствовать работу Синтаксического корпуса!

13.02.2024

Корпус «Русская классика» пополнен более чем на 1 млн словоформ. В него добавлены полные собрания сочинений А. Н. Радищева и И. А. Крылова, а также некоторые произведения уже представленных в нем авторов, пропущенные в предыдущем релизе корпуса. В корпусе можно строить графики, сравнивать запросы и отбирать подкорпус по жанру. Поисковую выдачу теперь можно сортировать по дате создания и по автору и жанру.

13.02.2024

В портрете Основного и Регионального корпусов появилась диахроническая статистика. Новый функционал позволяет представить распределение объема и состава текстов корпуса по времени создания. В Региональном корпусе дополнительно можно увидеть распределение объема текстов корпуса во времени по странам и регионам.

Чтобы увидеть графики диахронической статистики, нужно нажать на кнопку (i) в шапке корпуса, выбрать раздел Статистика и перейти во вкладку Распределение по времени.

Вы можете выбрать уровень детализации, задать диапазон дат и сглаживание. Эти параметры являются общими для всех графиков на странице, при изменении их значений будут перестраиваться все графики и таблицы.