Национальный корпус русского языка — представительная коллекция текстов
на русском языке
общим объемом более 2 млрд слов,
оснащенная лингвистической разметкой и инструментами поиска
Поиск по корпусам
Новости
В Синтаксическом корпусе появилась возможность отбора подкорпуса по основным параметрам, таким как автор, название текста, дата его создания и год рождения автора, а также по жанрам и типам текстов и по дате разметки.
Следите за нашими новостями на сайте и в социальных сетях, в марте мы продолжим совершенствовать работу Синтаксического корпуса!
В феврале мы существенно усовершенствовали Газетный корпус.
Корпус пополнен более чем на 49,6 млн словоформ. В него добавлены периодические издания 1990-х годов («Независимая газета», в том числе еженедельные приложения, «Московский комсомолец», «Санкт-Петербургские ведомости»).
Во всех текстах корпуса автоматически снята грамматическая омонимия и добавлена разметка синтаксических связей (напомним, что поле запроса появляется начиная со второго слова после нажатия ссылки «добавить условие»). Это делает доступными в Газетном корпусе центральных СМИ те новейшие функции, которые уже есть в меньших по объему Основном корпусе и Корпусе региональных СМИ: поиск по синтаксическим отношениям и свойствам, поиск коллокаций, частотный словарь, частотность выдачи.
Газетный корпус НКРЯ — теперь самый объемный в мире онлайн-корпус русского языка с возможностью поиска по синтаксическим связям!
В форме подкорпуса появилась возможность отбирать тексты по тематике и типу. Для разметки этих полей использована модель RuRoBERTa, дообученная на данных Регионального корпуса. Поля в форме подкорпуса и информации о тексте, значения которых сгенерированы НейроКРЯ, помечены специальным значком. При автоматической разметке возможны ошибки. Во всплывающем окне информации о тексте есть кнопка «Сообщить об ошибке». Сообщайте нам о всех неточностях и ошибках в определении тематики и типов.
Корпус «Русская классика» пополнен более чем на 1 млн словоформ. В него добавлены полные собрания сочинений А. Н. Радищева и И. А. Крылова, а также некоторые произведения уже представленных в нем авторов, пропущенные в предыдущем релизе корпуса. В корпусе можно строить графики, сравнивать запросы и отбирать подкорпус по жанру. Поисковую выдачу теперь можно сортировать по дате создания и по автору и жанру.
В портрете Основного и Регионального корпусов появилась диахроническая статистика. Новый функционал позволяет представить распределение объема и состава текстов корпуса по времени создания. В Региональном корпусе дополнительно можно увидеть распределение объема текстов корпуса во времени по странам и регионам.
Чтобы увидеть графики диахронической статистики, нужно нажать на кнопку (i) в шапке корпуса, выбрать раздел Статистика и перейти во вкладку Распределение по времени.
Вы можете выбрать уровень детализации, задать диапазон дат и сглаживание. Эти параметры являются общими для всех графиков на странице, при изменении их значений будут перестраиваться все графики и таблицы.