OrthRus_v2

OrthRus_v2 is the expanded and updated version of the corpus. The first version, OrthRus_v1, is also available for querying.

OrthRus is a large, multi-genre Russian corpus of Orthodox religious language compiled from multiple portals and content sections. The data were collected between December 2025 and May 2026; the current corpus was compiled in May 2026. The corpus includes news, topical articles, Q&A materials, and texts from the “Otechnik” section, which is a multi-genre library of religious literature containing theological, scholarly, publicistic, hagiographic, and other types of texts. The corpus provides public subcorpora by genre (core / news / Q&A / otechnik) and by portal (source website).

OrthRus_v2

OrthRus_v2 ist die erweiterte und aktualisierte Version des Korpus. Die erste Version, OrthRus_v1, ist ebenfalls für Abfragen verfügbar.

OrthRus ist ein großes, mehrgenres russisches Korpus orthodoxer religiöser Sprache, zusammengestellt aus mehreren Portalen und Inhaltsbereichen. Die Daten wurden zwischen Dezember 2025 und Mai 2026 erhoben; das aktuelle Korpus wurde im Mai 2026 erstellt. Es umfasst Nachrichten, thematische Artikel, Frage‑Antwort‑Materialien sowie Texte aus dem Bereich „Otechnik“, der eine mehrgenres Bibliothek religiöser Literatur darstellt und theologische, wissenschaftliche, publizistische, hagiographische sowie weitere Texttypen enthält. Im Korpus stehen öffentliche Subkorpora nach Genre (Kern / Nachrichten / Q&A / Otechnik) und nach Quellportal zur Verfügung.

OrthRus_v2

OrthRus_v2 — расширенная и обновленная версия корпуса. Первая версия, OrthRus_v1, также доступна для поиска.

OrthRus — большой многожанровый корпус русского православного религиозного дискурса, составленный по материалам нескольких порталов и разделов. Данные были собраны в период с декабря 2025 по май 2026 года; текущая версия была скомпилирована в мае 2026 года. Корпус включает новости, тематические статьи, материалы в формате «вопрос–ответ», а также тексты из раздела «Отечник», представляющего собой многожанровую и религиозной литературы, где представлены богословские, научные, публицистические, агиографические и другие типы текстов. В корпусе доступны публичные подкорпуса по жанрам (основной / новости / Q&A / отечник) и по порталам-источникам.

Corpus query interface (NoSketch Engine): https://noske.fisun.org/#dashboard?corpname=orthrus_v2

Tagset and annotation notes: https://corpora.fisun.org/corpus-pages/tagset.html

Korpusabfrage (NoSketch Engine): https://noske.fisun.org/#dashboard?corpname=orthrus_v2

Tagset und Annotationshinweise: https://corpora.fisun.org/corpus-pages/tagset.html

Интерфейс корпусного поиска (NoSketch Engine): https://noske.fisun.org/#dashboard?corpname=orthrus_v2

Тегсет и примечания к аннотации: https://corpora.fisun.org/corpus-pages/tagset.html

Sources

Quellen

Источники

Portal coverage

Portal coverage is intentionally uneven: the corpus is built around high-volume portals and supplemented with smaller sources to increase genre and register diversity.

Portalabdeckung

Die Portalabdeckung ist bewusst ungleichmäßig: Das Korpus konzentriert sich auf große Portale und wird durch kleinere Quellen ergänzt, um die Genre‑ und Registervielfalt zu erhöhen.

Охват порталов

Охват порталов намеренно неравномерен: корпус строится вокруг крупных порталов и дополняется более небольшими источниками, чтобы увеличить жанровое и регистровое разнообразие.

PortalTokensShare (%)
azbyka.ru143,317,22145.8
sedmitza.ru61,085,83819.5
patriarchia.ru47,080,13015.1
foma.ru35,067,28511.2
pravoslavie.ru18,947,8266.1
dialog.elitsy.ru6,764,5012.2
pravmir.ru457,7950.1

Reach

Traffic and audience figures are based on Similarweb (similarweb.com) and are provided only for contextual reference. The snapshot period is February–April 2025.

Reichweite

Besuchs- und Reichweitenzahlen basieren auf Similarweb (similarweb.com) und dienen ausschließlich der kontextuellen Einordnung. Der Erfassungszeitraum ist Februar–April 2025.

Охват аудитории

Данные о трафике и аудитории основаны на Similarweb (similarweb.com) и приводятся только для контекстной ориентировки. Период срезов: февраль–апрель 2025 года.

azbyka.ru

Azbyka.ru is a large Orthodox portal with multiple sections (library, catechesis, Q&A, thematic guides, calendars, media). OrthRus includes only those parts of Azbyka that contain Russian-language Orthodox discourse and fit the corpus scope.

azbyka.ru

Azbyka.ru ist ein großes orthodoxes Portal mit zahlreichen Bereichen (Bibliothek, Katechese, Q&A, thematische Leitfäden, Kalender, Medien). OrthRus enthält nur die Teile von Azbyka, die russischsprachigen orthodoxen Diskurs enthalten und in den Zuschnitt des Korpus passen.

azbyka.ru

Azbyka.ru — крупный православный портал с многочисленными разделами: библиотека, катехизация, вопросы‑ответы, тематические путеводители, календари, медиа. В OrthRus включены только те части Azbyka, которые содержат русскоязычный православный дискурс и соответствуют профилю корпуса.

The list below specifies which Azbyka sections are currently included in the corpus and which are excluded.

Included

Excluded

Die folgende Übersicht zeigt, welche Bereiche von Azbyka derzeit in das Korpus aufgenommen werden und welche ausgeschlossen bleiben.

Enthalten

Nicht enthalten

Ниже указано, какие разделы Azbyka в настоящее время включаются в корпус, а какие остаются за его пределами.

Включено

Исключено

Public subcorpora

OrthRus provides two public dimensions of subcorpora: by genre and by portal. Genre subcorpora reflect the main site‑section types used across portals.

By genre

By portal

Öffentliche Subkorpora

OrthRus bietet zwei öffentliche Dimensionen von Subkorpora: nach Genre und nach Portal. Die Genresubkorpora bilden die wichtigsten Bereichstypen ab, die portalübergreifend verwendet werden.

Nach Genre

Nach Portal

Публичные подкорпуса

В OrthRus доступны два типа публичных подкорпусов с делением по жанру и по порталу. Жанровые подкорпуса отражают основные типы разделов, используемые на разных порталах.

По жанру

По порталу

Document structure

Units and segmentation

<doc> metadata fields

Metadata is extracted from the source websites and normalized where possible. Field availability varies by portal and content type; some values are noisy due to source heterogeneity.

Dokumentstruktur

Einheiten und Segmentierung

Metadatenfelder von <doc>

Die Metadaten werden von den Quellwebsites extrahiert und, soweit möglich, normalisiert. Die Verfügbarkeit einzelner Felder variiert je nach Portal und Inhaltstyp; einige Werte sind aufgrund der Heterogenität der Quellen fehleranfällig.

Структура документа

Единицы и сегментация

Поля метаданных <doc>

Метаданные извлекаются с сайтов-источников и по возможности нормализуются. Наличие отдельных полей зависит от портала и типа материала; часть значений может быть шумной из‑за неоднородности источников.

FieldMeaningBedeutungЗначение
doc.text_idInternal unique identifier for the document in the corpus.Interne eindeutige Kennung des Dokuments im Korpus.Уникальный внутренний идентификатор документа в корпусе.
doc.urlSource URL of the document (when available).Quell-URL des Dokuments (falls verfügbar).URL документа на сайте-источнике (если доступен).
doc.portalSource portal label (azbyka / patriarchia / foma / elitsy / pravmir).Bezeichnung des Quellportals (azbyka / patriarchia / foma / elitsy / pravmir).Метка портала-источника (azbyka / patriarchia / foma / elitsy / pravmir).
doc.titleDocument title (headline) as provided by the source page.Dokumenttitel (Überschrift) gemäß Quellseite.Заголовок документа, как он представлен на исходной странице.
doc.authorAuthor name string when present on the source page.Namensangabe des Autors, sofern auf der Quellseite vorhanden.Имя автора, если оно указано на исходной странице.
doc.statusAuthor status / role descriptor (e.g., “иерей”, “священник”, “архиепископ”, “патриарх”). Values are automatically extracted and may be imperfect.Status- bzw. Rollenbezeichnung des Autors (z.B. „иерей“, „священник“, „архиепископ“, „патриарх“). Die Werte werden automatisch extrahiert und können ungenau sein.Статус или ролевая характеристика автора (например, «иерей», «священник», «архиепископ», «патриарх»). Значения извлекаются автоматически и могут быть неточными.
doc.genreHigh‑level genre label used for public subcorpora: core, news, qa.Genrebezeichnung höherer Ebene für öffentliche Subkorpora: core, news, qa.Жанровая метка верхнего уровня для публичных подкорпусов: core, news, qa.
doc.rubricRubric/section label as defined by the source site.Rubrik- bzw. Bereichsbezeichnung der Quellwebsite.Рубрика или раздел, как они обозначены на сайте-источнике.
doc.pubdateFull publication date (day‑month‑year) when available.Vollständiges Veröffentlichungsdatum (Tag‑Monat‑Jahr), falls verfügbar.Полная дата публикации (день‑месяц‑год), если доступна.
doc.pubyearPublication year only.Nur das Veröffentlichungsjahr.Только год публикации.
doc.languageLanguage label when available (the OrthRus index targets Russian‑language content).Sprachbezeichnung, sofern vorhanden (der OrthRus-Index ist auf russischsprachige Inhalte ausgerichtet).Метка языка, если она доступна (индекс OrthRus ориентирован на русскоязычный контент).
doc.sourceSource/bibliographic string when present (mainly for library‑style materials with edition metadata).Quellen- bzw. bibliographische Angabe, sofern vorhanden (hauptsächlich для библиотечных материалов с данными об издании).Источник или библиографическая строка, если она присутствует (главным образом для материалов библиотечного типа с данными об издании).

Linguistic annotation

The corpus was compiled and annotated automatically using a custom processing pipeline. Texts were harvested from each portal via Python scripts developed specifically for each source; metadata were extracted automatically by dedicated scripts.

Tokenization was implemented in-house. Morphological and syntactic annotation follow the Universal Dependencies (UD) framework. Lemmatization, UPOS tagging, dependency parsing, and morphological feature assignment were performed with UDPipe 1.2 using the SynTagRus model (UD FEATS format).

Tagset and annotation notes: https://corpora.fisun.org/corpus-pages/tagset.html

Size (current index)

Tokens312,720,596
Documents (<doc>)335,589
Sentences (<s>)17,980,458
Q&A answer segments (<answer>)93,552

Corpus profile

OrthRus is dominated by core editorial sections (47,8% of tokens). News accounts for 18,9% of tokens, while Otechnik contributes 28,7%, making it the second‑largest component of the corpus. Q&A accounts for 5.2% and constitutes a distinct dialogic register. The portal contribution is intentionally uneven and reflects both the relative size of the source portals and the selective coverage policy documented above.

Subcorpus sizes (tokens)

Linguistische Annotation

Das Korpus wurde automatisch kompiliert und annotiert, und zwar mit einer autopropriären Verarbeitungspipeline. Die Texte wurden portalweise mittels speziell für jede Quelle entwickelter Python-Skripte erfasst; Metadaten wurden ebenfalls durch dedizierte Skripte automatisch extrahiert.

Die Tokenisierung wurde selbst implementiert. Morphologische und syntaktische Annotation erfolgen im Rahmen von Universal Dependencies (UD). Lemmatisierung, UPOS-Tagging, Dependenzparserung und Zuweisung morphologischer Merkmale wurden mit UDPipe 1.2 unter Verwendung des SynTagRus-Modells durchgeführt (UD-FEATS-Format).

Tagset und Annotationshinweise: https://corpora.fisun.org/corpus-pages/tagset.html

Umfang (aktueller Index)

Token312,720,596
Dokumente (<doc>)335,589
Sätze (<s>)17,980,458
Q&A-Antwortsegmente (<answer>)93,552

Korpusprofil

OrthRus wird von zentralen redaktionellen Sektionen dominiert (47,8% der Token). Nachrichten machen 18,9% der Token aus, während Otechnik mit 28,7% die zweitgrößte Komponente des Korpus bildet. Q&A umfasst 5,2% und stellt ein eigenständiges dialogisches Register dar. Die Beiträge der einzelnen Portale sind bewusst ungleich verteilt und spiegeln sowohl die relativen Größen der Quellportale als auch die oben dokumentierte selektive Abdeckungsstrategie wider.

Größe der Subkorpora (Token)

Лингвистическая аннотация

Корпус собран и автоматически аннотирован с использованием собственного конвейера обработки. Тексты выгружалсиь с каждого портала с помощью Python-скриптов, разработанных специально для каждого источника; метаданные также извлекались автоматически специализированными скриптами.

Токенизация реализована самостоятельно. Морфологическая и синтаксическая аннотация выполнены в рамках универсальных зависимостей (Universal Dependencies, UD). Лемматизация, UPOS-теггинг, построение древовидных зависимостей и присвоение морфологических признаков выполнены с помощью UDPipe 1.2 с использованием модели SynTagRUS (формат UD FEATS).

Тегсет и примечания к аннотации: https://corpora.fisun.org/corpus-pages/tagset.html

Объём (текущий индекс)

Токены312,720,596
Документы (<doc>)335,589
Предложения (<s>)17,980,458
Сегменты ответов Q&A (<answer>)93,552

Профиль корпуса

В OrthRus преобладают основные редакционные разделы (47,8% токенов). Новости составляют 18,9% токенов, а «Отечник» даёт 28,7%, что делает его второй по величине частью корпуса. На Q&A приходится 5,2%; этот сегмент представляет собой особый диалогический регистр. Вклад отдельных порталов намеренно неравномерен и отражает как относительные размеры порталов-источников, так и описанную выше политику выборочного охвата.

Размеры подкорпусов (токены)

SubcorpusTokensShare (%)
genre_core147,767,78247.3
genre_otechnik89,600,84328.7
genre_news59,116,95418.9
genre_qa16,235,0175.2

How to cite

Fisun, Roman. 2026. OrthRus_v2: Russian Orthodox Regiolect Web Corpus. Compiled from azbyka.ru, patriarchia.ru, foma.ru, dialog.elitsy.ru, pravmir.ru, pravoslavie.ru and sedmitza.ru (data collected December 2025–May 2026). Available at: https://corpora.fisun.org/. Accessed: <DD-MM-YYYY>.

Software

Terms of use

Access to this corpus is restricted (password-protected) and provided on an "as is" basis for research and educational use only. This service does not grant any license or other rights to the underlying texts.

The corpus (including any excerpts, downloads, or derived copies of the original texts) is not freely distributable. Reproduction, redistribution, republication, mirroring, or making the content publicly available is prohibited unless you have explicit permission from the respective rights holders and/or the source websites.

Copyright and any other rights in the original texts remain with the respective source websites and/or their authors. Users are solely responsible for ensuring that any use complies with applicable law and the terms of the original sources.

The maintainer makes no warranties regarding completeness, accuracy, fitness for a particular purpose, or continued availability of the service.

Zitierempfehlung

Fisun, Roman. 2026. OrthRus_v2: Webkorpus des russisch-orthodoxen Regiolekts. Zusammengestellt aus azbyka.ru, patriarchia.ru, foma.ru, dialog.elitsy.ru, pravmir.ru, pravoslavie.ru und sedmitza.ru (Datenerhebung Dezember 2025–Mai 2026). Verfügbar unter: https://corpora.fisun.org/. Zugriff: <DD-MM-YYYY>.

Software

Nutzungsbedingungen

Der Zugang zu diesem Korpus ist eingeschränkt (passwortgeschützt) und wird ausschließlich für Forschungs- und Lehrzwecke auf einer "as is"-Basis bereitgestellt. Dieser Dienst gewährt keine Lizenz und keine sonstigen Rechte an den zugrunde liegenden Texten.

Das Korpus (einschließlich Auszügen, Downloads oder abgeleiteten Kopien der Originaltexte) darf nicht frei weiterverbreitet werden. Reproduktion, Weiterverbreitung, Republikation, Spiegelung oder öffentliche Zugänglichmachung sind verboten, sofern keine ausdrückliche Genehmigung der jeweiligen Rechteinhaber und/oder Quellwebsites vorliegt.

Urheberrecht und sonstige Rechte an den Originaltexten verbleiben bei den jeweiligen Quellwebsites und/oder ihren Autoren. Die Nutzer sind selbst dafür verantwortlich, sicherzustellen, dass jede Nutzung mit dem geltenden Recht und den Bedingungen der Originalquellen vereinbar ist.

Der Betreiber übernimmt keine Gewähr für Vollständigkeit, Richtigkeit, Eignung für einen bestimmten Zweck oder die dauerhafte Verfügbarkeit des Dienstes.

Как цитировать

Fisun, Roman. 2026. OrthRus_v2: Веб-корпус русского православного региолекта. Составлен по материалам azbyka.ru, patriarchia.ru, foma.ru, dialog.elitsy.ru, pravmir.ru, pravoslavie.ru и sedmitza.ru (данные собраны в декабре 2025 – мае 2026 года). Доступно по адресу: https://corpora.fisun.org/. Дата обращения: <DD-MM-YYYY>.

Программное обеспечение

Условия использования

Доступ к этому корпусу ограничен (защищён паролем) и предоставляется по принципу "as is" исключительно для исследовательского и образовательного использования. Этот сервис не предоставляет никаких лицензий или иных прав на тексты-источники.

Корпус (включая любые фрагменты, выгрузки или производные копии исходных текстов) не подлежит свободному распространению. Воспроизведение, перераспределение, повторная публикация, зеркалирование или размещение контента в открытом доступе запрещены без явного разрешения соответствующих правообладателей и/или сайтов-источников.

Авторские и иные права на исходные тексты сохраняются за соответствующими сайтами-источниками и/или их авторами. Пользователи несут полную ответственность за то, чтобы любое использование соответствовало применимому праву и условиям оригинальных источников.

Составитель не даёт никаких гарантий в отношении полноты, точности, пригодности для конкретной цели или постоянной доступности сервиса.

ContactKontaktКонтакты

corpora [at] fisun.org