This corpus uses the Universal Dependencies (UD) annotation scheme as implemented in the UD Russian SynTagRus treebank.
Dieses Korpus verwendet das Universal‑Dependencies‑Annotationsschema (UD), wie es im UD Russian SynTagRus‑Treebank implementiert ist.
Этот корпус использует схему аннотирования Universal Dependencies (UD) в том виде, как она реализована в дереве UD Russian SynTagRus.
One sentence in the corpusEin Satz aus dem KorpusОдно предложение из корпуса
The corpus is stored as a vertical file. Each sentence (<s>) contains one line per token with a fixed set of columns. The example below illustrates the exact token-level annotation format used in this corpus.
Das Korpus ist als vertikale Datei gespeichert. Jeder Satz (<s>) enthält eine Zeile pro Token mit einem festen Satz von Spalten. Das folgende Beispiel zeigt das genaue tokenbasierte Annotationsformat dieses Korpus.
Корпус хранится в виде файла vertical. Каждое предложение (<s>) содержит одну строку на токен с фиксированным набором столбцов. Пример ниже иллюстрирует точный формат аннотации на уровне токенов, используемый в этом корпусе.
Example (sentence <s>)Beispiel (Satz <s>)Пример (предложение <s>)
UD treebanks are normally stored in CoNLL-U format, where each token is represented by multiple columns (ID, FORM, LEMMA, UPOS, XPOS, FEATS, HEAD, DEPREL, etc.).
In this corpus, each <s> sentence uses a truncated CoNLL-U representation: only the fields required for search are retained, and unused columns are omitted.
UD‑Treebanks werden normalerweise im CoNLL‑U‑Format gespeichert, wobei jeder Token durch mehrere Spalten repräsentiert wird (ID, FORM, LEMMA, UPOS, XPOS, FEATS, HEAD, DEPREL usw.).
In diesem Korpus verwendet jeder Satz <s> eine gekürzte CoNLL‑U‑Darstellung: Nur die für die Suche benötigten Felder werden beibehalten, nicht verwendete Spalten werden weggelassen.
Трибанки UD обычно хранятся в формате CoNLL‑U, где каждый токен представлен несколькими столбцами (ID, FORM, LEMMA, UPOS, XPOS, FEATS, HEAD, DEPREL и т.д.).
В этом корпусе каждое предложение <s> использует сокращенное представление CoNLL‑U: сохраняются только поля, необходимые для поиска, а неиспользуемые столбцы опущены.
Mapping to corpus attributesZuordnung zu KorpusattributenСоответствие атрибутам корпуса
Corpus attributeKorpusattributАтрибут корпуса
MeaningBedeutungЗначение
CoNLL‑U analogue
id
Token number within the sentenceToken‑Nummer innerhalb des SatzesНомер токена в предложении
ID
word
Surface word formOberflächenform des WortesПоверхностная форма слова
FORM
lemma
LemmaLemmaЛемма
LEMMA
tag
POS tag (UPOS)POS‑Tag (UPOS)Частеречная метка (UPOS)
<feat> — morphologische Merkmale (UD FEATS) kodiert als Merkmal=Wert‑Paare getrennt durch |. Fehlen Merkmale, ist der Wert _.
Морфологическая аннотация:
<tag> — частеречная метка (UD UPOS; 17 универсальных частей речи).
<feat> — морфологические признаки (UD FEATS) в виде пар Признак=Значение, разделенных |. Если признаков нет — значение _.
<tag>: POS tags<tag>: POS‑Tags<tag>: частеречные теги
The corpus uses 17 POS tags: ADJ, ADP, ADV, AUX, CCONJ, DET, INTJ, NOUN, NUM, PART, PRON, PROPN, PUNCT, SCONJ, SYM, VERB, X.
ADJ — adjective
ADP — adposition
ADV — adverb
AUX — auxiliary
CCONJ — coordinating conjunction
DET — determiner
INTJ — interjection
NOUN — common noun
NUM — numeral
PART — particle
PRON — pronoun
PROPN — proper noun
PUNCT — punctuation
SCONJ — subordinating conjunction
SYM — symbol
VERB — lexical verb
X — other
Das Korpus verwendet 17 POS‑Tags: ADJ, ADP, ADV, AUX, CCONJ, DET, INTJ, NOUN, NUM, PART, PRON, PROPN, PUNCT, SCONJ, SYM, VERB, X.
ADJ — Adjektiv
ADP — Adposition
ADV — Adverb
AUX — Hilfsverb
CCONJ — nebenordnende Konjunktion
DET — Determinierer
INTJ — Interjektion
NOUN — Substantiv
NUM — Numerale
PART — Partikel
PRON — Pronomen
PROPN — Eigenname
PUNCT — Interpunktion
SCONJ — subordinierende Konjunktion
SYM — Symbol
VERB — Vollverb
X — Sonstiges
Корпус использует 17 частеречных меток: ADJ, ADP, ADV, AUX, CCONJ, DET, INTJ, NOUN, NUM, PART, PRON, PROPN, PUNCT, SCONJ, SYM, VERB, X.
ADJ — прилагательное
ADP — послелог/предлог
ADV — наречие
AUX — вспомогательный глагол
CCONJ — сочинительный союз
DET — определитель
INTJ — междометие
NOUN — имя существительное
NUM — числительное
PART — частица
PRON — местоимение
PROPN — имя собственное
PUNCT — пунктуация
SCONJ — подчинительный союз
SYM — символ
VERB — знаменательный глагол
X — прочее
<feat>: Morphological categories<feat>: Morphologische Kategorien<feat>: Морфологические категории
The corpus uses UD‑style feature bundles: Feature=Value pairs separated by |, e.g. Case=Nom|Gender=Masc|Number=Sing. In UD Russian SynTagRus, the feature inventory includes Animacy, Aspect, Case, Degree, Gender, Mood, Number, Person, PronType, Tense, Variant, VerbForm, Voice, and others.
Feature bundles by POS (full lists)
Click on a POS tag to see the morphological categories and values attested in UD Russian SynTagRus.
Das Korpus verwendet UD‑artige Merkmalsbündel: Merkmal=Wert‑Paare, getrennt durch |, z.B. Case=Nom|Gender=Masc|Number=Sing. Im UD Russian SynTagRus umfasst das Inventar u.a. Animacy, Aspect, Case, Degree, Gender, Mood, Number, Person, PronType, Tense, Variant, VerbForm, Voice.
Merkmalsbündel nach POS (vollständige Listen)
Klicken Sie auf ein POS‑Tag, um die morphologischen Kategorien und Werte zu sehen, die im UD Russian SynTagRus belegt sind.
Корпус использует наборы признаков в стиле UD: пары Признак=Значение, разделенные |, например Case=Nom|Gender=Masc|Number=Sing. В UD Russian SynTagRus перечень признаков включает Animacy, Aspect, Case, Degree, Gender, Mood, Number, Person, PronType, Tense, Variant, VerbForm, Voice и другие.
Наборы признаков по частям речи (полные списки)
Нажмите на название части речи, чтобы увидеть морфологические категории и значения, засвидетельствованные в UD Russian SynTagRus.
PronType: Prs (personal), Dem (demonstrative), Int (interrogative), Rel (relative), Ind (indefinite), Neg (negative), Tot (total/universal), Emp (emphatic).
Case (Kasus), Gender (Genus), Number (Numerus), Animacy (Belebtheit), NameType (Namensart: Geo, Prs, Giv, Sur, Com, Pro, Nat, Oth).
Case (падеж), Gender (род), Number (число), Animacy (одушевлённость), NameType (тип имени: Geo, Prs, Giv, Sur, Com, Pro, Nat, Oth).
PUNCT
Punctuation tokens have no morphological features (feat=_).
Interpunktionszeichen haben keine morphologischen Merkmale (feat=_).
Знаки пунктуации не имеют морфологических признаков (feat=_).
SCONJ
Subordinating conjunctions typically have no morphological features (feat=_).
Subordinierende Konjunktionen haben in der Regel keine morphologischen Merkmale (feat=_).
Подчинительные союзы обычно не имеют морфологических признаков (feat=_).
SYM
Symbols typically have no morphological features (feat=_).
Symbole haben in der Regel keine morphologischen Merkmale (feat=_).
Символы обычно не имеют морфологических признаков (feat=_).
X
The tag X is used for other or unknown tokens; morphological features are typically empty (feat=_).
Das Tag X wird für andere oder unbekannte Tokens verwendet; morphologische Merkmale sind in der Regel leer (feat=_).
Метка X используется для прочих или неизвестных токенов; морфологические признаки обычно отсутствуют (feat=_).
Syntactic annotation:
<head> — head token ID, i.e. the syntactic governor of the current token. The root token has head=0.
<deprel> — dependency relation label, describing the syntactic function of the token relative to its head.
Syntaktische Annotation:
<head> — Kopf‑ID, d.h. der syntaktische Governor des aktuellen Tokens. Das Wurzel‑Token hat head=0.
<deprel> — Dependenzrelation, die die syntaktische Funktion des Tokens relativ zu seinem Kopf beschreibt.
Синтаксическая аннотация:
<head> — ID вершины (синтаксического главного токена). Корневой токен имеет head=0.
<deprel> — метка синтаксической зависимости, описывающая функцию токена по отношению к его вершине.
<head>: Head index<head>: Kopf‑Index<head>: Индекс вершины
The head column stores the ID of the syntactic governor of the current token. The dependency structure forms a single rooted tree over the tokens of the sentence.
head is an integer pointing to another token’s id.
head=0 means the token is the sentence root.
head and deprel must be interpreted together.
Example from the sample sentence: должен has head=0 (root); войти has head=12; человек has head=4.
Die Spalte head speichert die ID des syntaktischen Governors des aktuellen Tokens. Die Abhängigkeitsstruktur bildet einen einzigen Wurzelbaum über die Tokens des Satzes.
head ist eine Ganzzahl, die auf die id eines anderen Tokens zeigt.
head=0 bedeutet, dass der Token die Satzwurzel ist.
head und deprel müssen zusammen interpretiert werden.
Beispiel aus dem Beispielsatz: должен hat head=0 (Wurzel); войти hat head=12; человек hat head=4.
Столбец head хранит ID синтаксического главного токена. Структура зависимостей образует единое корневое дерево над токенами предложения.
head — целое число, указывающее на id другого токена.
head=0 означает, что токен является корнем предложения.
head и deprel интерпретируются вместе.
Пример из примера предложения: должен имеет head=0 (корень); войти имеет head=12; человек имеет head=4.
<deprel>: Dependency relations<deprel>: Dependenzrelationen<deprel>: Синтаксические зависимости
Lyashevskaya, O., Droganova, K., Zeman, D., Alexeeva, M., Gavrilova, T., Mustafina, N., & Shakurova, E. (2016). Universal Dependencies for Russian: A New Syntactic Dependencies Tagset. SSRN Electronic Journal. https://doi.org/10.2139/ssrn.2859998. Full-text copy: ResearchGate.
Lyashevskaya, O., Droganova, K., Zeman, D., Alexeeva, M., Gavrilova, T., Mustafina, N., & Shakurova, E. (2016). Universal Dependencies for Russian: A New Syntactic Dependencies Tagset. SSRN Electronic Journal. https://doi.org/10.2139/ssrn.2859998. Full-text copy: ResearchGate.
Lyashevskaya, O., Droganova, K., Zeman, D., Alexeeva, M., Gavrilova, T., Mustafina, N., & Shakurova, E. (2016). Universal Dependencies for Russian: A New Syntactic Dependencies Tagset. SSRN Electronic Journal. https://doi.org/10.2139/ssrn.2859998. Full-text copy: ResearchGate.