vix.ing · top · new · best · stats · spec

VIELKO - Vietnamesisches Lernerkorpus

2023/07/26 by Thi Bao Van Ho
#Deutsch als Fremdsprache #German as a Foreign Language #Korpus #Lernerkorpus #Lernersprache #corpus #learner corpus #learner language

paper · doi:10.48694/kordaf.3739

Abstract

Das Vietnamesische Lernerkorpus (VieLko) wird seit 2017 im Rahmen eines laufenden, gemeinsamen Projekts zwischen zwei Hochschulen in Vietnam entwickelt und gilt als die erste landesweit, systematisiert aufgebaute Datensammlung mit sprachlichen Produkten von vietnamesischen Studierenden des Deutschen als Fremdsprache (DaF). Das Korpus umfasst sowohl geschriebene als auch gesprochene Lernerdaten: Die geschriebenen Daten wurden bisher mit vier Annotationsarten versehen, die gesprochenen Daten bleiben stets in ihrer digitaler Rohform. Seit Juni 2022 steht VieLko externen Forschenden sowie Interessierten mit beschränkter Zugänglichkeit zur Verfügung: Mithilfe einer lokal gespeicherten Kopie des Korpus haben Nutzer*innen die Möglichkeit, Konkordanzen in Bezug auf folgende Aspekte zu erstellen und auszusuchen: Tokenisierung, Lemmatisierung, Wortart, erste Zielhypothese. In der nächsten Entwicklungsphase (2023–2024) wird angestrebt, den freien Zugang zu den vorhandenen Korpusdaten auf einem Repositorium zu ermöglichen, sowie den Umfang des Datenbestandes zu erweitern.The Vietnamese Learner Corpus (VieLko) came into development in 2017 as a result of an on-going, joint project between two universities in Vietnam and is the first nationwide, systematically established database with data from Vietnamese students learning German as a Foreign Language. The corpus comprises not only written, but also spoken data: The written data have undergone linguistic processing and now contain four types of annotation, while the spoken data are left intact in their digital raw form. Since June 2022, VieLko has been, with limited access, available to the public through the use of a local copy that enables users to create and search for concordances with regard to the following aspects: tokenisation, lemmatisation, parts of speech, and first level target hypothesis. In the next phase of development (2023–2024), the existing corpus data will be published on a repository with free access to external users, while new data will also be collected to widen the scope of the corpus.

Related