News archive
New project notes and publications will appear here when they are available.
Latest updates
Project notes, releases, and research updates in a calmer reading layout.
Kontextualisierung als Schlüssel: Optimierung der maschinellen Übersetzung für das Ladinische mit großen Sprachmodellen
Wir freuen uns mitteilen zu können, dass unsere Forschungsarbeit "Every Word Presented in Context: Syntactic Coverage as Objective for Low-Resource Machine Translation with Large Language Models" für die 15th Language Resources and Evaluation Conference (LREC 2026) akzeptiert wurde. Die Ergebnisse unserer Studie werden am 15. Mai in Palma de Mallorca präsentiert.
AlignFix: Unser Tool für parallele Korpora bei der EACL 2026!
Wir freuen uns bekannt zu geben, dass unser Beitrag zu AlignFix für die EACL 2026 in Marokko akzeptiert wurde!
KI-gestützte Transkription, Übersetzung und Zusammenfassung in Echtzeit – mit besonderem Fokus auf das Ladinische
Wir freuen uns, die Veröffentlichung unserer wissenschaftlichen Dokumentation zu TransLoco bekanntzugeben – einem frei verfügbaren, selbst gehosteten Framework, das Audio in Echtzeit transkribiert, übersetzt und automatisch zusammenfasst. Das Projekt wurde im Rahmen der Konferenz Medien-Wissen-Bildung 2025 erstmals live demonstriert.
KI-basierte Schreibassistenz für das Ladinische
Im Rahmen unseres Forschungsprojekts am Institut für Informatik der Universität Innsbruck in Kooperation mit dem Ladinischen Kulturinstitut "Micurá de Rü" veröffentlichen wir nun einen ersten Prototyp für eine intelligente ladinische Schreibassistenz.
WMT 2025 - Bringing Ladin to FLORES+
Wir freuen uns, einen wichtigen Meilenstein unserer gemeinsamen Forschungsarbeit vorstellen zu können. Mit dem Beitrag „Bringing Ladin to FLORES+“ wurde Ladin in den internationalen Evaluationsdatensatz FLORES+ für maschinelle Übersetzung integriert. Unsere Arbeit wurde im Rahmen der Open Language Data Initiative Shared Task 2025 in Suzhou (China) präsentiert.
Samuel beim 8. Forum der Europäischen Minderheitenregionen
Am 26. und 27. November 2024 fand in Donostia/San Sebastián das 8. Forum der Europäischen Minderheitenregionen statt. Organisiert von der Föderalistische Union Europäischer Nationalitäten (FUEN) und dem baskischen Sprachindustrie-Cluster LANGUNE, war die Veranstaltung ein Treffpunkt für Vertreter*innen aus Politik, Wissenschaft, Industrie und Minderheitenregionen. Im Fokus standen die Chancen und Herausforderungen der Digitalisierung für Minderheitensprachen, insbesondere durch den Einsatz von Künstlicher Intelligenz (KI).
Neuronale Maschinelle Übersetzung erstmals für Ladinisch angewendet
Wir berichten über unsere ersten Schritte zur Anwendung moderner neuronaler Übersetzungstechnologien auf das Ladinische. In unserer Publikation „Traduzione automatica ‘neurale’ per il ladino della Val Badia“ haben wir untersucht, wie datengetriebene Ansätze der Neural Machine Translation (NMT) auch für eine Sprache mit begrenzten Ressourcen adaptiert werden können.
Vergleich von Back‑Translation‑Methoden auf dem LoResMT 2024‑Workshop präsentiert
Beim Seventh Workshop on Technologies for Machine Translation of Low‑Resource Languages (LoResMT 2024) in Bangkok, Thailand, wurde unser Beitrag „Rule‑Based, Neural and LLM Back‑Translation: Comparative Insights from a Variant of Ladin“ vorgestellt. Die Arbeit untersucht die Wirkung unterschiedlicher Back‑Translation‑Ansätze auf die maschinelle Übersetzung für das Ladinische (Variante Val Badia) im Kontext sehr begrenzter paralleler Daten (ca. 18 000 Ladinisch‑Italienisch Satzpaare). Neben einem feinabgestimmten neuronalen Modell wurden synthetische Trainingsdaten mithilfe eines regelbasierten Systems sowie eines großen Sprachmodells erzeugt und miteinander verglichen. Die Experimente zeigen, dass alle Ansätze in dieser Low‑Resource‑Situation ähnliche Übersetzungsqualität erreichen
Erste Experimente und Publikation zur maschinellen Übersetzung für Ladinisch
Erste Untersuchungen im Bereich der maschinellen Übersetzung für Ladinisch wurden erfolgreich durchgeführt. Ziel dieser Experimente war es, die Grundlagen für digitale Sprachressourcen zu schaffen und das Potenzial moderner KI-Methoden für eine Low-Resource-Sprache wie Ladinisch zu evaluieren. Die Ergebnisse dieser Arbeiten wurden in einem ersten Arbeitsbericht in der Ladinia XLVI (2022) veröffentlicht und bilden die Basis für weiterführende Forschung, die den Einsatz von KI-Technologien für das Ladinische voranbringen soll.
Papers and publications
Open project papers directly as PDFs. Cards show the first-page preview when an image is available.
Every Word Presented in Context: Syntactic Coverage as Objective for Low-Resource Machine Translation with Large Language Models
This paper introduces Fragment-Shot Prompting, a few-shot prompting method that retrieves examples for every word in the input sentence. It evaluates low-resource translation between Italian, Ladin Val Badia, and Ladin Gherdëina across several large language models.
Open PDF
AlignFix: A Tool for Parallel Corpora Augmentation and Refinement
AlignFix is an open-source browser-based tool for augmenting, inspecting, and correcting parallel corpora. It uses word alignments to extract consistent phrase pairs, support targeted replacements, and keep alignments updated locally on the client side.
Open PDF
TransLoco: AI-Driven Real-Time Transcription, Translation, and Summarization
TransLoco is a self-hosted free-software framework for near real-time transcription, translation, and summarization of audio streams. The paper presents a local deployment path for advanced AI tools and includes an Italian-Ladin translation model optimized for fast inference.
Open PDF
Bringing Ladin to FLORES+
This paper extends the FLORES+ dataset for the Ladin Val Badia and Gherdëina variants and releases additional parallel datasets. It validates the resources with state-of-the-art large language models and neural machine translation systems.
Open PDF
LaTeXMT: Machine Translation for LaTeX Documents
LaTeXMT is a structure-preserving source-to-source translation tool for LaTeX documents. It separates translatable text from document structure so machine translation systems can process LaTeX source while preserving markup.
Open PDF
Rule-Based, Neural and LLM Back-Translation: Comparative Insights from a Variant of Ladin
This paper compares rule-based, neural, and large-language-model back-translation for machine translation in the Val Badia variant of Ladin. It establishes baseline results and analyzes the effect of synthetic data in a low-resource setting.
Open PDF
Traduzione automatica "neurale" per il ladino della Val Badia
This article presents a neural machine translation approach for the Val Badia variant of Ladin. It discusses low-resource translation challenges, limited parallel data, and the role of Dolomitic Ladin variants.
Open PDF
Arbeitsbericht: Maschinelle Übersetzung für das Gadertalische
This working report documents machine translation for Gadertal Ladin, framing Ladin as a low-resource language and discussing data, methods, and digital language technology for a protected minority language.
Open PDFPresentazione al Convegno Lessicografia tradizionale e in rete in una quotidianità plurilingue
Al convegno scientifico “Lessicografia tradizionale e in rete in una quotidianità plurilingue” dedicato a Luca Serianni (30-31 marzo 2023, Eurac Research, Bolzano) abbiamo presentato il nostro contributo “Traduzione automatica per il ladino della Val Badia”. In questa relazione è stato esaminato come la traduzione automatica neurale (NMT) possa essere applicata al ladino, nonostante le risorse di dati limitate e la presenza di diverse varietà regionali. La presentazione ha reso visibili i primi risultati della ricerca e ha mostrato come le moderne tecnologie di traduzione possano essere trasferite a una lingua con risorse limitate.
Open PDF