← Retour au blog

Digest SOTA — Semaine 18 · 2026 : Speech LLM pour le Wolof, AfriLangTutor et AfriNLLB

🇫🇷 Vous lisez en français. Pour la version anglaise, cliquez sur EN en haut à droite.
Légende des badges de pertinence

🟢 DIRECT : applicable immédiatement au Wolof ou aux langues africaines. 🟡 TRANSFERABLE : méthodologie transférable avec adaptation. ⚪ FONDATION : avancée générale LLM impactant indirectement le low-resource.

Modèle de la semaine

Voxtral-4B-TTS de Mistral AI

Mistral a publié en mars 2026 Voxtral-4B-TTS, un modèle de synthèse vocale multilingue de 4 milliards de paramètres, entièrement open-source. Sa conception repose sur un décodeur autorégressif unique qui génère directement les tokens audio à partir du texte, sans passer par une représentation phonémique intermédiaire. Le modèle propose 20 voix prédéfinies avec une latence très faible et supporte neuf langues : anglais, français, espagnol, allemand, italien, portugais, néerlandais, arabe et hindi. Pour les travaux sur le Wolof, Voxtral constitue une base de transfert intéressante : son architecture autoregressive et sa prise en charge du français permettent d'envisager un fine-tuning ciblé sur des données Wolof-Français, en particulier pour les scénarios de code-switching oral.

Licence
Apache 2.0
Paramètres
4 B
Architecture
Décodeur autorégressif audio
Voix prédéfinies
20
Langues
EN, FR, ES, DE, IT, PT, NL, AR, HI
Pertinence Wolof ★★★☆☆ (Support du français utilisable pour fine-tuning Wolof-FR ; pas de support Wolof natif)

La semaine en 5 papiers

Deux papiers dominent cette semaine par leur impact direct sur le Wolof. Le premier présente le tout premier Speech LLM entraîné exclusivement sur cette langue : 860 heures de données de qualité, un encodeur HuBERT adapté et un mécanisme de Chain-of-Thought pour la transcription et la traduction. Le second, AfriNLLB présenté à l'atelier AfricaNLP 2026, propose des modèles de traduction compressés et accélérés pour 15 paires de langues dont le Wolof, sans perte de qualité mesurable. Dans le domaine du NLP, AfriLangTutor introduit une approche systématique pour construire des tuteurs LLM dans 10 langues africaines à partir d'un dictionnaire de 194 700 entrées. Lugha-Llama de Princeton complète le tableau avec un Llama-3.1-8B continûment pré-entraîné sur 10 milliards de tokens africains, atteignant les meilleures performances open-source sur IrokoBench. Enfin, Align2Speak propose une voie nouvelle pour la TTS en contexte low-resource : remplacer les données de préférence annotées par un signal de récompense ASR via GRPO, une piste directement applicable à la synthèse vocale en Wolof.

🟢 DIRECT SPEECH · ASR · LLM

Speech Language Models for Under-Represented Languages: Insights from Wolof

Yaya Sy, Dioula Doucouré, Christophe Cerisara, Irina Illina · 2025 · arXiv:2509.15362

Ce papier décrit la construction du premier Speech LLM pour le Wolof. Les auteurs collectent 1,4 To de parole brute, filtrée à 860 heures de haute qualité, puis continuent le pré-entraînement de HuBERT sur ce corpus. L'encodeur adapté est ensuite intégré à un LLM Wolof pour former un modèle de parole capable de transcription ASR et de traduction vocale. Une couche de Chain-of-Thought est ajoutée pour permettre au modèle de raisonner avant de produire la transcription finale, améliorant les deux tâches sans supervision supplémentaire.

Méthode clé

(1) Continued pretraining HuBERT sur 860h de parole Wolof non supervisée, filtrage qualité par VAD + SNR. (2) Projection linéaire des représentations HuBERT vers l'espace de tokens du LLM Wolof. (3) Chain-of-Thought : le modèle génère un raisonnement intermédiaire avant la transcription ou la traduction finale, guidé uniquement par le format de la séquence de sortie.

# Load HuBERT encoder continued on Wolof speech
from transformers import HubertModel, AutoTokenizer
import torch

# Continued-pretrained HuBERT encoder
encoder = HubertModel.from_pretrained("path/to/wolof-hubert")
encoder.eval()

# Project speech features to LLM input space
projector = torch.nn.Linear(encoder.config.hidden_size, llm_hidden_size)

def encode_speech(waveform: torch.Tensor) -> torch.Tensor:
    """Extract and project Wolof speech features."""
    with torch.no_grad():
        features = encoder(waveform).last_hidden_state  # (B, T, 768)
    return projector(features)  # (B, T, llm_hidden_size)
Pertinence Wolof ★★★★★ (Travail 100% Wolof : premier Speech LLM pour cette langue, avec corpus, encodeur et modèle publiés)
🟢 DIRECT NLP · TRANSLATION AfricaNLP 2026

AfriNLLB: Efficient Translation Models for African Languages

Yasmin Moslem, Aman Kassahun Wassie, Amanuel Gizachew Abebe · 2026 · arXiv:2602.09373

AfriNLLB compresse le modèle NLLB-200 600M via un élagage itératif de couches et une quantification, puis le réentraîne par distillation de connaissance depuis un modèle professeur plus large sur des corpus parallèles africains. Le résultat : des modèles de traduction jusqu'à 57% plus rapides que la base, couvrant 30 directions de traduction pour 15 paires incluant le Wolof, l'Hausa, le Swahili et l'Amharic, sans dégradation mesurable du score BLEU.

Méthode clé

(1) Élagage itératif : suppression progressive des couches les moins utiles de NLLB-200 600M selon un critère d'importance des activations. (2) Quantification FP16 du modèle élagué, accélération supplémentaire de 37%. (3) Knowledge distillation sur corpus parallèles africains : le modèle élagué est fine-tuné pour reproduire les distributions de sortie du modèle professeur non compressé, maintenant la qualité BLEU à iso-architecture réduite.

# Translate Wolof to English using AfriNLLB compressed model
from transformers import NllbTokenizer, AutoModelForSeq2SeqLM

model_id = "AfriNLP/AfriNLLB-wolof-en"  # compressed NLLB-200 variant
tokenizer = NllbTokenizer.from_pretrained(model_id)
model = AutoModelForSeq2SeqLM.from_pretrained(model_id)

def translate_wolof(text: str) -> str:
    """Translate Wolof text to English via AfriNLLB."""
    inputs = tokenizer(text, return_tensors="pt", src_lang="wol_Latn")
    tokens = model.generate(
        **inputs,
        forced_bos_token_id=tokenizer.lang_code_to_id["eng_Latn"],
        max_new_tokens=256,
    )
    return tokenizer.decode(tokens[0], skip_special_tokens=True)
Pertinence Wolof ★★★★★ (Wolof explicitement supporté dans les 15 paires de langues, modèles publiés sur HuggingFace)
🟢 DIRECT NLP · LLM · EDUCATION

AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models

Tadesse Destaw Belay (IPN Mexico), Shahriar Kabir Nahin, Ocean Monjur, Anshuman Chhabra (Univ. of South Florida), Israel Abebe Azime (Saarland Univ.), Shamsuddeen Hassan Muhammad (Imperial College London), Seid Muhie Yimam (Univ. Hamburg) · 2026 · arXiv:2604.20996

AfriLangTutor introduit AfriLangDict, un dictionnaire de 194 700 entrées couvrant 10 langues africaines, utilisé pour générer automatiquement AfriLangEdu : 78 900 exemples d'entraînement multi-tours pour SFT et DPO. Deux LLM sont fine-tunés sur ce corpus : Llama-3-8B-IT et Gemma-3-12B-IT. Les modèles résultants surpassent leurs bases respectives de 1,8% à 15,5% selon l'évaluation LLM-as-a-judge, avec les gains les plus forts sur les langues les moins dotées.

Méthode clé

(1) Graine de données : AfriLangDict agrège 194 700 entrées dictionnaire multilingues (langue africaine + anglais) pour 10 langues. (2) Génération automatique d'interactions tuteur-étudiant multi-tours à partir du dictionnaire via un LLM instructeur. (3) SFT suivi de DPO sur AfriLangEdu : la combinaison des deux phases donne les gains les plus élevés, le DPO renforçant les réponses pédagogiques correctes contre les alternatives moins précises.

Pertinence Wolof ★★★★☆ (Wolof inclus dans les 10 langues cibles ; la méthodologie dictionnaire-to-SFT/DPO est directement réplicable)
🟢 DIRECT LLM · PRETRAINING

Lugha-Llama: Adapting Large Language Models for African Languages

Happy Buzaaba, Alexander Wettig, David Ifeoluwa Adelani, Christiane Fellbaum (Princeton University, Mila) · 2025 · arXiv:2504.06536

Lugha-Llama adapte Llama-3.1-8B aux langues africaines par un continued pretraining sur 10 milliards de tokens multilingues. La clé de la méthode : combiner des données africaines curées avec des textes éducatifs anglais de haute qualité, traduits en Swahili à 200 millions de tokens. Sur IrokoBench, les trois variantes publiées atteignent les meilleures performances parmi les modèles open-source de taille similaire, avec un gain de plus de 10% sur AfriQA en question-réponse cross-linguale.

Méthode clé

(1) Corpus mixte : données africaines (web crawl filtré, Common Crawl multilingue) + 200M tokens éducatifs anglais traduits en Swahili. (2) Continued pretraining de Llama-3.1-8B sur 10B tokens total avec un ratio africain dominant. (3) Analyse ablative révélant que c'est le contenu des données éducatives (et non la langue source) qui explique la majorité des gains sur AfriMMLU.

Pertinence Wolof ★★★☆☆ (Approche continued pretraining applicable au Wolof ; corpus principalement Swahili et langues avec plus de données)
🟡 TRANSFERABLE TTS · SPEECH

Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization

Shehzeen Hussain, Paarth Neekhara et al. · 2025 · arXiv:2509.21718

Align2Speak résout un problème central du TTS low-resource : l'absence de données de préférence annotées. Le cadre propose trois étapes : entraînement d'une base TTS multilingue avec des tokens IPA, fine-tuning sur les données cibles limitées, puis optimisation par GRPO en utilisant un modèle ASR pré-entraîné comme signal de récompense combiné à la similarité locuteur et la qualité audio. Le modèle final surpasse le fine-tuning seul et les méthodes d'alignement offline comme DPO en intelligibilité, similarité locuteur et qualité perçue.

Méthode clé

(1) Base TTS multilingue avec tokens IPA : représentation phonémique universelle garantissant le transfert cross-lingual. (2) Fine-tuning sur texte+parole de la langue cible (quelques heures suffisent). (3) GRPO en ligne : récompense composite R = w1·WER_ASR + w2·SIM_locuteur + w3·PESQ_qualité, optimisée sans annotations humaines de préférence. La politique se met à jour à chaque batch de synthèse, rendant l'alignement continu et adaptatif.

Pertinence Wolof ★★★☆☆ (Méthodologie GRPO+ASR-reward directement applicable à la TTS Wolof ; pas d'expériences sur des langues africaines dans le papier)

Ce que cette semaine signifie pour le Wolof

La semaine 18 marque une convergence rare : trois papiers adressent le Wolof ou les langues sénégalaises de manière directe et outillée. Le Speech LLM de Sy et al. pose la fondation technique de la parole profonde en Wolof. AfriNLLB fournit un modèle de traduction prêt à déployer. AfriLangTutor ouvre la voie au tutorat LLM en Wolof à partir d'un dictionnaire. Ce triangle de ressources constitue aujourd'hui la base la plus complète disponible pour construire des applications vocales et linguistiques en Wolof. Lugha-Llama et Align2Speak ajoutent deux briques méthodologiques : la recette de continued pretraining à fort ratio de données éducatives, et l'alignement TTS par feedback ASR sans annotation. Les deux techniques sont directement transposables dans un pipeline Wolof-first.