🟢 DIRECT : applicable immédiatement au Wolof ou aux langues africaines. 🟡 TRANSFERABLE : méthodologie transférable avec adaptation. ⚪ FONDATION : avancée générale LLM impactant indirectement le low-resource.
Voxtral-4B-TTS de Mistral AI
Mistral a publié en mars 2026 Voxtral-4B-TTS, un modèle de synthèse vocale multilingue de 4 milliards de paramètres, entièrement open-source. Sa conception repose sur un décodeur autorégressif unique qui génère directement les tokens audio à partir du texte, sans passer par une représentation phonémique intermédiaire. Le modèle propose 20 voix prédéfinies avec une latence très faible et supporte neuf langues : anglais, français, espagnol, allemand, italien, portugais, néerlandais, arabe et hindi. Pour les travaux sur le Wolof, Voxtral constitue une base de transfert intéressante : son architecture autoregressive et sa prise en charge du français permettent d'envisager un fine-tuning ciblé sur des données Wolof-Français, en particulier pour les scénarios de code-switching oral.
La semaine en 5 papiers
Deux papiers dominent cette semaine par leur impact direct sur le Wolof. Le premier présente le tout premier Speech LLM entraîné exclusivement sur cette langue : 860 heures de données de qualité, un encodeur HuBERT adapté et un mécanisme de Chain-of-Thought pour la transcription et la traduction. Le second, AfriNLLB présenté à l'atelier AfricaNLP 2026, propose des modèles de traduction compressés et accélérés pour 15 paires de langues dont le Wolof, sans perte de qualité mesurable. Dans le domaine du NLP, AfriLangTutor introduit une approche systématique pour construire des tuteurs LLM dans 10 langues africaines à partir d'un dictionnaire de 194 700 entrées. Lugha-Llama de Princeton complète le tableau avec un Llama-3.1-8B continûment pré-entraîné sur 10 milliards de tokens africains, atteignant les meilleures performances open-source sur IrokoBench. Enfin, Align2Speak propose une voie nouvelle pour la TTS en contexte low-resource : remplacer les données de préférence annotées par un signal de récompense ASR via GRPO, une piste directement applicable à la synthèse vocale en Wolof.
Speech Language Models for Under-Represented Languages: Insights from Wolof
Ce papier décrit la construction du premier Speech LLM pour le Wolof. Les auteurs collectent 1,4 To de parole brute, filtrée à 860 heures de haute qualité, puis continuent le pré-entraînement de HuBERT sur ce corpus. L'encodeur adapté est ensuite intégré à un LLM Wolof pour former un modèle de parole capable de transcription ASR et de traduction vocale. Une couche de Chain-of-Thought est ajoutée pour permettre au modèle de raisonner avant de produire la transcription finale, améliorant les deux tâches sans supervision supplémentaire.
(1) Continued pretraining HuBERT sur 860h de parole Wolof non supervisée, filtrage qualité par VAD + SNR. (2) Projection linéaire des représentations HuBERT vers l'espace de tokens du LLM Wolof. (3) Chain-of-Thought : le modèle génère un raisonnement intermédiaire avant la transcription ou la traduction finale, guidé uniquement par le format de la séquence de sortie.
# Load HuBERT encoder continued on Wolof speech
from transformers import HubertModel, AutoTokenizer
import torch
# Continued-pretrained HuBERT encoder
encoder = HubertModel.from_pretrained("path/to/wolof-hubert")
encoder.eval()
# Project speech features to LLM input space
projector = torch.nn.Linear(encoder.config.hidden_size, llm_hidden_size)
def encode_speech(waveform: torch.Tensor) -> torch.Tensor:
"""Extract and project Wolof speech features."""
with torch.no_grad():
features = encoder(waveform).last_hidden_state # (B, T, 768)
return projector(features) # (B, T, llm_hidden_size)
AfriNLLB: Efficient Translation Models for African Languages
AfriNLLB compresse le modèle NLLB-200 600M via un élagage itératif de couches et une quantification, puis le réentraîne par distillation de connaissance depuis un modèle professeur plus large sur des corpus parallèles africains. Le résultat : des modèles de traduction jusqu'à 57% plus rapides que la base, couvrant 30 directions de traduction pour 15 paires incluant le Wolof, l'Hausa, le Swahili et l'Amharic, sans dégradation mesurable du score BLEU.
(1) Élagage itératif : suppression progressive des couches les moins utiles de NLLB-200 600M selon un critère d'importance des activations. (2) Quantification FP16 du modèle élagué, accélération supplémentaire de 37%. (3) Knowledge distillation sur corpus parallèles africains : le modèle élagué est fine-tuné pour reproduire les distributions de sortie du modèle professeur non compressé, maintenant la qualité BLEU à iso-architecture réduite.
# Translate Wolof to English using AfriNLLB compressed model
from transformers import NllbTokenizer, AutoModelForSeq2SeqLM
model_id = "AfriNLP/AfriNLLB-wolof-en" # compressed NLLB-200 variant
tokenizer = NllbTokenizer.from_pretrained(model_id)
model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
def translate_wolof(text: str) -> str:
"""Translate Wolof text to English via AfriNLLB."""
inputs = tokenizer(text, return_tensors="pt", src_lang="wol_Latn")
tokens = model.generate(
**inputs,
forced_bos_token_id=tokenizer.lang_code_to_id["eng_Latn"],
max_new_tokens=256,
)
return tokenizer.decode(tokens[0], skip_special_tokens=True)
AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models
AfriLangTutor introduit AfriLangDict, un dictionnaire de 194 700 entrées couvrant 10 langues africaines, utilisé pour générer automatiquement AfriLangEdu : 78 900 exemples d'entraînement multi-tours pour SFT et DPO. Deux LLM sont fine-tunés sur ce corpus : Llama-3-8B-IT et Gemma-3-12B-IT. Les modèles résultants surpassent leurs bases respectives de 1,8% à 15,5% selon l'évaluation LLM-as-a-judge, avec les gains les plus forts sur les langues les moins dotées.
(1) Graine de données : AfriLangDict agrège 194 700 entrées dictionnaire multilingues (langue africaine + anglais) pour 10 langues. (2) Génération automatique d'interactions tuteur-étudiant multi-tours à partir du dictionnaire via un LLM instructeur. (3) SFT suivi de DPO sur AfriLangEdu : la combinaison des deux phases donne les gains les plus élevés, le DPO renforçant les réponses pédagogiques correctes contre les alternatives moins précises.
Lugha-Llama: Adapting Large Language Models for African Languages
Lugha-Llama adapte Llama-3.1-8B aux langues africaines par un continued pretraining sur 10 milliards de tokens multilingues. La clé de la méthode : combiner des données africaines curées avec des textes éducatifs anglais de haute qualité, traduits en Swahili à 200 millions de tokens. Sur IrokoBench, les trois variantes publiées atteignent les meilleures performances parmi les modèles open-source de taille similaire, avec un gain de plus de 10% sur AfriQA en question-réponse cross-linguale.
(1) Corpus mixte : données africaines (web crawl filtré, Common Crawl multilingue) + 200M tokens éducatifs anglais traduits en Swahili. (2) Continued pretraining de Llama-3.1-8B sur 10B tokens total avec un ratio africain dominant. (3) Analyse ablative révélant que c'est le contenu des données éducatives (et non la langue source) qui explique la majorité des gains sur AfriMMLU.
Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization
Align2Speak résout un problème central du TTS low-resource : l'absence de données de préférence annotées. Le cadre propose trois étapes : entraînement d'une base TTS multilingue avec des tokens IPA, fine-tuning sur les données cibles limitées, puis optimisation par GRPO en utilisant un modèle ASR pré-entraîné comme signal de récompense combiné à la similarité locuteur et la qualité audio. Le modèle final surpasse le fine-tuning seul et les méthodes d'alignement offline comme DPO en intelligibilité, similarité locuteur et qualité perçue.
(1) Base TTS multilingue avec tokens IPA : représentation phonémique universelle garantissant le transfert cross-lingual. (2) Fine-tuning sur texte+parole de la langue cible (quelques heures suffisent). (3) GRPO en ligne : récompense composite R = w1·WER_ASR + w2·SIM_locuteur + w3·PESQ_qualité, optimisée sans annotations humaines de préférence. La politique se met à jour à chaque batch de synthèse, rendant l'alignement continu et adaptatif.
Ce que cette semaine signifie pour le Wolof
La semaine 18 marque une convergence rare : trois papiers adressent le Wolof ou les langues sénégalaises de manière directe et outillée. Le Speech LLM de Sy et al. pose la fondation technique de la parole profonde en Wolof. AfriNLLB fournit un modèle de traduction prêt à déployer. AfriLangTutor ouvre la voie au tutorat LLM en Wolof à partir d'un dictionnaire. Ce triangle de ressources constitue aujourd'hui la base la plus complète disponible pour construire des applications vocales et linguistiques en Wolof. Lugha-Llama et Align2Speak ajoutent deux briques méthodologiques : la recette de continued pretraining à fort ratio de données éducatives, et l'alignement TTS par feedback ASR sans annotation. Les deux techniques sont directement transposables dans un pipeline Wolof-first.