Article bilingue | basculez FR / EN avec le bouton en haut à droite.

Sélection hebdomadaire des papiers ArXiv les plus significatifs en NLP, Speech, LLMs low-resource et langues africaines, avec focus sur les travaux pertinents pour les langues sous-dotées d'Afrique subsaharienne.

Légende des badges

🟢 Impact direct wolof/langues africaines | 🟡 Méthodologie transférable (low-resource) | ⚪ Fondation LLM utile

Modèle de la semaine

Gemma 4 de Google DeepMind

Le 2 avril 2026, Google DeepMind publie Gemma 4 sous licence Apache 2.0 : quatre tailles disponibles (E2B, E4B, 26B MoE et 31B Dense), une fenêtre de contexte de 128 K à 256 K tokens, et un support de 140 langues. Les variantes E2B et E4B intègrent nativement un module ASR audio, ce qui en fait des candidats directs pour les systèmes voix en langues africaines. Le modèle est fine-tunable avec LoRA sur une seule GPU A100.

Licence
Apache 2.0
Tailles
E2B · E4B · 26B MoE · 31B
Contexte
128 K – 256 K tokens
Langues
140+
Audio natif
E2B + E4B
Pertinence Wolof ★★★★☆ (fine-tuning LoRA viable sur ressources limitées ; audio natif sur E2B/E4B)
🟢 DIRECT SPEECH

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

Hillary Mutisya et al. · 2025 · arXiv:2603.29244

Thiomi est un corpus multimodal à grande échelle couvrant des langues africaines sous-dotées d'Afrique de l'Est, dont le swahili. Le dataset atteint un WER de 3,24 % sur Common Voice swahili et fournit des baselines en ASR, traduction automatique et TTS : une ressource de référence pour les chercheurs en langues africaines.

Méthode clé

Fine-tuning wav2vec 2.0 par CTC : la perte CTC aligne les sorties encoder sans segmentation forcée. WER = distance_édition(hypothèse, référence) / longueur(référence). Le transfert cross-linguale depuis l'anglais puis le swahili est le levier principal pour les langues à très faibles ressources.

# Fine-tuning wav2vec2-XLSR for a low-resource African language (Thiomi approach)
from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor, TrainingArguments, Trainer

processor = Wav2Vec2Processor.from_pretrained("facebook/wav2vec2-large-xlsr-53")
model = Wav2Vec2ForCTC.from_pretrained(
    "facebook/wav2vec2-large-xlsr-53",
    ctc_loss_reduction="mean",
    pad_token_id=processor.tokenizer.pad_token_id,
    vocab_size=len(processor.tokenizer),
)
# Freeze feature extractor — fine-tune transformer layers only
model.freeze_feature_extractor()

training_args = TrainingArguments(
    output_dir="./wav2vec2-wolof",
    group_by_length=True,
    per_device_train_batch_size=8,
    gradient_accumulation_steps=2,
    num_train_epochs=30,
    fp16=True,
    learning_rate=3e-4,
)
Pertinence Wolof ★★★★★ (blueprint direct pour ASR wolof avec wav2vec 2.0 XLSR)
🟢 DIRECT NLP

AfrIFact: Cultural Information Retrieval, Evidence Extraction And Fact Checking for African Languages

Israel Abebe Azime et al. · 2025 · arXiv:2604.00706

AfrIFact introduit un benchmark dédié à la vérification factuelle culturelle pour les langues africaines : récupération d'informations, extraction de preuves et détection de désinformation dans un contexte culturellement ancré. Un outil critique pour évaluer la fiabilité des LLMs sur des contenus en langues africaines.

Méthode clé

Pipeline RAG pour fact-checking en trois étapes : (1) BM25 + retrieval dense pour récupérer les preuves, (2) cross-encoder pour le reranking par pertinence, (3) classification NLI tripartite (Supporté / Réfuté / Information insuffisante). Le score F1 macro sur les trois classes est la métrique principale.

Pertinence Wolof ★★★☆☆ (méthodologie applicable ; dataset ne couvre pas encore le wolof)
🟢 DIRECT LLM

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

Anri Lombard et al. (UCT, Jan Buys lab) · 2025 · arXiv:2603.20732

MzansiLM est un modèle de langue auto-régressif de 125 M paramètres entraîné depuis zéro sur les onze langues officielles d'Afrique du Sud, dont neuf sont sous-dotées. Le corpus MzansiText est publié en open source : blueprint direct pour un WolofLM entraîné sur le corpus JokkoLM.

Méthode clé

Architecture decoder-only GPT entraînée par prédiction du token suivant : L = −Σ log p(x_t | x_{<t}). Tokenizer BPE entraîné depuis zéro sur les 11 langues (~32 K vocab) : étape critique pour éviter la fragmentation excessive des langues agglutinantes (zoulou, xhosa, sotho). Perplexité par langue comme métrique de qualité.

# Load MzansiLM from HuggingFace and generate text
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_id = "anrilombard/mzansilm-125m"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.float16)
model.eval()

prompt = "Bonjour, comment allez-vous ?"
inputs = tokenizer(prompt, return_tensors="pt")
with torch.no_grad():
    outputs = model.generate(
        **inputs, max_new_tokens=50, do_sample=True, temperature=0.7
    )
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Pertinence Wolof ★★★★★ (blueprint idéal pour WolofLM : même paradigme decoder-only, corpus similaire)
🟡 TRANSFÉRABLE NLP

Can Large Language Models Understand, Reason About, and Generate Code-Switched Text?

Genta Indra Winata et al. · 2025 · arXiv:2601.07153

CodeMixQA évalue la compréhension, le raisonnement et la génération de texte code-switché par les LLMs via des annotations humaines couvrant 16 paires de langues. Les résultats révèlent des lacunes persistantes dans le traitement des alternances intraphrastiques : point critique pour le wolof, qui alterne fréquemment avec le français.

Méthode clé

Détection des points de commutation (CSP) via identification de langue (LID) token par token. Trois axes d'évaluation : (1) compréhension via QA, (2) raisonnement via chain-of-thought, (3) fidélité de génération mesurée par BLEU sur les alternances attendues. Couverture de 16 paires dont anglais-hindi, anglais-tagalog, anglais-espagnol.

Pertinence Wolof ★★★★★ (wolof-français est le cas de code-switching le plus critique pour l'Afrique de l'Ouest)
⚪ FONDATION LLM

Can Large Language Models Reason and Optimize Under Constraints?

Fabien Bernier, Salah Ghamizi et al. · 2025 · arXiv:2603.23004

Cette étude évalue la capacité des LLMs à raisonner sous contraintes et à résoudre des problèmes d'optimisation combinatoire. Des limitations persistantes sont identifiées sur les problèmes NP-difficiles ; les résultats ouvrent des pistes directes pour la recherche opérationnelle augmentée par LLM.

Méthode clé

Évaluation sur trois classes de problèmes : SAT (satisfiabilité booléenne), ILP (programmation linéaire en nombres entiers) et CP (programmation par contraintes). Les LLMs doivent à la fois générer une solution et la vérifier formellement. Le chain-of-thought améliore les contraintes simples mais échoue sur les problèmes NP-difficiles.

Pertinence Wolof ★★☆☆☆ (utile pour la recherche opérationnelle ; transfert indirect vers NLP low-resource)
⚪ FONDATION LLM

The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level

Jeremy Herbst et al. (Université de Hambourg) · 2025 · arXiv:2604.02178

Ce papier propose une méthode d'interprétabilité pour les modèles Mixture-of-Experts (MoE) : le comportement de chaque expert est analysé individuellement pour cartographier la spécialisation implicite par domaine linguistique. Un outil précieux pour déboguer et aligner les LLMs MoE en production.

Méthode clé

Attribution par expert via analyse des scores de routage : g_i = softmax(W_g · h) pour chaque expert i. Clustering hiérarchique des experts par matrice de co-activation sur des corpus typés (syntaxe, sémantique, morphologie). Révèle des spécialisations inter-langues dans les MoE multilingues.

Pertinence Wolof ★★☆☆☆ (intéressant pour comprendre la spécialisation des experts sur les langues africaines)
⚪ FONDATION ML

Speculating Experts Accelerates Inference for Mixture-of-Experts

Vivan Madan et al. (Université du Maryland) · 2025 · arXiv:2603.19289

En prédisant à l'avance les experts activés grâce aux représentations internes du modèle, ce travail réduit significativement la latence d'inférence des modèles MoE sans réentraînement. Une avancée directement applicable au déploiement de LLMs multilingues sur des infrastructures contraintes.

Méthode clé

Prédiction spéculative des experts : un prédicteur léger f(h_{l-1}) → top-k experts est entraîné sur les états cachés de la couche précédente. Cela permet de précharger les poids des experts avant leur activation effective. Réduction de latence de ~30 % sur Mixtral-8x7B sans dégradation de qualité mesurable.

Pertinence Wolof ★★☆☆☆ (pertinent pour déployer des MoE multilingues sur infrastructure limitée)
Veille automatique

Ce digest est généré chaque dimanche soir par l'agent Cowork de PSW. Review lundi matin puis git push.