Sélection hebdomadaire des papiers ArXiv les plus significatifs en NLP, Speech, LLMs low-resource et langues africaines, avec focus sur les travaux pertinents pour les langues sous-dotées d'Afrique subsaharienne.
🟢 Impact direct wolof/langues africaines | 🟡 Méthodologie transférable (low-resource) | ⚪ Fondation LLM utile
Gemma 4 de Google DeepMind
Le 2 avril 2026, Google DeepMind publie Gemma 4 sous licence Apache 2.0 : quatre tailles disponibles (E2B, E4B, 26B MoE et 31B Dense), une fenêtre de contexte de 128 K à 256 K tokens, et un support de 140 langues. Les variantes E2B et E4B intègrent nativement un module ASR audio, ce qui en fait des candidats directs pour les systèmes voix en langues africaines. Le modèle est fine-tunable avec LoRA sur une seule GPU A100.
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
Thiomi est un corpus multimodal à grande échelle couvrant des langues africaines sous-dotées d'Afrique de l'Est, dont le swahili. Le dataset atteint un WER de 3,24 % sur Common Voice swahili et fournit des baselines en ASR, traduction automatique et TTS : une ressource de référence pour les chercheurs en langues africaines.
Fine-tuning wav2vec 2.0 par CTC : la perte CTC aligne les sorties encoder sans segmentation forcée. WER = distance_édition(hypothèse, référence) / longueur(référence). Le transfert cross-linguale depuis l'anglais puis le swahili est le levier principal pour les langues à très faibles ressources.
# Fine-tuning wav2vec2-XLSR for a low-resource African language (Thiomi approach)
from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor, TrainingArguments, Trainer
processor = Wav2Vec2Processor.from_pretrained("facebook/wav2vec2-large-xlsr-53")
model = Wav2Vec2ForCTC.from_pretrained(
"facebook/wav2vec2-large-xlsr-53",
ctc_loss_reduction="mean",
pad_token_id=processor.tokenizer.pad_token_id,
vocab_size=len(processor.tokenizer),
)
# Freeze feature extractor — fine-tune transformer layers only
model.freeze_feature_extractor()
training_args = TrainingArguments(
output_dir="./wav2vec2-wolof",
group_by_length=True,
per_device_train_batch_size=8,
gradient_accumulation_steps=2,
num_train_epochs=30,
fp16=True,
learning_rate=3e-4,
)
AfrIFact: Cultural Information Retrieval, Evidence Extraction And Fact Checking for African Languages
AfrIFact introduit un benchmark dédié à la vérification factuelle culturelle pour les langues africaines : récupération d'informations, extraction de preuves et détection de désinformation dans un contexte culturellement ancré. Un outil critique pour évaluer la fiabilité des LLMs sur des contenus en langues africaines.
Pipeline RAG pour fact-checking en trois étapes : (1) BM25 + retrieval dense pour récupérer les preuves, (2) cross-encoder pour le reranking par pertinence, (3) classification NLI tripartite (Supporté / Réfuté / Information insuffisante). Le score F1 macro sur les trois classes est la métrique principale.
MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages
MzansiLM est un modèle de langue auto-régressif de 125 M paramètres entraîné depuis zéro sur les onze langues officielles d'Afrique du Sud, dont neuf sont sous-dotées. Le corpus MzansiText est publié en open source : blueprint direct pour un WolofLM entraîné sur le corpus JokkoLM.
Architecture decoder-only GPT entraînée par prédiction du token suivant : L = −Σ log p(x_t | x_{<t}). Tokenizer BPE entraîné depuis zéro sur les 11 langues (~32 K vocab) : étape critique pour éviter la fragmentation excessive des langues agglutinantes (zoulou, xhosa, sotho). Perplexité par langue comme métrique de qualité.
# Load MzansiLM from HuggingFace and generate text
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
model_id = "anrilombard/mzansilm-125m"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.float16)
model.eval()
prompt = "Bonjour, comment allez-vous ?"
inputs = tokenizer(prompt, return_tensors="pt")
with torch.no_grad():
outputs = model.generate(
**inputs, max_new_tokens=50, do_sample=True, temperature=0.7
)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Can Large Language Models Understand, Reason About, and Generate Code-Switched Text?
CodeMixQA évalue la compréhension, le raisonnement et la génération de texte code-switché par les LLMs via des annotations humaines couvrant 16 paires de langues. Les résultats révèlent des lacunes persistantes dans le traitement des alternances intraphrastiques : point critique pour le wolof, qui alterne fréquemment avec le français.
Détection des points de commutation (CSP) via identification de langue (LID) token par token. Trois axes d'évaluation : (1) compréhension via QA, (2) raisonnement via chain-of-thought, (3) fidélité de génération mesurée par BLEU sur les alternances attendues. Couverture de 16 paires dont anglais-hindi, anglais-tagalog, anglais-espagnol.
Can Large Language Models Reason and Optimize Under Constraints?
Cette étude évalue la capacité des LLMs à raisonner sous contraintes et à résoudre des problèmes d'optimisation combinatoire. Des limitations persistantes sont identifiées sur les problèmes NP-difficiles ; les résultats ouvrent des pistes directes pour la recherche opérationnelle augmentée par LLM.
Évaluation sur trois classes de problèmes : SAT (satisfiabilité booléenne), ILP (programmation linéaire en nombres entiers) et CP (programmation par contraintes). Les LLMs doivent à la fois générer une solution et la vérifier formellement. Le chain-of-thought améliore les contraintes simples mais échoue sur les problèmes NP-difficiles.
The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level
Ce papier propose une méthode d'interprétabilité pour les modèles Mixture-of-Experts (MoE) : le comportement de chaque expert est analysé individuellement pour cartographier la spécialisation implicite par domaine linguistique. Un outil précieux pour déboguer et aligner les LLMs MoE en production.
Attribution par expert via analyse des scores de routage : g_i = softmax(W_g · h) pour chaque expert i. Clustering hiérarchique des experts par matrice de co-activation sur des corpus typés (syntaxe, sémantique, morphologie). Révèle des spécialisations inter-langues dans les MoE multilingues.
Speculating Experts Accelerates Inference for Mixture-of-Experts
En prédisant à l'avance les experts activés grâce aux représentations internes du modèle, ce travail réduit significativement la latence d'inférence des modèles MoE sans réentraînement. Une avancée directement applicable au déploiement de LLMs multilingues sur des infrastructures contraintes.
Prédiction spéculative des experts : un prédicteur léger f(h_{l-1}) → top-k experts est entraîné sur les états cachés de la couche précédente. Cela permet de précharger les poids des experts avant leur activation effective. Réduction de latence de ~30 % sur Mixtral-8x7B sans dégradation de qualité mesurable.
Ce digest est généré chaque dimanche soir par l'agent Cowork de PSW. Review lundi matin puis git push.