← Retour au blog

Digest SOTA — Semaine 19 · 2026 : Bambara 612h, MoE hétérogène et Reasoning RL

🇫🇷 Vous lisez en français. Pour la version anglaise, cliquez sur EN en haut à droite.
Légende des badges de pertinence

🟢 DIRECT : applicable immédiatement au Wolof ou aux langues africaines. 🟡 TRANSFERABLE : méthodologie transférable avec adaptation. ⚪ FONDATION : avancée générale LLM impactant indirectement le low-resource.

Modèle de la semaine

OmniASR de Meta AI — reconnaissance vocale pour 1 600 langues

Meta AI a publié en novembre 2025 OmniASR, une suite de modèles de reconnaissance vocale automatique couvrant plus de 1 600 langues, dont plus de 500 jamais prises en charge par aucun système ASR auparavant. La famille s'étend de variantes compactes de 300 millions de paramètres (modèle CTC, déployable sur des appareils à faible puissance) à des modèles de 7 milliards de paramètres basés sur un décodeur de type LLM. L'approche combine un pré-entraînement auto-supervisé à grande échelle sur un corpus de 1,4 million d'heures, puis un fine-tuning supervisé sur des données labellisées pour des centaines de langues. Pour les langues africaines, la construction du corpus s'est appuyée sur des partenariats avec African Next Voices (Université de Maseno au Kenya, Université de Pretoria), NaijaVoices et d'autres consortiums communautaires, incluant des langues comme le Serer, l'Igala et l'Urhobo. Le taux d'erreur en caractères reste inférieur à 10% pour 78% des 1 600 langues couvertes. L'ensemble des modèles est publié sous licence Apache 2.0, avec le corpus d'entraînement sous CC-BY-4.0.

Licence
Apache 2.0
Tailles
300M (CTC), 1B (LLM), 7B (LLM)
Architecture
SSL 7B + décodeur LLM
Langues couvertes
1 600+
Données d'entraînement
1,4M heures (CC-BY-4.0)
Pertinence Wolof ★★★★☆ (1 600 langues couvertes incluant des langues ouest-africaines voisines ; base de transfert solide pour un ASR Wolof par fine-tuning)

La semaine en 6 papiers

La contribution la plus concrète de cette semaine vient du Mali. L'équipe de RobotsMali publie 612 heures de parole spontanée en Bambara, annotées semi-automatiquement, accompagnées de plusieurs modèles ultra-compacts directement utilisables. C'est le résultat d'un travail de terrain rigoureux, mené dans des conditions low-resource réelles. Sur le plan des fondations LLM, trois papiers avancent le front de l'architecture Mixture of Experts : MoHGE réduit de 20% le nombre de paramètres total à performance égale via un routage à deux niveaux, Expert Upcycling économise 32% des heures GPU en expandant progressivement les experts depuis un checkpoint dense, et Marco-MoE d'Alibaba ouvre l'ère des MoE multilingues entièrement open-source avec seulement 5% des paramètres activés par token. En parallèle, une analyse empirique sur 12 langues et 3 LLM populaires démontre que l'anglais n'est pas la langue la mieux couverte par ces modèles, une observation cruciale pour penser l'évaluation des langues africaines. Enfin, un nouveau cadre de renforcement traite la fonction de récompense elle-même comme un objet d'optimisation, ouvrant une voie prometteuse pour aligner des modèles sur des signaux non supervisés.

🟢 DIRECT SPEECH · NLP

Dealing with the Hard Facts of Low-Resource African NLP

Yacouba Diarra, Nouhoum Souleymane Coulibaly, Panga Azazia Kamaté, Madani Amadou Tall, Emmanuel Élisé Koné, Aymane Dembélé, Michael Leventhal (RobotsMali AI4D Lab, Bamako) · 2025 · arXiv:2511.18557

L'équipe de RobotsMali a collecté sur le terrain 612 heures de parole spontanée en Bambara, une langue mandé à plus de 15 millions de locuteurs en Afrique de l'Ouest. Le corpus est annoté semi-automatiquement avec transcriptions et traductions françaises. À partir de ces données, plusieurs modèles monolingues ultra-compacts et de petite taille sont entraînés et évalués, selon une procédure d'évaluation automatique et humaine. L'ensemble du corpus, des modèles, du code de collecte et d'annotation est rendu public, constituant la ressource ASR open-source la plus complète pour le Bambara à ce jour.

Méthode clé

(1) Collecte terrain : 612h de parole spontanée au Mali via le projet African Next Voices, avec annotation semi-automatique par VAD et post-correction humaine. (2) Entraînement de modèles ultra-compacts (type Conformer ou fine-tuning Whisper tiny/small) sur le corpus Bambara sans accès à des données cross-linguale volumineuses. (3) Évaluation double : métriques automatiques WER et CER, plus une évaluation humaine de la qualité de transcription selon les locuteurs natifs.

# Fine-tune Whisper-tiny on Bambara corpus from RobotsMali
from transformers import WhisperForConditionalGeneration, WhisperProcessor
from datasets import load_dataset

# Load RobotsMali Bambara corpus (selon disponibilité HuggingFace)
dataset = load_dataset("robotsmali/bambara-asr-612h", split="train")
processor = WhisperProcessor.from_pretrained("openai/whisper-tiny", language="Bambara")
model = WhisperForConditionalGeneration.from_pretrained("openai/whisper-tiny")

def preprocess_batch(batch):
    """Prepare audio features and tokenized labels for Whisper fine-tuning."""
    audio = batch["audio"]
    batch["input_features"] = processor(
        audio["array"], sampling_rate=audio["sampling_rate"]
    ).input_features[0]
    batch["labels"] = processor.tokenizer(batch["transcription"]).input_ids
    return batch

dataset = dataset.map(preprocess_batch, remove_columns=dataset.column_names)
Pertinence Wolof ★★★★☆ (Pipeline collecte terrain directement réplicable pour le Wolof ; modèles ultra-compacts adaptés aux contraintes de déploiement africaines)
🟡 TRANSFERABLE NLP · LLM · EVALUATION

Multilingual Large Language Models do not comprehend all natural languages to equal degrees

Natalia Moskvina, Raquel Montero, Masaya Yoshida, Ferdy Hubers, Paolo Morosi, Walid Irhaymi, Jin Yan, Tamara Serrano, Elena Pagliarini, Fritz Günther, Evelina Leivada · 2026 · arXiv:2602.20065

Cette étude évalue trois LLM populaires sur une tâche de compréhension linguistique dans 12 langues, représentant cinq familles : indo-européenne, afro-asiatique, turcique, sino-tibétaine et japonique. Le résultat le plus saillant renverse une hypothèse courante : l'anglais n'est pas la langue la mieux couverte. Ce sont plusieurs langues romanes, même moins dotées en données, qui surpassent systématiquement l'anglais. Les modèles restent en deçà des performances humaines pour toutes les langues testées, mais l'écart varie fortement selon la famille linguistique et la quantité de données d'entraînement.

Méthode clé

(1) Protocole de compréhension linguistique : tâche de jugement de grammaticalité et d'acceptabilité, standardisée via des stimuli contrôlés pour éviter les biais de formulation. (2) Prompting identique dans chaque langue cible, sans traduction de l'anglais, pour garantir une évaluation native. (3) Comparaison croisée LLM vs humains natifs via des scores d'accord, révélant l'écart systématique par famille linguistique.

Pertinence Wolof ★★★☆☆ (Aucune langue africaine dans les 12 testées, mais le protocole d'évaluation est directement applicable au Wolof pour quantifier l'écart de compréhension)
⚪ FONDATION MoE · LLM · ARCHITECTURE

Mixture of Heterogeneous Grouped Experts for Language Modeling

Zhicheng Ma, Xiang Liu, Zhaoxiang Liu, Ning Wang, Yi Shen, Kai Wang, Shuming Shi, Shiguo Lian (China Unicom, Data Science and AI Research Institute) · 2026 · arXiv:2604.23108

MoHGE introduit un routage à deux niveaux pour les architectures Mixture of Experts : un premier niveau sélectionne un groupe d'experts de types différents, un second niveau choisit parmi les experts au sein du groupe. Cette hétérogénéité contrôlée permet d'adapter dynamiquement le calcul selon le token traité. Les expériences montrent que MoHGE atteint les performances des MoE classiques tout en réduisant de 20% le nombre total de paramètres, avec une utilisation GPU mieux équilibrée entre les experts.

Méthode clé

(1) Groupes d'experts hétérogènes : chaque groupe combine des experts de capacités différentes (FFN large, FFN étroit, expert à convolution) plutôt que des experts identiques comme dans le MoE standard. (2) Routage hiérarchique : le router de niveau 1 sélectionne un groupe par score de softmax, le router de niveau 2 sélectionne un expert dans ce groupe, réduisant le coût de routage total. (3) Équilibrage de charge via une pénalité auxiliaire sur la distribution d'activation des groupes, évitant l'effondrement sur un sous-ensemble d'experts.

Pertinence Wolof ★★☆☆☆ (Avancée architecturale générale MoE ; réduction de 20% des paramètres utile pour déploiements contraints, pas d'expérience sur langues africaines)
⚪ FONDATION MoE · LLM · EFFICACITÉ

Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts

Chaitanya Dwivedi, Binxuan Huang, Himanshu Gupta, Pratik Jayarao, Neeraj Varshney, Bing Yin · 2026 · arXiv:2604.19835

Expert Upcycling propose une méthode pour convertir progressivement un modèle dense en MoE pendant l'entraînement continu, sans partir de zéro. Le principe : dupliquer les poids du modèle dense pour créer les experts initiaux (warm initialization), puis continuer le pré-entraînement pour briser la symétrie entre experts dupliqués et les pousser à se spécialiser. Une sélection des experts à dupliquer par scores d'importance basés sur les gradients (utility-based expert selection) triple le bénéfice quand les ressources de calcul sont limitées. Les expériences sur des modèles de 7B à 13B paramètres totaux montrent que la validation loss atteint celle d'un MoE de référence avec 32% de GPU-heures économisées.

Méthode clé

(1) Warm init MoE : copier les poids du modèle dense N fois pour créer N experts identiques, garantissant que le MoE initial est équivalent au dense en performance. (2) Continued pretraining (CPT) : l'entraînement brise la symétrie entre experts copiés par l'effet des gradients de différents batches, forçant la spécialisation. (3) Utility-based selection : plutôt que de dupliquer tous les blocs FFN, sélectionner ceux avec les scores d'importance gradient les plus élevés, concentrant l'expansion là où le gain marginal est maximal.

Pertinence Wolof ★★☆☆☆ (Technique d'expansion MoE économique en GPU-heures, pertinente pour continuer le pré-entraînement de modèles africains à moindre coût)
🟡 TRANSFERABLE MoE · LLM · MULTILINGUAL

Marco-MoE: Open Multilingual Mixture-of-Expert Language Models with Efficient Upcycling

Fan Jiang, Yu Zhao, Chenyang Lyu, Tianqi Shi, Yichao Du, Feihu Jiang, Longyue Wang, Weihua Luo (Alibaba International Digital Commerce) · 2026 · arXiv:2604.25578

Marco-MoE est une suite de modèles MoE multilingues entièrement open-source publiés par Alibaba International Digital Commerce. L'architecture est conçue pour une sparsité extrême : seulement 5% des paramètres totaux sont activés par token en entrée. Cette sparsité, combinée à un upcycling depuis des modèles denses, permet un pré-entraînement sur 5 000 milliards de tokens. Les variantes Marco-MoE-Instruct surpassent des modèles concurrents possédant 3 à 14 fois plus de paramètres activés. L'analyse du routage révèle que le modèle apprend des patterns d'activation d'experts structurés et partagés entre langues proches, tout en maintenant une spécialisation haute pour les langues linguistiquement isolées.

Méthode clé

(1) Upcycling depuis dense : Marco-MoE démarre depuis un checkpoint dense pré-entraîné, duplication des poids pour warm init des experts, continuant le pré-entraînement sur 5T tokens multilingues. (2) Sparsité extrême de 5% d'activation par token : chaque forward pass n'active qu'un sous-ensemble très réduit d'experts, rendant l'inférence aussi rapide qu'un modèle dense de taille bien inférieure. (3) Analyse du routage par langue : les langues linguistiquement proches partagent des experts communs, les langues isolées activent des experts spécialisés distincts, permettant une expansion à de nouvelles langues sans interférence catastrophique.

Pertinence Wolof ★★★☆☆ (MoE multilingue open-source avec analyse de routage par langue ; la spécialisation d'experts par famille linguistique est prometteuse pour intégrer le Wolof comme nouvelle langue cible)
⚪ FONDATION LLM · REASONING · RL

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning

Arash Ahmadi, Sarah Sharif, Yaser (Mike) Banad (INQUIRE Lab, University of Oklahoma) · 2026 · arXiv:2605.02073

Ce papier traite la conception de la fonction de récompense comme un problème d'optimisation à part entière, plutôt qu'un choix fixe d'ingénierie. Le cadre proposé génère des fonctions de récompense candidates par un LLM frontier, les valide automatiquement, puis sélectionne les meilleures via des runs courts de GRPO (500 étapes) sur Llama-3.2-3B-Instruct avec LoRA. Les fonctions gagnantes sont ensuite utilisées pour un entraînement complet par renforcement. L'approche améliore les performances de raisonnement sur GSM8K sans nécessiter d'annotation humaine des récompenses.

Méthode clé

(1) Génération de récompenses candidates : un LLM frontier (GPT-4 class) génère N fonctions de récompense Python vérifiables pour une tâche de raisonnement donnée. (2) Screening court : chaque fonction candidate est testée via un run GRPO de 500 étapes sur Llama-3.2-3B-Instruct+LoRA, classée par F1 sur GSM8K test. (3) Entraînement complet : la meilleure fonction identifiée est utilisée pour l'entraînement RL final, permettant une amélioration du raisonnement sans annotation humaine de préférence.

# Search-driven reward selection via short GRPO screening runs
# Adapted from INQUIRELAB/search-reward-rl (Apache 2.0)
from trl import GRPOTrainer, GRPOConfig
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

# Candidate reward function generated by the frontier LLM
def candidate_reward_fn(completions: list[str], ground_truths: list[str]) -> list[float]:
    """Verifiable reward: exact match on numeric answer after parsing."""
    rewards = []
    for completion, gt in zip(completions, ground_truths):
        pred = extract_final_answer(completion)  # regex-based parser
        rewards.append(1.0 if pred == gt else 0.0)
    return rewards

# Short screening run (500 steps) to evaluate this candidate
config = GRPOConfig(
    model_name="meta-llama/Llama-3.2-3B-Instruct",
    max_steps=500,
    use_peft=True,  # LoRA adaptation
    learning_rate=1e-5,
)
trainer = GRPOTrainer(
    model=model,
    reward_funcs=[candidate_reward_fn],
    config=config,
    train_dataset=gsm8k_train,
)
trainer.train()  # evaluate F1 on test set after these 500 steps
Pertinence Wolof ★★☆☆☆ (Cadre d'optimisation de récompenses applicable à tout signal vérifiable, y compris un signal ASR-WER pour l'alignement de TTS Wolof)

Ce que cette semaine signifie pour le low-resource

Trois lignes se dégagent de cette semaine 19. La première est pratique : le travail de RobotsMali sur le Bambara démontre une fois de plus que les données collectées sur le terrain, avec rigueur et en co-construction avec les communautés locales, restent la voie la plus directe vers des ressources ASR exploitables. La recette est connue, le pipeline est réplicable, et la priorité pour le Wolof reste la même : volume de parole transcrite, diversité des locuteurs, et annotation de qualité. La deuxième ligne est architecturale : trois papiers MoE publiés en même semaine signalent que l'architecture sparse devient la norme pour les modèles fondationnels à grande échelle. Les gains en efficacité (20% de paramètres en moins, 32% de GPU-heures économisées) sont précisément ce dont les équipes africaines ont besoin pour pré-entraîner ou fine-tuner sans accès à des clusters massifs. La troisième ligne est épistémologique : l'analyse de Moskvina et al. rappelle que les LLM actuels ne couvrent pas équitablement toutes les langues, et que quantifier cet écart pour le Wolof et les langues sénégalaises est une étape nécessaire avant de déployer ces outils dans des contextes non anglophones.