⚙ Architecture
Trois backends STSpeech-to-text : traduction directe audio → texte anglais, sans étape de transcription française intermédiaire. → glossaire (audio → texte EN) ou quasi-directs, sélectionnés par model.type dans le YAML. InférenceUtilisation du modèle déjà entraîné : on charge les poids et on traduit, sans phase d’apprentissage sur m-TEDx. → glossaire seule — pas d’entraînement sur m-TEDx.
Positionnement : la variante 3 (Gemini) donne le meilleur BLEUScore standard de qualité de traduction (0–100). → glossaire (~41) mais repose sur une API fermée et non reproductible. La variante 4 (cascade ASR→MTDeux modèles en série : transcription française (ASR) puis traduction texte (MT). Voir variante 4., ~37) est ouverte mais en deux étapes. La variante 6 teste des systèmes speech-to-textTraduction directe de la parole en texte anglais, en un seul modèle. → glossaire récents, directement comparables à Gemini sur la tâche audio→anglais.
Protocole : mêmes manifestsFichiers TSV (valid.tsv, test.tsv) listant les segments audio et leurs références pour l’évaluation. → glossaire valid.tsv / test.tsv (utteranceDécoupage par énoncé : chaque segment = une phrase parlée. → glossaire), mêmes artefacts eval/sacrebleu_*.txt et protocol.json que les variantes 3–4.
⚡ Modèles testés
BackendIdentifiant du modèle dans la config YAML (model.type). | Modèle | RunIdentifiant d’une expérience d’évaluation. → glossaire | BLEU testScore BLEU sur le jeu de test (échelle 0–100). → glossaire | État |
|---|---|---|---|---|
canary_1b |
nvidia/canary-1b-v2 |
run_074 |
40,04 | ok — meilleur open ST |
seamless_m4t_v2 |
facebook/seamless-m4t-v2-large |
run_073 / 075b_* |
38,02 | ok |
whisper_st |
openai/whisper-large-v3 |
run_072 / 075_* |
36,65 | ok |
canary_1b |
nvidia/canary-1b-v2 |
run_074 (tentative) |
0,00 | échec env (torch/NeMo) |
run_072→073→074 — SeamlessM4T (**38,02**) et Whisper (**36,60**) proches de la cascadePipeline ASR puis MT (variante 4), ~37,4 BLEU sur utterance. → variante 4 (**37,4**) ; Canary **40,04** test (meilleur open ST). Une tentative Canary a échoué (compatibilité torch/NeMo).
★ Meilleur run · Canary-1B
run_074 — meilleur système open weightsPoids publiés, reproductibles localement (pas d’API fermée). → glossaire du projet, à ~1 pt de Gemini 3.5 Flash (41,1). Zero-shotModèle utilisé tel quel, sans entraînement sur m-TEDx. → glossaire sur m-TEDx FR→EN, même protocole SacreBLEUImplémentation standardisée du BLEU. → glossaire que les variantes 3–4.
- Modèle
nvidia/canary-1b-v2(NeMoBibliothèque NVIDIA pour modèles de parole (ASR, ST) — backend de Canary.EncDecMultiTaskModel)- Tâche
task="ast"(speech translationTraduction directe de la parole en texte (audio → texte cible), sans transcription française intermédiaire. → glossaire) ·source_lang=fr·target_lang=en- Config
6_open_baselines/configs/fr-en/canary_1b.yaml- SegmentationFaçon de découper l’audio en segments. → glossaire
- utteranceDécoupage par énoncé : chaque segment = une phrase parlée. → glossaire — manifestsFichiers TSV listant les segments audio à évaluer. → glossaire
datasets/manifests/fr-en/{valid,test}.tsv - Entrée
- Fichier WAV entier du segment (pas de chunking) · filtre m-TEDx typ. 1–30 s
- PromptConsigne textuelle donnée au modèle. → glossaire texte
- Aucun — pas de consigne naturelle ; les langues source/cible sont passées à l’API NeMo
- Sortie
- Texte anglais libre ·
max_new_tokensNombre maximal de tokens générés. → glossaire: 256dans le YAML (non branché côté Canary S3T) - Précision
- float16Nombres à demi-précision : moins de mémoire GPU, calcul plus rapide. ·
device: cuda(GPUProcesseur graphique utilisé pour l’inférence. → glossaire) - Machine
- Modyco (venv
.venv-canary+ NeMo) · 10 juil. 2026 · scriptrun_modyco_open_canary_074.sh - Échec antérieur
- OVH : incompatibilité torch/NeMo → BLEUScore de qualité de traduction (0–100). → glossaire 0 (environnement, pas le modèle)
run_081, config préparée) et une analyse par buckets de durée sur run_074 sont prévus — voir page Résultats · contexte.
⚖ Avantages et inconvénients
| Détail | |
|---|---|
| Forces | Reproductible (poids ouvertsLes poids du modèle sont publiés (Hugging Face, NeMo…) — pas d’API propriétaire. → glossaire, pas d’API) ; même protocole que Gemini ; plusieurs candidats pour maximiser les chances ; documentable pour un rapport académique |
| Faiblesses | Dépendances lourdes (NeMo pour Canary) ; scores encore sous Gemini (~41) ; biais « données déjà vues » possible (TED en ligne) — comme pour Whisper et Gemini |
| Références | Gemini ~41 BLEUScore de qualité de traduction (0–100). → glossaire (variante 3) · Cascade ~37 (variante 4) · baseline article Pantagruel 25,2 (→ glossaire) |
🔧 Pistes d’amélioration
-
1
Consolider Canary-1B —
run_074atteint 40,0 BLEUScore de qualité de traduction (0–100). → glossaire test (meilleur open ST) ; documenter la dépendance NeMo pour reproductibilité. -
2
Stabilité des scores — Whisper et SeamlessM4T : écarts < 0,5 BLEU entre runsExpériences identifiées par
run_XXX. → glossaire de contrôle ; Canary dépend de NeMo (stack torch/vision). -
3
Taille de contexteEnsemble audio + consignes + plafond de sortie à l’inférence. → glossaire — Whisper/Seamless sentence_likePseudo-phrases plus longues. → glossaire déjà mesurés (Modyco
run_080/080b: baisse nette vs utteranceDécoupage par énoncé. → glossaire). Priorité : Canary sentence_like (run_081) + buckets de durée surrun_074pour localiser la fenêtre audio optimale. -
4
Cohérence intra-textuelle — au-delà du BLEUScore de qualité de traduction (0–100). → glossaire segment isolé : mesurer la variation / dérive sur un discours entier (prochaine étape transversale, toutes variantes).
-
5
Granite Speech / Ollama — candidats backlog (piste K) si les trois modèles initiaux ne suffisent pas.