Variante 6 / 6

Open baselines ST

Modèles pré-entraînés open weightsModèle dont les poids sont publiés et téléchargeables — on peut relancer l’inférence sans API propriétaire. → glossaire évalués en zero-shotLe modèle est utilisé tel quel, sans entraînement ni fine-tuning sur m-TEDx. → glossaire sur m-TEDx — même protocole SacreBLEUImplémentation standardisée du BLEU (tokenisation figée) pour comparer les runs de façon reproductible. → glossaire que Gemini, sans API ni entraînement local. Alternative reproductible pour la recherche académique.

« Comparer Gemini à des systèmes ouverts que n’importe qui peut relancer sur les mêmes manifestsFichiers TSV listant les segments audio à évaluer (test.tsv, valid.tsv). → glossaire, avec la même signature BLEUScore SacreBLEU calculé avec le même protocole tokenisation. → glossaire. »

Survolez les termes soulignés en pointillésExplication courte affichée au survol de la souris. pour une définition en langage courant. Si la bulle contient un lien, cliquez d’abord sur le terme pour la maintenir affichée, puis sur le lien — sinon elle disparaît dès que la souris s’éloigne.

Architecture

Trois backends STSpeech-to-text : traduction directe audio → texte anglais, sans étape de transcription française intermédiaire. → glossaire (audio → texte EN) ou quasi-directs, sélectionnés par model.type dans le YAML. InférenceUtilisation du modèle déjà entraîné : on charge les poids et on traduit, sans phase d’apprentissage sur m-TEDx. → glossaire seule — pas d’entraînement sur m-TEDx.

Audio FR m-TEDx 16 kHz mono Modèle ST open (au choix) Whisper-ST task=translate SeamlessM4T v2 Meta · ST directe Canary-1B NVIDIA NeMo zero-shot · poids ouverts · Hugging Face / NeMo pipeline = open_baselines_st Texte EN SacreBLEU signé

Positionnement : la variante 3 (Gemini) donne le meilleur BLEUScore standard de qualité de traduction (0–100). → glossaire (~41) mais repose sur une API fermée et non reproductible. La variante 4 (cascade ASR→MTDeux modèles en série : transcription française (ASR) puis traduction texte (MT). Voir variante 4., ~37) est ouverte mais en deux étapes. La variante 6 teste des systèmes speech-to-textTraduction directe de la parole en texte anglais, en un seul modèle. → glossaire récents, directement comparables à Gemini sur la tâche audio→anglais.

Protocole : mêmes manifestsFichiers TSV (valid.tsv, test.tsv) listant les segments audio et leurs références pour l’évaluation. → glossaire valid.tsv / test.tsv (utteranceDécoupage par énoncé : chaque segment = une phrase parlée. → glossaire), mêmes artefacts eval/sacrebleu_*.txt et protocol.json que les variantes 3–4.

Modèles testés

BackendIdentifiant du modèle dans la config YAML (model.type).ModèleRunIdentifiant d’une expérience d’évaluation. → glossaireBLEU testScore BLEU sur le jeu de test (échelle 0–100). → glossaireÉtat
canary_1b nvidia/canary-1b-v2 run_074 40,04 ok — meilleur open ST
seamless_m4t_v2 facebook/seamless-m4t-v2-large run_073 / 075b_* 38,02 ok
whisper_st openai/whisper-large-v3 run_072 / 075_* 36,65 ok
canary_1b nvidia/canary-1b-v2 run_074 (tentative) 0,00 échec env (torch/NeMo)
Juillet 2026 : chaîne run_072→073→074 — SeamlessM4T (**38,02**) et Whisper (**36,60**) proches de la cascadePipeline ASR puis MT (variante 4), ~37,4 BLEU sur utterance. → variante 4 (**37,4**) ; Canary **40,04** test (meilleur open ST). Une tentative Canary a échoué (compatibilité torch/NeMo).

Meilleur run · Canary-1B

41,19 BLEUScore de qualité de traduction (0–100). → glossaire valid
40,04 BLEUScore de qualité de traduction (0–100). → glossaire test

run_074 — meilleur système open weightsPoids publiés, reproductibles localement (pas d’API fermée). → glossaire du projet, à ~1 pt de Gemini 3.5 Flash (41,1). Zero-shotModèle utilisé tel quel, sans entraînement sur m-TEDx. → glossaire sur m-TEDx FR→EN, même protocole SacreBLEUImplémentation standardisée du BLEU. → glossaire que les variantes 3–4.

Modèle
nvidia/canary-1b-v2 (NeMoBibliothèque NVIDIA pour modèles de parole (ASR, ST) — backend de Canary. EncDecMultiTaskModel)
Tâche
task="ast" (speech translationTraduction directe de la parole en texte (audio → texte cible), sans transcription française intermédiaire. → glossaire) · source_lang=fr · target_lang=en
Config
6_open_baselines/configs/fr-en/canary_1b.yaml
SegmentationFaçon de découper l’audio en segments. → glossaire
utteranceDécoupage par énoncé : chaque segment = une phrase parlée. → glossairemanifestsFichiers TSV listant les segments audio à évaluer. → glossaire datasets/manifests/fr-en/{valid,test}.tsv
Entrée
Fichier WAV entier du segment (pas de chunking) · filtre m-TEDx typ. 1–30 s
PromptConsigne textuelle donnée au modèle. → glossaire texte
Aucun — pas de consigne naturelle ; les langues source/cible sont passées à l’API NeMo
Sortie
Texte anglais libre · max_new_tokensNombre maximal de tokens générés. → glossaire: 256 dans le YAML (non branché côté Canary S3T)
Précision
float16Nombres à demi-précision : moins de mémoire GPU, calcul plus rapide. · device: cuda (GPUProcesseur graphique utilisé pour l’inférence. → glossaire)
Machine
Modyco (venv .venv-canary + NeMo) · 10 juil. 2026 · script run_modyco_open_canary_074.sh
Échec antérieur
OVH : incompatibilité torch/NeMo → BLEUScore de qualité de traduction (0–100). → glossaire 0 (environnement, pas le modèle)
ContexteEnsemble audio + consignes + plafond de sortie à l’inférence. → glossaire vs taille d’entrée : Canary traduit chaque utteranceÉnoncé isolé. → glossaire isolément. Pour savoir sur quelle longueur audio il est le plus performant, un bench sentence_likePseudo-phrases plus longues. → glossaire (run_081, config préparée) et une analyse par buckets de durée sur run_074 sont prévus — voir page Résultats · contexte.

Avantages et inconvénients

Détail
Forces Reproductible (poids ouvertsLes poids du modèle sont publiés (Hugging Face, NeMo…) — pas d’API propriétaire. → glossaire, pas d’API) ; même protocole que Gemini ; plusieurs candidats pour maximiser les chances ; documentable pour un rapport académique
Faiblesses Dépendances lourdes (NeMo pour Canary) ; scores encore sous Gemini (~41) ; biais « données déjà vues » possible (TED en ligne) — comme pour Whisper et Gemini
Références Gemini ~41 BLEUScore de qualité de traduction (0–100). → glossaire (variante 3) · Cascade ~37 (variante 4) · baseline article Pantagruel 25,2 (→ glossaire)

🔧 Pistes d’amélioration

🔗 Liens

Autres variantes : 1 · Transformer 2 · speechLLM 3 · Gemini 4 · Cascade 5 · Speech_Text