Résultats

Synthèse des scores SacreBLEUImplémentation standardisée du BLEU (tokenisation figée) pour comparer les runs de façon reproductible. → glossaire sur m-TEDx FR→EN pour les six variantes du projet. Le BLEUScore de qualité de traduction (0–100) : recouvrement lexical avec les références. → glossaire (voir Évaluation) mesure le recouvrement lexical avec les références : il sert surtout à comparer des systèmes sur un même test, pas comme une « note sur 100 ».

Survolez les termes soulignés en pointillésExplication courte affichée au survol. Si la bulle contient un lien, cliquez d’abord sur le terme pour la maintenir, puis sur le lien. pour une définition en langage courant. Glossaire complet : vocabulaire.html.

Meilleur score par variante

Score BLEUScore de qualité de traduction (0–100). → glossaire obtenu sur le jeu de test m-TEDx pour chaque approche. Les scores en segmentationFaçon de découper l’audio en segments pour l’évaluation. → glossaire utteranceDécoupage par énoncé : chaque segment = une phrase parlée. → glossaire sont comparables entre eux ; les scores sentence_likePseudo-phrases plus longues (fusion de segments) — non comparables directement à utterance. → glossaire ne le sont pas directement.

Pourquoi certains scores dépassent la baseline article ? La référence Pantagruel (Table 8, 25,2 BLEUScore de qualité de traduction (0–100). → glossaire) sert de point de comparaison pour les modèles entraînés sur m-TEDx. Les variantes 3 (Gemini), 6 (baselines open weightsPoids publiés et téléchargeables — pas d’API fermée. → glossaire) et 4 (cascade ASR→MTDeux modèles en série : transcription française (ASR) puis traduction texte (MT). → variante 4) partent de modèles pré-entraînés à très grande échelle : Gemini via une API cloud (41,1) ; Canary-1B, SeamlessM4T v2 et Whisper-ST en zero-shotModèle utilisé tel quel, sans entraînement sur m-TEDx. → glossaire reproductible (meilleur : 40,0) ; cascade Whisper + Marian MT (37,4). Les variantes 1, 2 et 5 entraînent ou adaptent un modèle sur les seules données m-TEDx — le meilleur STSpeech-to-text : traduction directe audio → texte. → glossaire entraîné (26,1) dépasse à peine cette baseline.

Données déjà vues ? Gemini, Whisper et les modèles open ST ont peut-être déjà croisé des enregistrements proches de m-TEDx lors de leur pré-entraînement : les conférences TED sont librement accessibles en ligne. Ce biais complique la comparaison directe avec les approches limitées au corpus du projet.

Résultats BLEU (test)

Découpage audio → glossaire

Paramètres des runs

# Variante Run BLEU test Paramètres clés

2 Variante 2 · speechLLM — impact des paramètres

Chaque barre représente un runIdentifiant d’une expérience (run_XXX). → glossaire speechLLM. La couleur indique la configuration : bonne (48 tokensUnités de texte manipulées par le modèle. → glossaire, utteranceDécoupage par énoncé. → glossaire), sentence_likePseudo-phrases plus longues. → glossaire, ou échouée (128 tokens).

Utterance · 48 tok (bon)
Sentence_like
LLM alternatif (Qwen / Llama)
Utterance · 128 tok (échec)

run_013 et run_012 (L-114k/L-14k gelés, 48 tok) obtiennent 15 BLEU utterance. Les runs à 128 tokens (run_017, run_021) s’effondrent à 5–6 malgré un encodeur identique.

Effet max_new_tokensNombre maximal de tokens générés pour la traduction. → glossaire : 128 tokensUnités de texte manipulées par le modèle. → glossaire → le modèle génère des traductions 3× trop longues, ce qui pénalise fortement le score BLEUScore de qualité de traduction (0–100). → glossaire même si le début de la traduction est correct.

Tableau récapitulatif

Tous les meilleurs runsExpériences identifiées par run_XXX. → glossaire par variante, avec leur contexte. UtteranceDécoupage par énoncé. → glossaire et sentence_likePseudo-phrases plus longues. → glossaire sont deux modes de segmentationFaçon de découper l’audio. → glossaire de l’audio — leurs scores BLEUScore de qualité de traduction (0–100). → glossaire ne sont pas directement comparables.

Variante Run BLEU test Seg. Paramètres clés Lien
3 · Gemini run_005 41,1 utteranceDécoupage par énoncé. → glossaire Gemini 3.5 Flash · max 8192 tok · thinking minimal · garde-fous anti-boucles
run_004 36,8 sentence_likePseudo-phrases plus longues. → glossaire Gemini 3.5 Flash v2 · sentence_like
run_001 33,7 utterance Gemini 2.5 Flash · temp 0 · max 256 tok
4 · Cascade run_001 37,4 utterance Whisper large-v3 (ASRAutomatic Speech Recognition : parole → texte.) → Marian opus-mt-fr-en (MTMachine Translation : texte → texte.)
6 · Open baselines run_074 40,0 utteranceDécoupage par énoncé. → glossaire Canary-1B v2 · NeMoBibliothèque NVIDIA pour modèles de parole. · zero-shotSans entraînement sur m-TEDx. → glossaire · meilleur open STSpeech-to-text. → glossaire
run_073 38,0 utterance SeamlessM4T v2 large · zero-shot
run_072 36,6 utterance Whisper large-v3 · task=translate
run_080 32,3 sentence_likePseudo-phrases plus longues. → glossaire Whisper-ST sentence_like (Modyco) — sous utterance 36,6
run_080b 30,0 sentence_like SeamlessM4T v2 sentence_like (Modyco) — sous utterance 38,0
1 · Transformer run_026 26,1 utteranceDécoupage par énoncé. → glossaire L-14k · SpecAugmentMasquage aléatoire du spectrogramme. → glossaire v5 · vocab 1k · dépasse référence article L-14k (24,0)
run_033 25,1 utterance L-114k · SPM 5k — réplication Table 8 (article 25,2)
run_028 23,5 utterance L-114k · SpecAugment v5 vocab 1k — sous run_033
run_020 21,2 utterance L-14k · v3 · gel 5k puis dégel
Article réf. 25,2 utterance L-114k · fairseq · beam 5 · Table 8 Pantagruel (2026)
2 · speechLLM run_013 15,2 utteranceDécoupage par énoncé. → glossaire L-114k gelé · Phi-2 · 48 tok
run_005 19,0 sentence_likePseudo-phrases plus longues. → glossaire B-1k dégeléPoids mis à jour pendant l’entraînement. → glossaire · Phi-2 · meilleur global B1
5 · Speech_Text run_001 7,9 sentence_likePseudo-phrases plus longues. → glossaire Speech_Text B-1k · décodeur 6 couches · réglages non optimisés
Attention à la comparaison : les variantes 1, 2 et 5 entraînent un modèle sur m-TEDx. Les variantes 3 (Gemini), 6 (open STSpeech-to-text. → glossaire) et 4 (Cascade) utilisent des modèles pré-entraînés sur bien plus de données — leurs scores élevés ne signifient pas qu’elles sont « meilleures » au sens de la contribution du projet, mais qu’elles partent d’un avantage fondamental.

Contexte d’entrée / sortie

Pour chaque système, le « contexteEnsemble de ce que le modèle « voit » à l’inférence : audio, consignes et plafond de sortie. → glossaire » utile à l’inférenceUtilisation du modèle déjà entraîné, sans apprentissage. → glossaire se décompose ainsi :

taille entrée audio + promptConsigne textuelle donnée au modèle. → glossaire + input modèle + sortie (plafond) = contexte

Objectif prochain : localiser sur quelle taille de contexte Canary (et les autres) est le plus performant, puis mesurer les risques de variation intra-textuelle (cohérence sur un discours entier, pas seulement une phrase isolée).

Variante · runIdentifiant d’expérience. → glossaire Taille entrée PromptConsigne textuelle. → glossaire Input modèle Sortie Statut contexte
6 · Canary
run_074
utteranceDécoupage par énoncé. → glossaire
WAV entier · typ. 1–30 s
aucun texte
src=fr · tgt=en
audio + codes langue (NeMoBibliothèque NVIDIA pour modèles de parole (ASR, ST) — backend de Canary. task=ast) texte libre
(plafond YAML 256 non branché)
mesuré utterance
à faire · sentence_likePseudo-phrases plus longues. → glossaire run_081
buckets durée
6 · Whisper-ST
run_072 / 080
utt. 36,6 · sent. 32,3 implicite (task=translate, lang=fr) audio → Whisper encodeurRéseau qui transforme l’audio en représentations. → glossaire max_new_tokensPlafond de tokens générés. → glossaire: 256 utt. + sentence_like
baisse sur segments longs
6 · Seamless
run_073 / 080b
utt. 38,0 · sent. 30,0 implicite (tgt_lang) audio → Seamless max_new_tokens: 256 utt. + sentence_like
baisse nette sur longs
3 · Gemini
run_005
utteranceDécoupage par énoncé. → glossaire
≤ ~75 mots réf. (~100 tok.)
Translate the French speech to English. audio + promptConsigne textuelle. → glossaire (API) max_output_tokens: 8192
thinking minimal
utt. 41,1 · sent. 36,8
4 · Cascade
run_001
utteranceDécoupage par énoncé. → glossaire aucun (ASRAutomatic Speech Recognition : parole → texte.) puis MTMachine Translation : texte → texte. audio → Whisper · texte FR → Marian hyp. MT Marian utterance 37,4
relancer sentence_like
2 · speechLLM
run_066
utteranceDécoupage par énoncé. → glossaire llama_inst + « Translate the French speech to English. » frames encodeurRéseau audio → représentations. → glossaire + tokensUnités de texte du modèle. → glossaire prompt max_new_tokensPlafond de tokens générés. → glossaire: 48 48 tok critique
(128 tok → effondrement)
1 · Transformer
run_026
utteranceDécoupage par énoncé. → glossaire mel → encodeur · décodeur SPM beamBeam search : plusieurs hypothèses en parallèle. → glossaire 5 · max_len_b: 128 utt. + sentence_like
5 · Speech_Text
run_001
sentence_likePseudo-phrases plus longues. → glossaire seulement encodeurRéseau audio → représentations. → glossaire multimodal décodeur 6 couches manque utterance
RunsExpériences identifiées par run_XXX. → glossaire complémentaires préparés / à lancer
  • Priorité · Canary sentence_likePseudo-phrases plus longues. → glossaire (run_081) — config canary_1b_sentence.yaml + script Modyco run_modyco_open_canary_sentence_081.sh — seul trou v6 pour comparer la taille d’entrée.
  • Cascade sentence_like — config déjà présente (4_cascade/configs/fr-en/cascade_sentence.yaml) ; score à (re)mesurer.
  • Buckets de durée sur hyps run_074 (et Gemini / Cascade) — BLEUScore de qualité de traduction (0–100). → glossaire vs durée audio, sans nouveau train.
  • Intra-textuel (prochains jours) — protocole de cohérence sur un texte / talk entier (dérive, répétitions, anaphores) pour chaque variante ; distinct du BLEU segment isolé.

3 Gemini — détail

Le meilleur score du projet (41,1 BLEUScore de qualité de traduction (0–100). → glossaire) est obtenu avec Gemini 3.5 Flash via l’API Google. Le paramètre clé : les garde-fous anti-boucles et un budget thinking minimal. Sans ces réglages, run_004 initial ne donnait que 20,3.

6 Canary — détail

Meilleur open STSpeech-to-text : traduction directe audio → texte. → glossaire (40,0 BLEUScore de qualité de traduction (0–100). → glossaire test, run_074). Zero-shotModèle utilisé tel quel, sans entraînement sur m-TEDx. → glossaire NeMoBibliothèque NVIDIA pour modèles de parole — backend de Canary., pas de promptConsigne textuelle. → glossaire texte — l’audio utteranceDécoupage par énoncé. → glossaire suffit. Prochaine mesure : performance vs longueur d’entrée (sentence_likePseudo-phrases plus longues. → glossaire + buckets).

4 Cascade — détail

En chaînant Whisper large-v3 (transcription) puis Marian opus-mt-fr-en (traduction), on obtient 37,4 BLEUScore de qualité de traduction (0–100). → glossaire avec un seul runIdentifiant d’expérience. → glossaire. Avantage : pas d’entraînement ; inconvénient : deux modèles distincts, erreurs ASRAutomatic Speech Recognition : parole → texte. propagées.

Suite méthodologique

Après le bench taille de contexteEnsemble audio + consignes + plafond de sortie à l’inférence. → glossaire : évaluer la cohérence intra-textuelle (un talk entier vs phrases isolées) pour chaque variante — risque distinct du BLEUScore de qualité de traduction (0–100). → glossaire moyen.

À propos

Morgane Bona-Pellissier est étudiante en master de traitement automatique des langues à l’Université Paris Nanterre après un doctorat en traductologie (Université de Genève, 2023). Ses recherches portent sur la traduction automatique neuronale et les langues peu dotées et minorisées ; elle parle notamment catalan et étudie le breton.