Meilleur score par variante
Score BLEUScore de qualité de traduction (0–100). → glossaire obtenu sur le jeu de test m-TEDx pour chaque approche. Les scores en segmentationFaçon de découper l’audio en segments pour l’évaluation. → glossaire utteranceDécoupage par énoncé : chaque segment = une phrase parlée. → glossaire sont comparables entre eux ; les scores sentence_likePseudo-phrases plus longues (fusion de segments) — non comparables directement à utterance. → glossaire ne le sont pas directement.
Données déjà vues ? Gemini, Whisper et les modèles open ST ont peut-être déjà croisé des enregistrements proches de m-TEDx lors de leur pré-entraînement : les conférences TED sont librement accessibles en ligne. Ce biais complique la comparaison directe avec les approches limitées au corpus du projet.
Résultats BLEU (test)
Paramètres des runs
| # | Variante | Run | BLEU test | Paramètres clés |
|---|
2 Variante 2 · speechLLM — impact des paramètres
Chaque barre représente un runIdentifiant d’une expérience (run_XXX). → glossaire speechLLM. La couleur indique la configuration : bonne (48 tokensUnités de texte manipulées par le modèle. → glossaire, utteranceDécoupage par énoncé. → glossaire), sentence_likePseudo-phrases plus longues. → glossaire, ou échouée (128 tokens).
run_013 et run_012 (L-114k/L-14k gelés, 48 tok) obtiennent 15 BLEU utterance. Les runs à 128 tokens (run_017, run_021) s’effondrent à 5–6 malgré un encodeur identique.
Tableau récapitulatif
Tous les meilleurs runsExpériences identifiées par run_XXX. → glossaire par variante, avec leur contexte. UtteranceDécoupage par énoncé. → glossaire et sentence_likePseudo-phrases plus longues. → glossaire sont deux modes de segmentationFaçon de découper l’audio. → glossaire de l’audio — leurs scores BLEUScore de qualité de traduction (0–100). → glossaire ne sont pas directement comparables.
| Variante | Run | BLEU test | Seg. | Paramètres clés | Lien |
|---|---|---|---|---|---|
| 3 · Gemini | run_005 |
41,1 | utteranceDécoupage par énoncé. → glossaire | Gemini 3.5 Flash · max 8192 tok · thinking minimal · garde-fous anti-boucles | → |
run_004 |
36,8 | sentence_likePseudo-phrases plus longues. → glossaire | Gemini 3.5 Flash v2 · sentence_like | → | |
run_001 |
33,7 | utterance | Gemini 2.5 Flash · temp 0 · max 256 tok | → | |
| 4 · Cascade | run_001 |
37,4 | utterance | Whisper large-v3 (ASRAutomatic Speech Recognition : parole → texte.) → Marian opus-mt-fr-en (MTMachine Translation : texte → texte.) | → |
| 6 · Open baselines | run_074 |
40,0 | utteranceDécoupage par énoncé. → glossaire | Canary-1B v2 · NeMoBibliothèque NVIDIA pour modèles de parole. · zero-shotSans entraînement sur m-TEDx. → glossaire · meilleur open STSpeech-to-text. → glossaire | → |
run_073 |
38,0 | utterance | SeamlessM4T v2 large · zero-shot | → | |
run_072 |
36,6 | utterance | Whisper large-v3 · task=translate | → | |
run_080 |
32,3 | sentence_likePseudo-phrases plus longues. → glossaire | Whisper-ST sentence_like (Modyco) — sous utterance 36,6 | → | |
run_080b |
30,0 | sentence_like | SeamlessM4T v2 sentence_like (Modyco) — sous utterance 38,0 | → | |
| 1 · Transformer | run_026 |
26,1 | utteranceDécoupage par énoncé. → glossaire | L-14k · SpecAugmentMasquage aléatoire du spectrogramme. → glossaire v5 · vocab 1k · dépasse référence article L-14k (24,0) | → |
run_033 |
25,1 | utterance | L-114k · SPM 5k — réplication Table 8 (article 25,2) | → | |
run_028 |
23,5 | utterance | L-114k · SpecAugment v5 vocab 1k — sous run_033 | → | |
run_020 |
21,2 | utterance | L-14k · v3 · gel 5k puis dégel | → | |
| Article réf. | 25,2 | utterance | L-114k · fairseq · beam 5 · Table 8 Pantagruel (2026) | ||
| 2 · speechLLM | run_013 |
15,2 | utteranceDécoupage par énoncé. → glossaire | L-114k gelé · Phi-2 · 48 tok | → |
run_005 |
19,0 | sentence_likePseudo-phrases plus longues. → glossaire | B-1k dégeléPoids mis à jour pendant l’entraînement. → glossaire · Phi-2 · meilleur global B1 | → | |
| 5 · Speech_Text | run_001 |
7,9 | sentence_likePseudo-phrases plus longues. → glossaire | Speech_Text B-1k · décodeur 6 couches · réglages non optimisés | → |
Contexte d’entrée / sortie
Pour chaque système, le « contexteEnsemble de ce que le modèle « voit » à l’inférence : audio, consignes et plafond de sortie. → glossaire » utile à l’inférenceUtilisation du modèle déjà entraîné, sans apprentissage. → glossaire se décompose ainsi :
Objectif prochain : localiser sur quelle taille de contexte Canary (et les autres) est le plus performant, puis mesurer les risques de variation intra-textuelle (cohérence sur un discours entier, pas seulement une phrase isolée).
| Variante · runIdentifiant d’expérience. → glossaire | Taille entrée | PromptConsigne textuelle. → glossaire | Input modèle | Sortie | Statut contexte |
|---|---|---|---|---|---|
6 · Canaryrun_074 |
utteranceDécoupage par énoncé. → glossaire WAV entier · typ. 1–30 s |
aucun textesrc=fr · tgt=en |
audio + codes langue (NeMoBibliothèque NVIDIA pour modèles de parole (ASR, ST) — backend de Canary. task=ast) |
texte libre (plafond YAML 256 non branché) |
mesuré utterance à faire · sentence_likePseudo-phrases plus longues. → glossaire run_081 buckets durée |
6 · Whisper-STrun_072 / 080 |
utt. 36,6 · sent. 32,3 | implicite (task=translate, lang=fr) |
audio → Whisper encodeurRéseau qui transforme l’audio en représentations. → glossaire | max_new_tokensPlafond de tokens générés. → glossaire: 256 |
utt. + sentence_like baisse sur segments longs |
6 · Seamlessrun_073 / 080b |
utt. 38,0 · sent. 30,0 | implicite (tgt_lang) |
audio → Seamless | max_new_tokens: 256 |
utt. + sentence_like baisse nette sur longs |
3 · Geminirun_005 |
utteranceDécoupage par énoncé. → glossaire ≤ ~75 mots réf. (~100 tok.) |
Translate the French speech to English. |
audio + promptConsigne textuelle. → glossaire (API) | max_output_tokens: 8192thinking minimal |
utt. 41,1 · sent. 36,8 |
4 · Cascaderun_001 |
utteranceDécoupage par énoncé. → glossaire | aucun (ASRAutomatic Speech Recognition : parole → texte.) puis MTMachine Translation : texte → texte. | audio → Whisper · texte FR → Marian | hyp. MT Marian | utterance 37,4 relancer sentence_like |
2 · speechLLMrun_066 |
utteranceDécoupage par énoncé. → glossaire | llama_inst + « Translate the French speech to English. » |
frames encodeurRéseau audio → représentations. → glossaire + tokensUnités de texte du modèle. → glossaire prompt | max_new_tokensPlafond de tokens générés. → glossaire: 48 |
48 tok critique (128 tok → effondrement) |
1 · Transformerrun_026 |
utteranceDécoupage par énoncé. → glossaire | — | mel → encodeur · décodeur SPM | beamBeam search : plusieurs hypothèses en parallèle. → glossaire 5 · max_len_b: 128 |
utt. + sentence_like |
5 · Speech_Textrun_001 |
sentence_likePseudo-phrases plus longues. → glossaire seulement | — | encodeurRéseau audio → représentations. → glossaire multimodal | décodeur 6 couches | manque utterance |
run_XXX. → glossaire complémentaires préparés / à lancer
- Priorité · Canary sentence_likePseudo-phrases plus longues. → glossaire (
run_081) — configcanary_1b_sentence.yaml+ script Modycorun_modyco_open_canary_sentence_081.sh— seul trou v6 pour comparer la taille d’entrée. - Cascade sentence_like — config déjà présente (
4_cascade/configs/fr-en/cascade_sentence.yaml) ; score à (re)mesurer. - Buckets de durée sur hyps
run_074(et Gemini / Cascade) — BLEUScore de qualité de traduction (0–100). → glossaire vs durée audio, sans nouveau train. - Intra-textuel (prochains jours) — protocole de cohérence sur un texte / talk entier (dérive, répétitions, anaphores) pour chaque variante ; distinct du BLEU segment isolé.
3 Gemini — détail
Le meilleur score du projet (41,1 BLEUScore de qualité de traduction (0–100). → glossaire) est obtenu avec Gemini 3.5 Flash via l’API Google. Le paramètre clé : les garde-fous anti-boucles et un budget thinking minimal. Sans ces réglages, run_004 initial ne donnait que 20,3.
6 Canary — détail
Meilleur open STSpeech-to-text : traduction directe audio → texte. → glossaire (40,0 BLEUScore de qualité de traduction (0–100). → glossaire test, run_074). Zero-shotModèle utilisé tel quel, sans entraînement sur m-TEDx. → glossaire NeMoBibliothèque NVIDIA pour modèles de parole — backend de Canary., pas de promptConsigne textuelle. → glossaire texte — l’audio utteranceDécoupage par énoncé. → glossaire suffit. Prochaine mesure : performance vs longueur d’entrée (sentence_likePseudo-phrases plus longues. → glossaire + buckets).
4 Cascade — détail
En chaînant Whisper large-v3 (transcription) puis Marian opus-mt-fr-en (traduction), on obtient 37,4 BLEUScore de qualité de traduction (0–100). → glossaire avec un seul runIdentifiant d’expérience. → glossaire. Avantage : pas d’entraînement ; inconvénient : deux modèles distincts, erreurs ASRAutomatic Speech Recognition : parole → texte. propagées.
Suite méthodologique
Après le bench taille de contexteEnsemble audio + consignes + plafond de sortie à l’inférence. → glossaire : évaluer la cohérence intra-textuelle (un talk entier vs phrases isolées) pour chaque variante — risque distinct du BLEUScore de qualité de traduction (0–100). → glossaire moyen.