Skip to content
Back to blog
Guide8 min read

Transcription avec Horodatages : Obtenir un Timing Mot par Mot et Phrase par Phrase depuis l'Audio

Découvrez comment la transcription IA génère des horodatages au niveau du mot, de la phrase et de la phrase complète — à quoi ressemble le résultat en VTT, SRT et JSON, quand utiliser chaque granularité et comment obtenir des transcriptions synchronisées depuis n'importe quel fichier audio ou vidéo.

CT
Written by Le Captain
Published on
Transcription avec Horodatages : Obtenir un Timing Mot par Mot et Phrase par Phrase depuis l'Audio

Que signifie « transcription avec horodatages » ?

Quand un outil de transcription IA traite votre fichier audio ou vidéo, il ne renvoie pas simplement un document texte brut — il enregistre aussi exactement à quel moment de l'enregistrement chaque élément de texte a été prononcé. C'est la transcription avec horodatages : une sortie structurée qui associe chaque segment de texte à une heure de début et une heure de fin, mesurées en heures, minutes, secondes et millisecondes.

Les horodatages dans la transcription existent à trois niveaux de granularité, chacun adapté à des cas d'usage différents :

  • Horodatages au niveau de la phrase (niveau segment) — Chaque phrase complète ou groupe naturel reçoit une plage de début–fin unique. C'est le standard pour les fichiers de sous-titres VTT et SRT utilisés sur YouTube, Vimeo, les vidéos HTML5 et les plateformes d'e-learning.
  • Horodatages au niveau de la courte phrase — Deux à cinq mots par plage, utilisés pour les formats vidéo des réseaux sociaux (TikTok, Instagram Reels) où les sous-titres se mettent à jour rapidement pour suivre la parole.
  • Horodatages au niveau du mot — Chaque mot individuel reçoit sa propre heure de début et de fin. Utilisés pour les sous-titres de type karaoké, les transcriptions interactives où cliquer sur un mot fait avancer l'audio, et les applications développeur qui doivent mettre en évidence le texte au fur et à mesure qu'il est prononcé.

Le format de sortie dont vous avez besoin détermine la granularité à demander. Pour la plupart des workflows de sous-titrage, les horodatages au niveau de la phrase au format VTT ou SRT sont le bon choix. Pour les applications où le texte doit réagir dynamiquement à l'audio — recherche dans l'audio, affichage de paroles, outils d'accessibilité — les horodatages au niveau du mot sont nécessaires.

Comment les outils IA génèrent-ils les horodatages ?

Les fournisseurs de transcription peuvent renvoyer des horodatages au niveau des segments ou des mots avec le texte reconnu. Leur disponibilité et leur précision varient selon le fournisseur, le modèle, la langue et la qualité audio.

Captain Transcribe normalise les données temporelles renvoyées par le fournisseur sélectionné et les utilise pour construire trois styles d'export :

  • Style Standard — Les phrases et les pauses naturelles déterminent les limites des segments. Chaque segment couvre une pensée complète. Idéal pour les sous-titres vidéo traditionnels.
  • Style Court — La sortie est découpée en courtes rafales de deux à quatre mots. Les horodatages sont alignés sur les mots mais regroupés en courts segments. Idéal pour les vidéos sociales rapides.
  • Style Mot par mot — Chaque mot est exporté dans son propre segment minuté. Ce format convient aux mises en page rapides, avec un seul mot affiché à la fois dans l'éditeur cible.

À quoi ressemble le résultat d'une transcription horodatée

Voici le même extrait audio de 15 secondes transcrit à chaque niveau de granularité avec Captain Transcribe, exporté en VTT :

Niveau phrase (style Standard)

WEBVTT

1
00:00:00.320 --> 00:00:04.880
Dans ce guide, nous allons voir comment la transcription IA
génère des horodatages à différents niveaux de détail.

2
00:00:05.200 --> 00:00:09.640
Les horodatages au niveau de la phrase sont le standard
pour les sous-titres sur YouTube, Vimeo et HTML5.

3
00:00:09.960 --> 00:00:14.320
Les horodatages au niveau du mot sont utilisés quand
le texte doit se synchroniser mot par mot avec l'audio.

Style Courte phrase

WEBVTT

1
00:00:00.320 --> 00:00:01.680
Dans ce guide,

2
00:00:01.680 --> 00:00:03.200
nous allons voir

3
00:00:03.200 --> 00:00:04.880
comment la transcription

Niveau mot (style Mot par mot)

WEBVTT

1
00:00:00.320 --> 00:00:00.520
Dans

2
00:00:00.520 --> 00:00:00.760
ce

3
00:00:00.760 --> 00:00:01.120
guide,

Les trois sorties sont des fichiers WebVTT valides — la différence réside dans la façon dont les limites des segments sont placées. La sortie Mot par mot utilise un segment minuté par mot.

Notez les règles de formatage clés : le fichier commence exactement par WEBVTT à la première ligne, les horodatages utilisent des points comme séparateurs de millisecondes (et non des virgules, qui appartiennent au format SRT), et chaque bloc de segment est séparé par une ligne vide.

Comment obtenir une transcription horodatée avec Captain Transcribe

Obtenir une transcription horodatée à partir de n'importe quel fichier audio ou vidéo se fait en quatre étapes :

  1. Uploadez votre fichier — Rendez-vous sur captaintranscribe.com et uploadez votre fichier audio ou vidéo. Les formats pris en charge incluent MP3, AAC, FLAC, WAV, M4A, MP4, MOV et MKV. Pour les fichiers vidéo, l'audio est extrait automatiquement — aucun pré-traitement nécessaire.
  2. Sélectionnez la langue parlée — Choisissez la langue correcte dans la liste. C'est le paramètre le plus critique pour la précision des horodatages : une mauvaise langue dégrade à la fois la qualité de la transcription et la précision de l'alignement.
  3. Choisissez un style de sous-titres — Sélectionnez Standard pour les horodatages au niveau de la phrase, Court pour le niveau courte phrase, ou Karaoké pour le niveau mot. Ce choix détermine comment les limites des segments sont placées dans le fichier de sortie.
  4. Téléchargez votre format — Cliquez sur le bouton de téléchargement VTT ou SRT. Les deux fichiers incluent des horodatages synchronisés. Le téléchargement texte brut omet les horodatages — utilisez-le uniquement si vous avez besoin des mots sans le timing.

Depuis une seule transcription, vous pouvez télécharger VTT, SRT et texte brut simultanément sans retraiter l'audio. Si vous avez besoin des trois formats pour différentes plateformes, un seul upload suffit.

Formats d'horodatage : VTT vs SRT vs JSON

Les transcriptions horodatées se présentent sous plusieurs formats selon l'outil et l'usage prévu. Voici comment ils se comparent :

Format Syntaxe des horodatages Idéal pour Niveau mot ?
VTT (WebVTT) 00:00:01.500 (points) HTML5, Vimeo, e-learning, lecteurs web Oui (segments séparés)
SRT (SubRip) 00:00:01,500 (virgules) YouTube, logiciels de montage, TikTok Oui (segments séparés)
JSON (sortie API) Entiers en millisecondes Intégrations développeur, indexation de recherche Oui (la plupart des API)
TSV (tabulé) Colonnes début/fin Tableurs, analyse de données Oui (Whisper)
Texte brut Aucun Articles, documents, résumés Non

La différence syntaxique critique entre VTT et SRT est le séparateur de millisecondes : le VTT utilise un point (00:00:01.500) tandis que le SRT utilise une virgule (00:00:01,500). Cette seule différence d'un caractère est la source la plus fréquente d'échecs d'analyse VTT lors d'éditions manuelles ou de conversions entre formats. Pour une comparaison complète des deux formats, consultez notre guide sur les formats de sous-titres SRT vs VTT.

Quand utiliser chaque niveau de granularité

Cas d'usage Granularité Format recommandé
Sous-titres YouTube et Vimeo Niveau phrase VTT ou SRT
Accessibilité vidéo HTML5 Niveau phrase VTT (requis par l'élément <track>)
TikTok, Instagram Reels Courte phrase (2–4 mots) VTT ou SRT
Paroles de clip / karaoké Niveau mot VTT ou SRT avec un segment par mot
Transcription de podcast interactive Niveau phrase VTT ou JSON
Recherche dans l'audio (clic pour jouer) Niveau mot JSON du fournisseur ou segments minutés
Logiciel de montage (Premiere, DaVinci) Niveau phrase SRT (compatibilité éditeur la plus large)
E-learning / accessibilité RGAA Niveau phrase VTT (Moodle, Canvas, Coursera)

Précision des horodatages : les facteurs influents

La qualité des horodatages est directement liée à la qualité de la transcription. Plus l'IA identifie précisément ce qui a été dit, plus elle peut pinpointer où dans l'audio cela a été dit. Plusieurs facteurs influencent la précision des horodatages :

  • Clarté audio — Les enregistrements propres avec peu de bruit de fond produisent généralement des horodatages mieux alignés. Les enregistrements bruités ou réverbérants demandent davantage de relecture autour des transitions.
  • Débit de parole — Une parole très rapide comprime le signal acoustique ; une parole très lente avec de longues pauses crée des écarts entre les segments. Les deux sont gérés correctement, mais la sortie reflète le timing réel de la parole.
  • Silence et audio non-vocal — De longs passages de musique, d'applaudissements ou de bruit de fond avant le contenu parlé créent des lacunes dans la séquence d'horodatages. Il s'agit d'un comportement précis : l'IA ne tente pas de transcrire l'audio non-vocal.
  • Fournisseur et modèle — Le comportement des horodatages varie selon le fournisseur et le modèle. Relisez plus attentivement le mode Mot par mot lorsque la parole est rapide ou peu claire.

Prévisualisez toujours les sous-titres exportés sur le média final et ajustez les limites des segments si nécessaire, en particulier après un montage de la vidéo source.

Utiliser les horodatages pour l'accessibilité web

Les horodatages ne sont pas seulement une fonctionnalité pratique — ils sont requis pour la conformité à l'accessibilité web. Le critère de succès WCAG 2.1 1.2.2 (Sous-titres, pré-enregistrés) exige des sous-titres synchronisés pour tout contenu audio pré-enregistré dans les vidéos. Le mot clé est « synchronisés » : une transcription texte brut ne satisfait pas ce critère car elle n'est pas horodatée. Un fichier VTT ou SRT avec des horodatages précis, oui.

Pour l'élément HTML5 <video>, le VTT est le seul format de sous-titres pris en charge nativement par les navigateurs via l'élément <track> :

<video controls>
  <source src="interview.mp4" type="video/mp4">
  <track src="interview.vtt" kind="captions" srclang="fr" label="Français" default>
</video>

Utiliser kind="captions" plutôt que kind="subtitles" indique aux lecteurs d'écran et aux outils d'accessibilité que la piste inclut non seulement le texte de la parole mais aussi les informations audio non-vocales pertinentes (identifiants de locuteurs, effets sonores). Pour les contenus destinés aux spectateurs sourds ou malentendants, utilisez captions ; pour les pistes de sous-titres traduits, utilisez subtitles.

Résoudre les problèmes d'horodatage courants

Problème Cause probable Solution
Sous-titres trop tôt ou trop tard Décalage constant sur tous les segments Ajoutez un décalage global dans les paramètres de sous-titres de votre lecteur vidéo, ou décalez tous les horodatages du montant du décalage avec un éditeur de sous-titres
La synchronisation se dégrade au fil du temps Fréquence d'images variable dans la vidéo source Réencodez la vidéo à une fréquence d'images constante avant de re-transcrire ; ou utilisez un éditeur de sous-titres compatible VFR
Les horodatages ont des virgules — sous-titres non chargés Syntaxe SRT dans un fichier avec extension .vtt Remplacez toutes les virgules d'horodatage par des points via Rechercher & Remplacer ; vérifiez que l'en-tête WEBVTT est en ligne 1
Segments qui se chevauchent Une édition manuelle a créé un segment dont la fin dépasse le début du suivant Ouvrez le fichier dans un éditeur de sous-titres (Subtitle Edit, Aegisub) et utilisez l'outil de détection automatique des chevauchements
Le timing karaoké au niveau du mot semble incorrect Alignement à faible confiance sur parole rapide ou audio bruité Utilisez le style Standard au niveau de la phrase pour l'audio bruité ; le timing karaoké fonctionne mieux sur des enregistrements clairs à locuteur unique

Points clés

  • La transcription avec horodatages associe chaque segment parlé à une heure de début et de fin — la sortie est un fichier de sous-titres structuré, pas seulement un document texte.
  • Il existe trois niveaux de granularité : niveau phrase (standard pour les sous-titres), courte phrase (vidéo sociale), et niveau mot (karaoké, transcriptions interactives).
  • Les données temporelles varient selon le fournisseur et le modèle — relisez les sous-titres exportés sur le média final avant publication.
  • Le VTT est le format correct pour les horodatages de vidéo web HTML5 ; le SRT fonctionne dans les logiciels de montage et sur YouTube ; le JSON des API est le meilleur choix pour les intégrations développeur.
  • La distinction point/virgule est importante : les horodatages VTT utilisent des points (00:00:01.500), le SRT utilise des virgules (00:00:01,500). Utiliser le mauvais séparateur fait que les navigateurs ignorent silencieusement le fichier.
  • Les sous-titres synchronisés sont requis pour la conformité WCAG — une transcription texte brut ne remplace pas un fichier VTT ou SRT horodaté.
  • Captain Transcribe génère les trois styles d'export — choisissez Standard, Court ou Mot par mot et téléchargez VTT et SRT depuis la même transcription.

Articles connexes

Related articles

This article was drafted with AI assistance and reviewed by The Captain before publication.

© 2026 Captain Transcribe. All rights reserved.