Skip to content

sprezzature-audio

Audio — sous-titres

Sous-titres, diarisation et identification de locuteurs en intelligence artificielle (IA) locale pour vidéo / audio. WebVTT / format de sous-titres SubRip (SRT) depuis un whisper.cpp local, qui-parle-quand via NeMo, qui-est-qui par embeddings ou passe sur la transcription. L'audio ne quitte pas la machine.

En cours de développement : le moteur de sous-titres se stabilise encore et les mesures de qualité sont en cours : les sous-titres sont des brouillons à relire.

Produit

  • Sous-titres World Wide Web Consortium (W3C) WebVTT / SRT / texte depuis un build whisper.cpp local
  • « Qui parle quand » via diarisation NVIDIA NeMo Sortformer
  • « Qui est qui » via embeddings TitaNet ou une passe minée de la transcription
  • VTT (format de sous-titres WebVTT) étiqueté par locuteur avec repères nommés ; EN/FR par défaut

Audite

  • Biais par vocabulaire de projet sur la piste sous-titres
  • Sous-titres traduits

Dites l'une de ces phrases

La skill se déclenche sur une formulation de ce type, sans commande à mémoriser.

sous-titres transcris cette vidéo / cet audio WebVTT SRT diarisation qui parle quand identifie les locuteurs traduis les sous-titres

Bibliothèque de références

Les connaissances sur lesquelles la skill s'appuie : à lire directement dans le repo.