sprezzature-audio
Audio — sous-titres
Sous-titres, diarisation et identification de locuteurs en intelligence artificielle (IA) locale pour vidéo / audio. WebVTT / format de sous-titres SubRip (SRT) depuis un whisper.cpp local, qui-parle-quand via NeMo, qui-est-qui par embeddings ou passe sur la transcription. L'audio ne quitte pas la machine.
En cours de développement : le moteur de sous-titres se stabilise encore et les mesures de qualité sont en cours : les sous-titres sont des brouillons à relire.
Produit
- Sous-titres World Wide Web Consortium (W3C) WebVTT / SRT / texte depuis un build whisper.cpp local
- « Qui parle quand » via diarisation NVIDIA NeMo Sortformer
- « Qui est qui » via embeddings TitaNet ou une passe minée de la transcription
- VTT (format de sous-titres WebVTT) étiqueté par locuteur avec repères nommés ; EN/FR par défaut
Audite
- Biais par vocabulaire de projet sur la piste sous-titres
- Sous-titres traduits
Dites l'une de ces phrases
La skill se déclenche sur une formulation de ce type, sans commande à mémoriser.
sous-titres
transcris cette vidéo / cet audio
WebVTT
SRT
diarisation
qui parle quand
identifie les locuteurs
traduis les sous-titres
Bibliothèque de références
Les connaissances sur lesquelles la skill s'appuie : à lire directement dans le repo.