Détails techniques
TranscriLive est un moteur de transcription, traduction, diarisation et vocalisation en temps réel, propulsé par des modèles d'IA exécutés localement sur GPU. Tout fonctionne sur votre infrastructure — aucune donnée n'est envoyée dans le cloud.
Le pipeline temps réel
Un orchestrateur in-process capture l'audio, le transcrit, le traduit, identifie les locuteurs puis le vocalise. Un bus pub/sub par langue alimente des « sinks » branchables : plusieurs sorties simultanées par langue.
Ce qui entre, ce qui sort
Entrées
• Micro navigateur (WebRTC)
• Périphérique audio / carte son (CoreAudio, ASIO)
• Dante (Dante Virtual Soundcard)
• Flux réseau RTSP
• Flux HLS
• Fichiers audio/vidéo (mode batch)
Sorties (plusieurs par langue)
• Sous-titres WebSocket (JSON temps réel)
• WebVTT / SRT / TTML / EBU-TT Live
• Audio vocalisé par langue → device / canal Dante
• Diffusion réseau RTSP / SRT (ffmpeg)
• Flux HLS (viewers distants, QR code)
• Pages sous-titres web multi-langues (overlay, lower-third)
Ce que fait le moteur
Transcription
Reconnaissance vocale en temps réel, y compris en environnement bruyant et avec plusieurs interlocuteurs.
Traduction
Traduction simultanée du texte transcrit, en direct, dans plusieurs langues à la fois.
Diarisation
Identification des locuteurs : qui parle, et quand — pour des transcriptions claires et attribuées.
Vocalisation
Synthèse vocale du texte traduit, voix naturelles, en temps réel — avec clonage de voix possible.
Tous les traitements s'exécutent localement sur GPU. Les modèles d'IA sont interchangeables selon la précision et la vitesse recherchées.
Multilingue, du texte à la voix
Langues
• Transcription dans plus de 90 langues
• Mode ultra-rapide sur 25 langues européennes
• Traduction multilingue temps réel
• Sorties simultanées dans plusieurs langues
Voix de synthèse
• Bibliothèque de voix masculines et féminines
• Vocalisation par langue, en temps réel
• Prosodie et ponctuation naturelles
Clonage de voix
• À partir d'un extrait de 5 à 15 secondes
• Transcription automatique de l'extrait
• Voix clonée réutilisable pour la vocalisation
Latences et diffusion de masse
Diffusion de masse : partagez un lien accessible par QR code et tout l'auditoire suit en direct sur son propre appareil — jusqu'à des centaines de milliers de spectateurs. Overlays de sous-titres pour la régie et flux RTSP/SRT réinjectables dans une chaîne de diffusion existante.
API & pilotage
API REST / WebSocket
• API versionnée /api/v1, auto-documentée (Swagger)
• Authentification par clé API
/ws/subtitles?lang= · /ws/listen · /subtitles/<lang>.vtt · /voices/upload · /routing
Exploitation
• Profils d'entrées/sorties sauvegardables
• Validation stricte des périphériques (UID CoreAudio)
• Redémarrage à l'identique, sans intervention
• Console web d'installation et de test
Tout reste chez vous
On-premise par défaut
En mode on-premise, aucune donnée ne quitte vos serveurs.
Pensé pour le RGPD
Traitement local en on-premise, sans sous-traitant tiers.
Pensé pour l'EAA / le RGAA
Accessibilité des directs.
Souveraineté
Vous gardez la main sur toute la chaîne.
Matériel recommandé par environnement
TranscriLive s'appuie sur l'accélération GPU. La puissance dépend de la pile activée (transcription seule, + traduction, + vocalisation) et du nombre de langues diffusées simultanément.
Windows (NVIDIA CUDA)
• GPU : NVIDIA RTX 4090 24 Go recommandé (pile complète)
• Transcription + traduction : RTX 4070 / 4080 (12–16 Go)
• Multi-langues / diffusion : RTX 5090 ou RTX A6000
• CPU 8+ cœurs · 32 Go RAM · Windows 10 / 11
Linux (NVIDIA CUDA)
• Idéal serveur / régie, déploiement souverain
• GPU : RTX 4090 24 Go ou station RTX A6000 / L40S
• Plusieurs GPU pour de nombreuses langues en parallèle
• CPU 8+ cœurs · 32 Go RAM · Ubuntu 22.04+
macOS (Apple Silicon)
• Pipeline MLX natif Apple Silicon (M1 → M4)
• Recommandé : Mac Studio M2 / M3 Max ou Ultra
• 30+ cœurs GPU · 32–64 Go de mémoire unifiée
• MacBook Pro M-series pour transcription + traduction
Le traitement s'exécute sur le GPU (CUDA sur PC, Neural Engine / Metal sur Mac). Aucun cloud, aucune carte réseau spécifique requise en dehors du réseau local.
Ce que vous gagnez face aux autres
Notre concurrent le plus direct, KUDO, traduit les conférences dans le cloud et facture à l'usage (réunion, minute, langue) ; TranscriLive est illimité une fois installé, et rien ne quitte vos serveurs. Quant à la voix — vocalisation, clonage — elle n'existe quasiment qu'en cloud, sur des serveurs américains.
TranscriLive on-premise | KUDO cloud · facturation à l'usage | Interprétation événementielle Wordly · Interprefy… | Transcription cloud Otter · Deepgram · Google · Azure… | IA vocale cloud OpenAI · ElevenLabs… | |
|---|---|---|---|---|---|
| 100% on-premise possible, sur vos serveurs | ✕ | ✕ | ~ | ✕ | |
| Aucune donnée dans le cloud (mode on-premise) | ✕ | ✕ | ✕ | ✕ | |
| Souveraineté / RGPD (hébergement UE) | ✕ | ~ | ~ | ✕ | |
| Illimité — pas de facturation à la minute/heure | ✕ | ✕ | ✕ | ✕ | |
| Transcription en temps réel | ~ | ||||
| Traduction temps réel multilingue | ~ | ~ | |||
| Diarisation (qui parle, quand) | ~ | ~ | ~ | ✕ | |
| Vocalisation / voix de synthèse en direct | ✕ | ✕ | |||
| Clonage de voix | ✕ | ✕ | ✕ | ~ | |
| Diffusion de masse (QR, sous-titres, RTSP/SRT) | ~ | ~ | ✕ | ✕ | |
| Fonctionne hors-ligne / réseau local | ✕ | ✕ | ✕ | ✕ |
Envie de tester TranscriLive ?
Sur votre infrastructure : on installe un pilote gratuit sur votre environnement, résultats mesurés sur vos propres directs. Ou tout de suite : une démo en ligne, accessible sur notre plateforme de test SaaS.