Transcription vocale (STT)
STT local faster-whisper, Groq Whisper, détection de silence, repli et diagnostic.
#Moteurs
| Moteur | Données | Prérequis |
|---|---|---|
| Local | Audio traité sur le PC | faster-whisper, CPU et modèle local; valeur par défaut small. |
| Groq | Audio envoyé à l’API Groq | Clé Groq et modèle Whisper annoncé. |
| Aucun repli | Échec retourné sans second moteur | Choisir explicitement none comme repli. |
#Capture PC
La détection d’activité vocale calibre le bruit ambiant, attend un minimum d’audio, termine après une séquence de silence et impose une durée maximale. Ces seuils sont des détails d’implémentation et non une garantie de reconnaissance.
Sur Android, l’application enregistre en mono 16 kHz dans un fichier temporaire, encode les octets puis tente de supprimer le fichier après l’arrêt ou l’annulation.
#Repli
Le moteur principal est lu à chaque appel. S’il échoue, OSIA peut essayer le moteur de repli configuré lorsqu’il est différent et disponible. Si les deux échouent, la transcription est vide plutôt qu’inventée.
#Diagnostic
- Vérifier l’autorisation et le périphérique par défaut.
- Tester dans une pièce calme après calibration.
- Pour local, attendre le premier chargement du modèle.
- Pour Groq, vérifier la clé et le compte fournisseur.
- Revenir au texte si l’audio reste indisponible.
Provenance de cette page
Faits produit vérifiés sur PC 7b6b3b000b89, mobile d492cc89cf77 et Worker f07e239bd455.
Sources consultées
- PC: osia/voice/
- Mobile: lib/services/audio_service.dart