Google lance Gemini 3.5 Transcribe pour la saisie vocale
Sur un Pixel 11, une note vocale peut désormais arriver sous une forme plus proche d’un texte finalisé que d’une transcription. Le Gemini 3.5 Transcribe de Google alimente déjà la fonctionnalité « Rambler » de Gboard, et l’entreprise prépare le déploiement du modèle dans l’ensemble de son écosystème.
Le modèle ne se contente pas de reconnaître les mots. Il peut supprimer les « euh », réviser le texte lorsqu’un locuteur se corrige et consulter un vocabulaire personnalisé pour les termes spécialisés. Google affirme que le passage de la parole au texte final est environ 70 % plus rapide qu’avec Chirp 3, son précédent moteur de conversion de la voix en texte.
La précision s’est également améliorée, même si l’écart reste modeste. Google mesure le taux d’erreur en parole en direct de Gemini 3.5 Transcribe à 5,5 %, contre 7,32 % pour Chirp 3. Le système prend en charge 85 langues et jusqu’à trois locuteurs dans des enregistrements audio préenregistrés.
Alors, qu’est-ce qui change concrètement ? Les personnes qui dictent de courts messages ou des notes devraient passer moins de temps à corriger les hésitations et les erreurs de transcription avant de partager le résultat. C’est particulièrement utile lorsque la saisie vocale est plus rapide que la frappe, mais cela suppose de faire confiance aux choix éditoriaux du modèle plutôt que de recevoir un compte rendu mot à mot.
Ce compromis reste la principale limite. Ars Technica a jugé le nettoyage efficace lors de tests avec Rambler, tout en notant que Gemini 3.5 Transcribe peut modifier la formulation des propos. Pour une dictée ordinaire, c’est peut-être précisément l’objectif ; dans les situations qui exigent un compte rendu exact, cela peut être une raison de conserver la transcription brute de la parole.
Commentaires
Chargement du fil…
Connectez-vous pour écrire un commentaire. Se connecter