Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
On a Pixel 11, a voice note can now arrive as something closer to finished prose than a transcript. Google’s Gemini 3.5 Transcribe already powers the Gboard “Rambler” feature, and the company is preparing to bring the model across its wider ecosystem.
Sur un Pixel 11, une note vocale peut désormais arriver sous une forme plus proche d’un texte finalisé que d’une transcription. Le Gemini 3.5 Transcribe de Google alimente déjà la fonctionnalité « Rambler » de Gboard, et l’entreprise prépare le déploiement du modèle dans l’ensemble de son écosystème.
The model does more than recognize words. It can remove “ums” and “uhs,” revise text when a speaker corrects themselves, and consult custom vocabulary for specialized jargon. Google says the path from speech to final text is about 70 percent faster than with Chirp 3, the previous voice-to-text engine.
Le modèle ne se contente pas de reconnaître les mots. Il peut supprimer les « euh », réviser le texte lorsqu’un locuteur se corrige et consulter un vocabulaire personnalisé pour les termes spécialisés. Google affirme que le passage de la parole au texte final est environ 70 % plus rapide qu’avec Chirp 3, son précédent moteur de conversion de la voix en texte.
Accuracy has improved too, though the gap is modest. Google measures Gemini 3.5 Transcribe’s live-speech error rate at 5.5 percent, compared with 7.32 percent for Chirp 3. The system supports 85 languages and up to three speakers in pre-recorded audio.
La précision s’est également améliorée, même si l’écart reste modeste. Google mesure le taux d’erreur en parole en direct de Gemini 3.5 Transcribe à 5,5 %, contre 7,32 % pour Chirp 3. Le système prend en charge 85 langues et jusqu’à trois locuteurs dans des enregistrements audio préenregistrés.
So what changes in practice? People dictating short messages or notes should spend less time fixing verbal stumbles and transcription errors before sharing the result. That is especially useful when voice input is faster than typing, but it depends on trusting the model’s editorial choices rather than receiving a word-for-word record.
Alors, qu’est-ce qui change concrètement ? Les personnes qui dictent de courts messages ou des notes devraient passer moins de temps à corriger les hésitations et les erreurs de transcription avant de partager le résultat. C’est particulièrement utile lorsque la saisie vocale est plus rapide que la frappe, mais cela suppose de faire confiance aux choix éditoriaux du modèle plutôt que de recevoir un compte rendu mot à mot.
That trade-off remains the limit. Ars Technica found the cleanup effective in testing with Rambler, while noting that Gemini 3.5 Transcribe can alter the wording of what was said. For casual dictation, that may be the point; for situations requiring an exact account, it may be a reason to keep the raw speech transcript.
Ce compromis reste la principale limite. Ars Technica a jugé le nettoyage efficace lors de tests avec Rambler, tout en notant que Gemini 3.5 Transcribe peut modifier la formulation des propos. Pour une dictée ordinaire, c’est peut-être précisément l’objectif ; dans les situations qui exigent un compte rendu exact, cela peut être une raison de conserver la transcription brute de la parole.