01 Ce qui s’est passé

Google a détaillé en septembre les fonctions de Gemini 3.5 Transcribe pour les développeurs. Le modèle avait été lancé le mois précédent et traite les flux audio ainsi que les fichiers enregistrés.

02 Les points essentiels

  • Transcription en streaming prise en charge dans plus de 85 langues avec basculement automatique.
  • Configuration via custom_vocabulary permettant d'ajouter jusqu'à 1 000 termes spécifiques au domaine ou jargon technique.
  • Traitement de fichiers jusqu'à une heure avec étiquetage des locuteurs, horodatage et nettoyage automatique du texte via l'API Interactions.
  • Selon les évaluations internes de Google, le taux d'erreur sur les mots est de 4,0 % en streaming et 2,6 % pour le traitement de fichiers.

03 Pourquoi c’est important

Ces outils permettent aux développeurs d'accroître la précision de leurs applications vocales grâce à un vocabulaire adapté et des fonctions de correction.

04 Pour qui c’est utile

Développeurs de logiciels et ingénieurs travaillant sur les interfaces vocales.

Source originaleGoogle