Google continue d'étendre les capacités de sa gamme phare d'intelligence artificielle , Gemini 2.0 , en mettant l'accent sur la combinaison d'une interaction vocale fluide et d'une analyse logique approfondie. Les dernières fonctionnalités de l'écosystème permettent à l'IA d'effectuer des calculs complexes en plusieurs étapes, directement au cours de la conversation avec l'utilisateur.

Le mode vocal interactif Gemini Live permet une conversation en temps réel avec une latence minimale. Les utilisateurs peuvent interrompre l'algorithme en pleine phrase, changer de sujet ou transmettre le flux vidéo de la caméra de leur appareil. Le système adapte l'intonation et les émotions, créant ainsi un rendu proche de la parole humaine naturelle.

Parallèlement, les développeurs font évoluer la technologie « Extended Thinking » , introduite avec le modèle Gemini 2.0 Flash Thinking . Grâce à des mécanismes de « Chain-of-Thought » (chaîne de raisonnement), le modèle élabore un plan de réponse interne, vérifie des hypothèses et corrige ses propres erreurs. Cela réduit considérablement le nombre d'hallucinations lors de la résolution de problèmes de programmation, de mathématiques et d'analyse.

La synergie entre les algorithmes d'interaction vocale et les capacités de raisonnement approfondi marque une nouvelle étape dans le développement de l'IA. Les utilisateurs peuvent désormais obtenir des réponses précises à des questions analytiques, sans délai ni requêtes textuelles complexes.

Source : Blog Google