Google crea un modelo de inteligencia artificial que transforma tus pensamientos en texto

Elígenos como tu fuente preferida en Google.
La empresa tecnológica afirma que Gemini 3.5 Transcribe permitirá usar la conversión de voz a texto en cualquier campo web del navegador.
Google ha implementado Gemini 3.5 Transcribe, un modelo de audio con inteligencia artificial que ofrece reconocimiento de voz y transcripción mejorados y que, según la empresa, puede ofrecer en texto reflexiones sin aparente orden.
Habitualmente, la empresa más famosa de Mountain View presenta sus nuevos modelos como los más capaces lanzados hasta el momento y esta vez no ha sido diferente con la última iteración de la IA de Google.
Sobre esta, ha destacado una particularidad, debido a que "a diferencia de los modelos de reconocimiento de voz convencionales que tienen dificultades con el ruido de fondo, la jerga compleja y la corrección de disfluencia, Gemini 3.5 convierte el audio sin procesar directamente en texto preciso, pulido y formateado".
Qué diferencia a Gemini 3.5 Transcribe del resto de modelos
Google ha comentado que este modelo de IA está diseñado para capturar el estilo de habla natural de los usuarios, así como para comprender mejor la intención con la que hablan y reconocer vocabulario personalizado.
De esa manera, puede gestionar fácilmente autocorrecciones en el habla, así como eliminar palabras de relleno o coletillas (por ejemplo 'ehs' y 'ahs') y formatear el texto de manera automática, para darle mayor continuidad y fluidez-
Por otro lado, el modelo puede delegar tareas complejas, como la generación de imágenes o análisis de archivos, a otros modelos de Gemini, además de que puede hacer transcripciones de texto más precisas, con una tasa de error menor.
De este modo, "demuestra un rendimiento sólido en entornos ruidosos y reales, capturando con precisión entidades alfanuméricas, como códigos postales e identificadores de pedidos", ha señalado la firma.
Lo más interesante es que reconoce la jerga especializada y la ortografía particular adaptando las transcripciones al vocabulario personalizado de cada usuario. Y lo hace, además, detectando automáticamente más de 85 idiomas y manejando sin problema los acentos, así como dialectos.
Finalmente, Google ha avanzado que Gemini 3.5 Transcribe también identifica qué ha dicho quién en las conversaciones con marcas de tiempo para hasta tres hablantes, teniendo en cuenta que la compatibilidad con 3 o más hablantes es experimental.
Ya disponible para desarrolladores y usuarios de Rambler para Android
La compañía ha anunciado que ha creado Gemini Transcribe 3.5 para que se integre "a la perfección" en los flujos de trabajo de desarrollo de agentes de voz, herramientas de simulación en tiempo real o sistemas de análisis posteriores a las llamadas.
De esa manera, ha puesto a disposición de los usuarios este modelo a través de dos interfaces de programación de aplicaciones (API) diferentes. Una de ellas está enfocada al procesamiento de audio programado, de modo que transcribe audio grabado, reuniones, registros de llamadas, entre otros, con atribución de orador y marcas de tiempo.
Por otro lado está la transcripción en tiempo real, que ofrece una transmisión continua y bidireccional con latencia inferior a un segundo para aplicaciones de voz interactivas a través de la API Live o Gemini 3.4 Transcribe Live.
Con todo eso, Gemini 3.5 Transcribe ya está disponible para desarrolladores, en la versión preliminar pública de la API Gemini a través de Google AI Studio y Google Antigravity. Las empresas también pueden acceder a este modelo a través de Gemini Enterprise Agent Platform y los usuarios pueden hacerlo desde la app del asistente para macOS en inglés.
Asimismo, Google ha confirmado que se podrá utilizar este modelo de inteligencia artificial en Rambler para Android en algunos países e idiomas, como el árabe, el inglés, el coreano o el portugués. Finalmente, se integrará en Chrome, aunque no se ha concretado la fecha de llegada a su navegador.


