
Google представила модель Gemini 3.5 Transcribe — ИИ для транскрипции речи. С её помощью можно загрузить аудиофайл или подключить микрофон и получить текст с учетом пунктуации, разделением по спикерам и временными метками. Модель автоматически распознаёт язык и поддерживает русский.
Для базовой транскрипции нет необходимости писать код или подключать платный API — Gemini 3.5 Transcribe доступна через Google AI Studio. Я уже протестировал модель, и в этой статье продемонстрирую весь процесс на простом примере, а также рассмотрим транскрипцию речи в реальном времени.
Также читайте: Нейросети для озвучивания текста голосом
Возможности Gemini 3.5 Transcribe
Gemini 3.5 Transcribe преобразует речь из аудиофайла в текст. Google сообщает о поддержке более 85 языков и диалектов, включая русский. Модель автоматически определяет язык и распознаёт переключения между несколькими языками в одной записи.
Это может быть полезно, например, для:
- транскрипции интервью, подкастов или голосовых заметок;
- получения текста из записи звонка;
- перевода надиктованного черновика статьи или поста в текст;
- разделения реплик нескольких участников;
- получения временных меток для каждого слова;
- точного распознавания названий компаний, фамилий и профессиональных терминов.
Для последних трёх задач модель предлагает специальные настройки. Speaker labels разделяет запись по спикерам, Word timestamps добавляет временные метки, а Custom vocabulary позволяет заранее указать слова, к которым модель должна проявлять особое внимание. В словарь можно добавить до 1000 терминов, хотя Google рекомендует ограничиваться примерно сотней наиболее важных.
Существует режим Smart transcription. Обычная транскрипция стремится сохранить речь максимально близко к оригиналу, включая повторы и слова-паразиты. Smart transcription очищает текст: убирает лишние «э-э», повторы и оговорки, расставляет пунктуацию и может оформить продиктованное перечисление как список.
Для длинных записей есть ограничение: Gemini 3.5 Transcribe принимает до одного часа аудио за запрос. Если активировать разделение по спикерам или временные метки для слов, лимит снижается до 30 минут.
Это интересно: Как создать пост-карусель с помощью ИИ
Как бесплатно использовать Gemini 3.5 Transcribe
Gemini 3.5 Transcribe можно протестировать бесплатно в Google AI Studio. На момент написания статьи мне удалось просто выбрать модель в Playground и начать транскрипцию без подключения платного API. Я проверял на короткой записи на русском языке — модель корректно распознала речь.
Точные ограничения бесплатного режима Google в интерфейсе AI Studio не отображает, поэтому рассчитывать на него как на безлимитный сервис не следует.
Шаг 1. Откройте Gemini 3.5 Transcribe
Перейдите на сайт Google AI Studio и откройте Playground.
На правой панели кликните по названию текущей модели. Откроется окно выбора модели. Выберите раздел Audio и найдите Gemini 3.5 Transcribe. Код модели — gemini-3.5-transcribe.

После выбора появится отдельный интерфейс для работы с аудио: в центре появится блок Turn speech to transcriptions, а справа — параметры транскрипции.
Шаг 2. Настройте транскрипцию
Справа расположены основные параметры.

Primary language — язык записи. Можно оставить Detect, чтобы Gemini определила его автоматически. Если вы знаете язык заранее, его можно указать вручную.
Word timestamps — временные метки для отдельных слов.
Speaker labels — разделение реплик по участникам. Gemini 3.5 Transcribe поддерживает до восьми спикеров, хотя Google пока считает распознавание трёх и более участников экспериментальным.
Smart transcription — очистка разговорной речи и автоматическое форматирование текста.
Custom vocabulary — собственный словарь. Сюда стоит добавить сложные фамилии, названия брендов, продуктов, сервисов или профессиональные термины, которые модель может распознать неправильно.
Для стандартной голосовой заметки ничего менять не нужно: оставьте автоматическое определение языка и запустите транскрипцию.
Шаг 3. Добавьте аудио
Запись можно добавить тремя способами:
- Drive — выбрать файл с Google Диска;
- Upload — загрузить аудиофайл с компьютера;
- Record Audio — записать голос прямо в AI Studio.
Для быстрого теста удобно использовать последний вариант — нажмите Record Audio.

Затем нажмите Start recording и произнесите несколько фраз.

После завершения записи её можно прослушать. Если всё в порядке, нажмите Add to prompt.

Аудиофайл появится в списке Selected files.
Шаг 4. Нажмите Transcribe
После добавления записи нажмите Transcribe.

Gemini обработает аудио и выведет текст ниже. Если активированы Speaker labels, рядом с репликами появятся обозначения спикеров. При включённых временных метках модель также вернёт время произнесения слов.

Например, в моём тесте была записана фраза: «Всем привет. Это Telegram-канал Промты и точка. Здесь я рассказываю про новинки ИИ».
Gemini 3.5 Transcribe корректно распознала её и сразу добавила нужные знаки препинания.
Как транскрибировать речь в реальном времени?
Gemini 3.5 Transcribe имеет версию для живой речи — Gemini 3.5 Transcribe Live, код модели gemini-3.5-transcribe-live. Она принимает звук с микрофона или другого аудиопотока и выводит текст по мере произнесения слов.

В Google AI Studio снова откройте выбор моделей, перейдите в Audio и выберите Gemini 3.5 Transcribe Live. После запуска разрешите сайту доступ к микрофону и начинайте говорить — распознанный текст будет отображаться в интерфейсе во время разговора.
Версия Live также автоматически определяет язык, поддерживает собственный словарь и Smart transcription. Однако в сравнении с обработкой аудиофайлов здесь есть ограничения: отсутствует разделение по спикерам и временные метки для каждого слова, а одна сессия длится максимум 10 минут.
В моём тесте стандартная Gemini 3.5 Transcribe быстро и точно расшифровала короткую русскую запись. Но Live-режим работал менее стабильно и иногда задерживал распознавание.
Цены на API для Gemini 3.5 Transcribe
В Google AI Studio обе модели можно протестировать бесплатно. Если подключать модели через платный Gemini API, цены следующие:
— Gemini 3.5 Transcribe — $2 за 1 млн входных аудиотокенов и $12 за 1 млн выходных текстовых токенов. Google оценивает общую стоимость примерно в $0,005 за минуту транскрипции;
— Gemini 3.5 Transcribe Live — $3,50 за 1 млн входных аудиотокенов и $21 за 1 млн выходных текстовых токенов, или около $0,009 за минуту при расчётном объёме токенов от Google.
Чтобы подключить модель к своему приложению или скрипту, нужен ключ Gemini API. Его можно получить в Google AI Studio.
Что делать дальше
Сначала протестируйте Gemini 3.5 Transcribe на своих записях: голосовых сообщениях, интервью, звонках или подкастах. Для записей с несколькими участниками активируйте разделение по спикерам, а сложные названия, фамилии и термины добавьте в Custom vocabulary.
Если качество вас устраивает, подключите модель через Gemini API. Это позволит автоматически транскрибировать загруженные аудиофайлы, переводить голосовые сообщения в текст, подготавливать стенограммы встреч или обрабатывать речь в реальном времени.
Больше гайдов по работе с ИИ:
- Как пользоваться нейросетью GLM-5.3-Flash
- Как пользоваться Nano Banana 2 Lite бесплатно
- Как установить и запустить ComfyUI


