Skip to main content
Нейросеть Gemini 3.5 Transcribe — как бесплатно расшифровать аудио, как подключить API

Google представила модель Gemini 3.5 Transcribe — ИИ для транскрипции речи. С её помощью можно загрузить аудиофайл или подключить микрофон и получить текст с учетом пунктуации, разделением по спикерам и временными метками. Модель автоматически распознаёт язык и поддерживает русский.

Для базовой транскрипции нет необходимости писать код или подключать платный API — Gemini 3.5 Transcribe доступна через Google AI Studio. Я уже протестировал модель, и в этой статье продемонстрирую весь процесс на простом примере, а также рассмотрим транскрипцию речи в реальном времени.

Также читайте: Нейросети для озвучивания текста голосом

Возможности Gemini 3.5 Transcribe

Gemini 3.5 Transcribe преобразует речь из аудиофайла в текст. Google сообщает о поддержке более 85 языков и диалектов, включая русский. Модель автоматически определяет язык и распознаёт переключения между несколькими языками в одной записи.

Это может быть полезно, например, для:

  • транскрипции интервью, подкастов или голосовых заметок;
  • получения текста из записи звонка;
  • перевода надиктованного черновика статьи или поста в текст;
  • разделения реплик нескольких участников;
  • получения временных меток для каждого слова;
  • точного распознавания названий компаний, фамилий и профессиональных терминов.

Для последних трёх задач модель предлагает специальные настройки. Speaker labels разделяет запись по спикерам, Word timestamps добавляет временные метки, а Custom vocabulary позволяет заранее указать слова, к которым модель должна проявлять особое внимание. В словарь можно добавить до 1000 терминов, хотя Google рекомендует ограничиваться примерно сотней наиболее важных.

Существует режим Smart transcription. Обычная транскрипция стремится сохранить речь максимально близко к оригиналу, включая повторы и слова-паразиты. Smart transcription очищает текст: убирает лишние «э-э», повторы и оговорки, расставляет пунктуацию и может оформить продиктованное перечисление как список.

Для длинных записей есть ограничение: Gemini 3.5 Transcribe принимает до одного часа аудио за запрос. Если активировать разделение по спикерам или временные метки для слов, лимит снижается до 30 минут.

Это интересно: Как создать пост-карусель с помощью ИИ

Как бесплатно использовать Gemini 3.5 Transcribe

Gemini 3.5 Transcribe можно протестировать бесплатно в Google AI Studio. На момент написания статьи мне удалось просто выбрать модель в Playground и начать транскрипцию без подключения платного API. Я проверял на короткой записи на русском языке — модель корректно распознала речь.

Точные ограничения бесплатного режима Google в интерфейсе AI Studio не отображает, поэтому рассчитывать на него как на безлимитный сервис не следует.

Шаг 1. Откройте Gemini 3.5 Transcribe

Перейдите на сайт Google AI Studio и откройте Playground.

На правой панели кликните по названию текущей модели. Откроется окно выбора модели. Выберите раздел Audio и найдите Gemini 3.5 Transcribe. Код модели — gemini-3.5-transcribe.

Как пользоваться Gemini 3.5 Transcribe бесплатно

После выбора появится отдельный интерфейс для работы с аудио: в центре появится блок Turn speech to transcriptions, а справа — параметры транскрипции.

Шаг 2. Настройте транскрипцию

Справа расположены основные параметры.

Настройка расшифровки

Primary language — язык записи. Можно оставить Detect, чтобы Gemini определила его автоматически. Если вы знаете язык заранее, его можно указать вручную.

Word timestamps — временные метки для отдельных слов.

Speaker labels — разделение реплик по участникам. Gemini 3.5 Transcribe поддерживает до восьми спикеров, хотя Google пока считает распознавание трёх и более участников экспериментальным.

Smart transcription — очистка разговорной речи и автоматическое форматирование текста.

Custom vocabulary — собственный словарь. Сюда стоит добавить сложные фамилии, названия брендов, продуктов, сервисов или профессиональные термины, которые модель может распознать неправильно.

Для стандартной голосовой заметки ничего менять не нужно: оставьте автоматическое определение языка и запустите транскрипцию.

Шаг 3. Добавьте аудио

Запись можно добавить тремя способами:

  • Drive — выбрать файл с Google Диска;
  • Upload — загрузить аудиофайл с компьютера;
  • Record Audio — записать голос прямо в AI Studio.

Для быстрого теста удобно использовать последний вариант — нажмите Record Audio.

Как записать аудио

Затем нажмите Start recording и произнесите несколько фраз.

Как расшифровать аудио с помощью ИИ

После завершения записи её можно прослушать. Если всё в порядке, нажмите Add to prompt.

Расшифровка речи

Аудиофайл появится в списке Selected files.

Шаг 4. Нажмите Transcribe

После добавления записи нажмите Transcribe.

Транскрибация речи с помощью ИИ

Gemini обработает аудио и выведет текст ниже. Если активированы Speaker labels, рядом с репликами появятся обозначения спикеров. При включённых временных метках модель также вернёт время произнесения слов.

Как превратить аудио в текст

Например, в моём тесте была записана фраза: «Всем привет. Это Telegram-канал Промты и точка. Здесь я рассказываю про новинки ИИ».

Gemini 3.5 Transcribe корректно распознала её и сразу добавила нужные знаки препинания.

Как транскрибировать речь в реальном времени?

Gemini 3.5 Transcribe имеет версию для живой речи — Gemini 3.5 Transcribe Live, код модели gemini-3.5-transcribe-live. Она принимает звук с микрофона или другого аудиопотока и выводит текст по мере произнесения слов.

Gemini 3.5 Transcribe Live

В Google AI Studio снова откройте выбор моделей, перейдите в Audio и выберите Gemini 3.5 Transcribe Live. После запуска разрешите сайту доступ к микрофону и начинайте говорить — распознанный текст будет отображаться в интерфейсе во время разговора.

Версия Live также автоматически определяет язык, поддерживает собственный словарь и Smart transcription. Однако в сравнении с обработкой аудиофайлов здесь есть ограничения: отсутствует разделение по спикерам и временные метки для каждого слова, а одна сессия длится максимум 10 минут.

В моём тесте стандартная Gemini 3.5 Transcribe быстро и точно расшифровала короткую русскую запись. Но Live-режим работал менее стабильно и иногда задерживал распознавание.

Цены на API для Gemini 3.5 Transcribe

В Google AI Studio обе модели можно протестировать бесплатно. Если подключать модели через платный Gemini API, цены следующие:

— Gemini 3.5 Transcribe — $2 за 1 млн входных аудиотокенов и $12 за 1 млн выходных текстовых токенов. Google оценивает общую стоимость примерно в $0,005 за минуту транскрипции;

— Gemini 3.5 Transcribe Live — $3,50 за 1 млн входных аудиотокенов и $21 за 1 млн выходных текстовых токенов, или около $0,009 за минуту при расчётном объёме токенов от Google.

Чтобы подключить модель к своему приложению или скрипту, нужен ключ Gemini API. Его можно получить в Google AI Studio.

Что делать дальше

Сначала протестируйте Gemini 3.5 Transcribe на своих записях: голосовых сообщениях, интервью, звонках или подкастах. Для записей с несколькими участниками активируйте разделение по спикерам, а сложные названия, фамилии и термины добавьте в Custom vocabulary.

Если качество вас устраивает, подключите модель через Gemini API. Это позволит автоматически транскрибировать загруженные аудиофайлы, переводить голосовые сообщения в текст, подготавливать стенограммы встреч или обрабатывать речь в реальном времени.

Больше гайдов по работе с ИИ:

  • Как пользоваться нейросетью GLM-5.3-Flash
  • Как пользоваться Nano Banana 2 Lite бесплатно
  • Как установить и запустить ComfyUI

Gemini гайды Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий