24 сентября 2026 года Google DeepMind выпустила Gemini 3.8 Live with Live Avatar. Модель нативно связывает диалог в реальном времени с потоковой генерацией видео. Аватар слушает собеседника, видит его, говорит и параллельно обращается к внешним сервисам. Анонс сделали исследователь Shuo-yiin Chang и инженер CJ Zheng от имени Gemini Audio Team.
Идентификатор модели в API, согласно разбору на Habr, выглядит как gemini-3.8-live. Там же приведены технические детали: контекстное окно до 128 000 токенов, при активном Live Avatar модель выдаёт до 24 000 токенов. На вход идут аудио PCM 16 кГц, текст и кадры JPEG (анализ входящего видео, до 1 кадра в секунду). На выходе модель отдаёт звук 24 кГц, текст и MP4-видео с аватаром при 24 кадрах в секунду. Связь идёт по двустороннему WebSocket. Эти цифры в анонсе Google DeepMind не приводятся, опираться на них стоит с оговоркой.
Доступна модель в Gemini Enterprise. Кастомные аватары можно создавать по одному референсному изображению: модель сохраняет внешность и превращает статичную картинку в анимированного персонажа. Использовать изображения несовершеннолетних и знаменитостей запрещено, требуются права на лицо и голос. Кастомные аватары пока доступны только через enterprise allowlisting. Цена в анонсе не раскрыта.
Live Avatar поддерживает асинхронный вызов инструментов. Пока внешний сервис обрабатывает запрос в фоне, диалог не прерывается. В демонстрации Google виртуальный сотрудник регистрирует гостя в отеле: аватар разговаривает и параллельно обращается к системе бронирования.
Модель переключается между 97 языками прямо во время разговора, без перезапуска сессии. Синхронизация губ и мимика адаптируются к новой речи автоматически. Весь сгенерированный аудио- и видеоконтент помечается водяным знаком SynthID.
Ограничения в карточке модели тоже указаны. В разборе на Habr со ссылкой на карточку модели говорится: Live Avatar рассчитан на несколько минут непрерывной работы, возможны задержки, тайм-ауты и галлюцинации, дата отсечки знаний приходится на январь 2025. Для актуальных данных агенту всё равно нужен внешний источник.
Что это значит для агентов
По цене и бенчмаркам рассуждать не получится: в анонсе нет ни того, ни другого. Зато описана роль модели: это разговорный интерфейс с визуальным присутствием, а не новый рассуждающий модуль. Сама модель рассчитана на сессии в несколько минут — интерфейс для коротких сценариев, внутри которых агент выполняет ограниченный набор действий.