«Сбер» разрабатывает технологию искусственного интеллекта нового типа — «фулл-дуплекс», которая позволяет ИИ одновременно слушать собеседника и говорить, как это делает человек во время телефонного разговора. О новой разработке рассказал директор по развитию технологий ИИ Сбербанка Сергей Марков.

Сегодня большинство голосовых ассистентов работают по принципу очереди. Человек сначала говорит, затем система обрабатывает запрос и только после этого отвечает. В новой технологии этот процесс пытаются устроить иначе.

Главное отличие фулл-дуплекса в том, что вместо нескольких отдельных нейросетей используется одна модель. Сейчас одна система переводит голос в текст, другая формирует ответ, а третья превращает его обратно в речь. Это позволяет ИИ одновременно слушать и отвечать.

Если добавить видеомодальность, такая система сможет также видеть собеседника и управлять движениями аватара.

Подобные технологии уже появились за рубежом. Первой стала модель Moshi французского стартапа Kyutai в 2024 году. Затем свои решения представили Google с Gemini Live и OpenAI с GPT-Live.

Фулл-дуплекс позволяет значительно сократить задержку ответа — с нескольких секунд до 160–320 миллисекунд. Это уже сопоставимо со скоростью реакции человека в разговоре.

В России о подобной разработке ранее публично не заявлял никто. У «Яндекса» есть близкая технология Realtime API с быстрым ответом и возможностью перебить ассистента, однако, по словам Маркова, это не полноценный фулл-дуплекс.

Разница в том, что система «Яндекса» ждёт смены реплики, а полноценный фулл-дуплекс продолжает слушать пользователя даже в тот момент, когда сам уже говорит.

Читайте ещё материалы по теме: