Google пусна гласовия модел Gemini 3.8 Live
- Редактор: Петър Симеонов
- Коментари: 0

Технологията променя създаването на виртуални асистенти
Технологичната компания "Гугъл" (Google) представи официално във вторник две нови версии на своя езиков модел за гласова комуникация – Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Разработката позволява създаването на автономни гласови агенти, които обработват информация и водят плавен диалог в реално време, съобщават от официалния блог на корпорацията.
Анализ в реално време
Базовата версия Gemini 3.8 Live е оптимизирана за мащабност и бързина. Моделът може да обработва визуална информация почти мигновено и автоматично да разпознава и превключва между 97 поддържани езика в рамките на един разговор. Системата изпълнява софтуерни команди и търсения във фонов режим, като поддържа разговора с потребителя, докато задачата се финализира.
За операции, изискващи по-дълбок анализ, от компанията въвеждат версията Extended Thinking. Този модел има способността да обмисля и да говори едновременно. За да поддържа естествения ход на разговора по време на сложни задачи, изкуственият интелект използва словесни паузи, заявявайки например "Нека проверя това...", докато извършва търсенето, посочват от "Гугъл".
Според представените технически тестове, моделът за разширено мислене постига резултат от 97,7% в специализирания бенчмарк за аудио Big Bench Audio и заема първо място в индекса за качество на гласовите разговори Artificial Analysis с резултат от 82,6 пункта.
Интеграция в бизнеса
Новите модели вече са достъпни за разработчици чрез платформата Gemini Live API. Партньорски платформи за разработка като Agora, LangChain и Vercel вече използват технологията за изграждане на гласови интерфейси от ново поколение. Системата е насочена към автоматизиране на корпоративни работни процеси, където се изисква баланс между точност на данните и естествено звучене на гласа.
Защита на съдържанието
Срещу потенциални злоупотреби с генериран глас, компанията въвежда задължителна защита. Цялото аудио съдържание, създадено от моделите Gemini 3.8 Live, съдържа невидим воден знак, базиран на технологията SynthID. Сигналът е вграден директно в звуковата вълна и позволява категоричното разпознаване на генерираното от изкуствен интелект съдържание, за да се предотврати разпространението на дезинформация.
Моделите са достъпни за разработчици чрез платформите на "Гугъл", а крайните потребители могат да тестват базовата версия през функцията за търсене на живо. Версията Extended Thinking е налична за абонатите на премиум услугите на компанията.






















