Google пусна гласовия модел Gemini 3.8 Live

0
Технологията променя създаването на виртуални асистенти
Технологията променя създаването на виртуални асистенти

Технологията променя създаването на виртуални асистенти

Технологичната компания "Гугъл" (Google) представи официално във вторник две нови версии на своя езиков модел за гласова комуникация – Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Разработката позволява създаването на автономни гласови агенти, които обработват информация и водят плавен диалог в реално време, съобщават от официалния блог на корпорацията.

Анализ в реално време

Базовата версия Gemini 3.8 Live е оптимизирана за мащабност и бързина. Моделът може да обработва визуална информация почти мигновено и автоматично да разпознава и превключва между 97 поддържани езика в рамките на един разговор. Системата изпълнява софтуерни команди и търсения във фонов режим, като поддържа разговора с потребителя, докато задачата се финализира.

За операции, изискващи по-дълбок анализ, от компанията въвеждат версията Extended Thinking. Този модел има способността да обмисля и да говори едновременно. За да поддържа естествения ход на разговора по време на сложни задачи, изкуственият интелект използва словесни паузи, заявявайки например "Нека проверя това...", докато извършва търсенето, посочват от "Гугъл".

Според представените технически тестове, моделът за разширено мислене постига резултат от 97,7% в специализирания бенчмарк за аудио Big Bench Audio и заема първо място в индекса за качество на гласовите разговори Artificial Analysis с резултат от 82,6 пункта.

Интеграция в бизнеса

Новите модели вече са достъпни за разработчици чрез платформата Gemini Live API. Партньорски платформи за разработка като Agora, LangChain и Vercel вече използват технологията за изграждане на гласови интерфейси от ново поколение. Системата е насочена към автоматизиране на корпоративни работни процеси, където се изисква баланс между точност на данните и естествено звучене на гласа.

Защита на съдържанието

Срещу потенциални злоупотреби с генериран глас, компанията въвежда задължителна защита. Цялото аудио съдържание, създадено от моделите Gemini 3.8 Live, съдържа невидим воден знак, базиран на технологията SynthID. Сигналът е вграден директно в звуковата вълна и позволява категоричното разпознаване на генерираното от изкуствен интелект съдържание, за да се предотврати разпространението на дезинформация.

Моделите са достъпни за разработчици чрез платформите на "Гугъл", а крайните потребители могат да тестват базовата версия през функцията за търсене на живо. Версията Extended Thinking е налична за абонатите на премиум услугите на компанията.

Изпращайте снимки и информация на news@dunavmost.com по всяко време на денонощието!

Остават 2000 символа

Поради зачестилите злоупотреби в сайта, за да оставите анонимен коментар или да гласувате изискваме да се идентифицирате с Google акаунт.

Натискайки на Google бутона коментарът ви ще бъде публикуван анонимно под псевдонима който сте попълнили по-горе в полето "Твоето име". Никаква лична информация за вас няма да бъде съхранявана при нас или показвана на други потребители.

Код за сигурност
* Моля, използвайте кирилица! Не се толерират мнения с обидно или нецензурно съдържание, на верска или етническа основа, както и коментари написани само с главни букви!
Зареди още коментари

Най-четени новини

Календар - новини и събития

Виц на деня

Влиза жена в стаята при мъжа си и казва:

- Искам да ми купиш ново килимче.

- Ааа, без такива екстри! Ще си летиш с метлата.

Нови коментари