Темы

среда, 26 ноября 2025 г.

Теперь вы можете использовать ChatGPT Voice, не выходя из чата

OpenAI объявила во вторник, что устранила необходимость в отдельном голосовом режиме в ChatGPT, интегрировав голосовые разговоры непосредственно в основной интерфейс чата, где пользователи теперь могут просматривать транскрипции в реальном времени наряду с визуальным контентом, таким как карты и изображения.

Обновление, которое внедряется для всех пользователей на мобильных и веб-платформах, устраняет давнее ограничение, при котором голосовые взаимодействия ранее происходили на изолированном экране с анимированным синим шаром. Пользователи могли только слушать ответы, не видя их, что требовало выхода из голосового режима для просмотра того, что ChatGPT сказал в текстовом виде.

Бесшовный мультимодальный опыт

Благодаря новой интеграции пользователи могут начинать голосовые разговоры, нажав на значок формы волны рядом с текстовым полем ChatGPT, и наблюдать, как ответы появляются по мере их речи. Согласно демонстрационному видео OpenAI, система может отображать расшифровки разговоров, одновременно показывая соответствующие визуальные материалы. В одном из примеров, которым поделилась компания, ChatGPT отображал карту популярных булочных и фотографии выпечки из пекарни Tartine Bakery в Сан-Франциско во время голосового разговора.

«Вы можете говорить, наблюдать, как появляются ответы, просматривать предыдущие сообщения и видеть визуальные элементы, такие как изображения или карты, в режиме реального времени», — заявила OpenAI в своем объявлении в X. Пользователи по-прежнему должны нажать «завершить», чтобы остановить голосовой разговор перед переключением обратно на текстовый ввод.

Сохранение выбора пользователя

Интегрированный голосовой режим становится интерфейсом по умолчанию после обновления приложения, хотя OpenAI сохранила оригинальный интерфейс для пользователей, которые предпочитают работу только с аудио. Те, кто хочет вернуться к предыдущему формату, могут включить «Раздельный режим» в разделе «Голосовой режим» в настройках.

Это изменение представляет собой продолжение усилий OpenAI по развитию мультимодальных AI-взаимодействий, позволяя пользователям более плавно переключаться между голосом и текстом без потери контекста разговора. Google исследовала схожую территорию с Gemini Live, который может выделять определённые части видео в реальном времени с помощью наложений во время голосовых разговоров.



Комментариев нет:

Отправить комментарий

Избранные

Квантовый компьютер на захваченных ионах моделирует физику частиц с помощью кубитов и фононов

Учёные из Университета Мэриленда впервые использовали колебательные фононные моды захваченных ионов как нативный бозонный регист...

Часто просматриваемве