Компания разрабатывает новую архитектуру аудиомодели, запуск которой запланирован на первый квартал 2026 года и которая обеспечит более естественную речь, обработку прерываний в реальном времени и—в отличие от текущих моделей—возможность говорить, пока пользователи еще разговаривают. Кундан Кумар, исследователь, привлеченный из Character.AI, возглавляет техническую работу по устранению разрыва между аудиомоделями OpenAI и их текстовыми аналогами, которые, по словам нынешних и бывших сотрудников, остаются более быстрыми и точными.
Аппаратный рывок следует за приобретением OpenAI в мае за $6,5 миллиарда стартапа io, соучредителем которого является бывший главный дизайнер Apple Джони Айв. Айв сделал снижение зависимости от устройств центральным приоритетом, позиционируя дизайн с приоритетом аудио как возможность «исправить ошибки» прошлых потребительских гаджетов. Хотя конкретные детали остаются скудными, OpenAI, как сообщается, рассматривает множество форм-факторов, включая очки и умные колонки без экрана.
Индустрия принимает будущее с приоритетом аудио
Поворот OpenAI отражает волну экспериментов со звуком по всей технологической индустрии. Meta внедрила массив из пяти микрофонов в свои умные очки Ray-Ban для фильтрации разговоров в шумной обстановке, в то время как Google запустил Audio Overviews в июне, которые преобразуют результаты поиска в разговорные резюме с использованием моделей ИИ Gemini. Tesla интегрировала Grok, разговорного ассистента xAI, в свои автомобили для навигации без использования рук и управления климатом.
Тем не менее, путь к жизнеспособному аудио-ориентированному оборудованию остается усеян неудачами. Humane закрыла свой AI Pin в феврале после того, как HP приобрела активы компании за 116 миллионов долларов, положив конец продукту, который сжег сотни миллионов в финансировании. Носимое устройство за 699 долларов страдало от медленных ответов, плохого времени работы батареи и неспособности выполнять базовые задачи.
Ставки высоки для OpenAI. Генеральный директор Сэм Альтман назвал прототипы io «самой крутой технологией, которую когда-либо видел мир», и компания поставила амбициозную цель поставить 100 миллионов единиц «быстрее, чем любая компания когда-либо поставляла 100 миллионов чего-то нового». Может ли только звук поддерживать новую вычислительную платформу — или для этого требуются экосистемы на основе экранов, от которых пользователи уже зависят — остается вопросом на миллиард долларов для индустрии.
Комментариев нет:
Отправить комментарий