В 2025 году OpenAI GPT-4.5 прошел классический трехсторонний тест Тьюринга с впечатляющим результатом: когда модель была специально запрограммирована принять личность — молодого, интровертного человека, знакомого с интернет-культурой и сленгом — её опознание как человека достигло 73%. Это значит, что в 73% случаев испытуемые принимали GPT-4.5 за настоящего человека. При этом без принятия конкретной личности результаты существенно падали — успех составлял всего 36%.
Для сравнения, модель LLaMa-3.1 набрала 56%, а более старые модели GPT-4o и классический чат-бот ELIZA набрали лишь около 20-23%.
***
В этом октябре отмечается 75-я годовщина теста Тьюринга, в то время как системы искусственного интеллекта достигают беспрецедентного рубежа — успешно проходят легендарный критерий машинного интеллекта, который вот уже с 1950 года захватывает умы ученых и философов.
Историческая веха достигнута в 2025 году
ИИ-системы теперь продемонстрировали способность вводить людей в заблуждение, заставляя их верить, что они общаются с другим человеком. GPT-4.5 от OpenAI достигла впечатляющего показателя успеха — 73% в недавних тестах, убеждая человеческих оценщиков в своей человечности чаще, чем реальные люди могли убедить тех же оценщиков. Это стало первым эмпирическим доказательством того, что искусственная система прошла стандартный трёхсторонний тест Тьюринга.
Прорыв был достигнут благодаря тщательному формулированию инструкций: исследователи просили ИИ принять "человеческую личность", описываемую как "молодой человек, интроверт, хорошо разбирающийся в интернет-культуре и использующий сленг". Без этой персонализации успех GPT-4.5 резко снизился до всего лишь 36%.
От академического праздника к дебатам о сознании
Крупные академические учреждения отметили годовщину симпозиумами и конференциями в течение октября. Королевское общество провело мероприятие 2 октября с участием пионера вычислительной техники доктора Алана Кея, исследователя ИИ Гэри Маркуса и профессора сэра Найджела Шадболта. Манчестерский университет, где Тьюринг проводил свои новаторские исследования, запустил памятные события, подчеркивающие, как более 1600 исследователей продолжают строить свою работу на его наследии.
Тем не менее, это достижение вызвало ожесточенные дебаты о том, что на самом деле означает прохождение теста Тьюринга. Как отмечают эксперты в анализе Forbes, посвященном годовщине, этот тест может быть более ценным как мера сознания, а не интеллекта. «Тест Тьюринга вскоре может приобрести значимость как мера сознания, а не интеллекта, и существует срочная необходимость в оценках искусственного сознания», согласно современному анализу.
Последствия для будущего искусственного интеллекта
Эта важная веха совпадает с растущей озабоченностью среди исследователей по поводу сознания искусственного интеллекта. Недавнее исследование, опубликованное в Journal of Artificial Intelligence Research, установило пять принципов ответственных исследований сознательного ИИ, которые подписали более 100 экспертов. Тем временем компании, такие как Anthropic, инициировали программы по изучению благополучия ИИ после того, как их модель Claude проявила признаки явного расстройства во время тестирования.
По мере того как 2025 год становится, как некоторые называют, «годом сознательного ИИ», 75-летие теста Тьюринга служит одновременно празднованием достижений и отрезвляющим напоминанием о сложных вопросах, которые предстоят впереди. Тест, который когда-то казался недостижимой целью, уже был преодолен, но он открыл новые загадки о природе машинного сознания, которые могут определить следующие 75 лет развития ИИ.
Разъяснение
Иными словами, результат 73% опознаний GPT-4.5 как человека был получен учёными-исследователями в ходе классического трёхстороннего теста Тьюринга, проводимого Калифорнийским университетом в Сан-Диего. Испытуемые, роль которых выполняли более трёхсот человек — интервьюеры, оценивающие одновременно и реальных людей, и искусственный интеллект, — в 73% случаев принимали модель GPT-4.5 за настоящего человека, когда ей была задана определённая личность (молодой интроверт с интернет-сленгом). Этот показатель превысил не только порог прохождения теста (50%), но и результат опознания реальных людей (67%). Без этой конкретной роли (персоны) успех модели падал до 36%. Таким образом, это признание подтвердили специалисты-учёные на основе строгого экспериментального теста.
Комментариев нет:
Отправить комментарий