OpenAI в четверг представила революционный бенчмарк, который демонстрирует, что модели искусственного интеллекта стремительно приближаются к уровню человеческой производительности в профессиональной работе в ключевых отраслях. Система оценки GDPval компании показывает, что ИИ-модели теперь могут соперничать или превосходить человеческих экспертов почти в половине всех протестированных заданий, что является самым близким соответствием машин человеческому экономическому вкладу на сегодняшний день.
В ходе тестирования ведущие ИИ-модели сравнивались с опытными профессионалами в 44 профессиях из девяти отраслей, наиболее значимых для валового внутреннего продукта США, включая здравоохранение, финансы, промышленность и государственное управление. В слепых сравнениях Opus 4.1 от Anthropic стал лидером, показав результат 47,6% побед или ничьих против человеческих экспертов, в то время как GPT-5 от OpenAI набрал 40,6%.
Резкий скачок производительности свидетельствует об экономическом влиянии искусственного интеллекта
Результаты свидетельствуют о поразительном ускорении развития возможностей искусственного интеллекта. Модель GPT-4o от OpenAI, выпущенная всего 15 месяцев назад, показывала успех лишь в 13,7% подобных задач — то есть производительность GPT-5 за это время почти утроилась. «Темпы прогресса действительно впечатляют», — сказала TechCrunch руководитель отдела оценки OpenAI Теджал Патвардхан.
Оценка GDPval отличается от традиционных тестов ИИ тем, что она фокусируется на реальных рабочих результатах, а не на академических испытаниях. Профессиональные эксперты сравнивали отчёты, юридические заключения, инженерные планы и стратегии ухода, созданные ИИ, с работами, произведёнными людьми, не зная, кто автор. Задания были разработаны профессионалами со средним опытом 14 лет, чтобы максимально отразить реальные рабочие результаты.
Преимущества скорости и стоимости стимулируют интеграцию на рабочем месте
Помимо соответствия качеству, модели ИИ продемонстрировали значительный прирост эффективности. OpenAI обнаружила, что передовые модели могут выполнять задачи GDPval примерно в 100 раз быстрее и в 100 раз дешевле, чем отраслевые эксперты, хотя эти показатели не учитывают необходимые этапы контроля человеком и интеграции. «Особенно по тем задачам, где модели особенно сильны, мы ожидаем, что передача задачи модели до попытки с человеком поможет сэкономить время и деньги», заявили в OpenAI.
Главный экономист OpenAI, доктор Аарон Чаттерджи, подчеркнул, что результаты указывают на то, что ИИ будет дополнять, а не заменять людей на рабочих местах. «Люди, работающие на этих должностях, теперь могут использовать модель — и по мере улучшения её возможностей — для передачи части своей работы и заниматься, возможно, более ценными задачами», пояснил он. Однако компания отмечает, что GDPval в настоящее время оценивает лишь узкую часть реальных рабочих задач, и планирует расширить охват этого стандарта в будущих итерациях.
Комментариев нет:
Отправить комментарий