Исследование OpenAI и партнеров выявляет статистическую природу феномена галлюцинаций у моделей искусственного интеллекта (ИИ), объясняя их не как технические ошибки, а как естественные ошибки бинарной классификации, возникающие в процессе обучения и оценки моделей. Такие галлюцинации связаны с тем, что факты, встречающиеся в обучающих данных единожды, приводят к неизбежным пробелам в знаниях, и модели генерируют ошибочные ответы, как показали тесты на простых вопросах, где ведущие модели давали разные неверные даты, несмотря на запрос ответов только при уверенности в знании.
Причина таких переуверенных ошибок кроется в бинарной системе оценки, где модели вознаграждаются за правильные ответы и наказываются за неверные, при этом выражение неопределенности оценивается как ошибка. Это стимулирует модели делать предположения и отвечать уверенно, а не признавать незнание, подобно студентам, угадывающим ответы на тестах с множественным выбором, где непреднамеренное угадывание может приносить баллы, а молчание — нет. Анализ популярных тестовых наборов подтвердил, что практически все современные стандарты поощряют уверенное угадывание, что усугубляет проблему галлюцинаций.
Для решения проблемы предлагается изменить систему оценки, введя явные целевые показатели уверенности, например, с поощрением отказа от ответа, если уверенность ниже определённого порога (например, лишь отвечать при уверенности выше 75%), а также штрафами за ошибки и отдельным вознаграждением за правильные ответы. Такой подход по аналогии с историческими экзаменами с отрицательной оценкой за неправильные ответы призван снизить склонность моделей к необоснованным догадкам. Эксперименты показали, что модели, которые отказываются отвечать в половине случаев, делают меньше ошибок, чем те, кто почти всегда отвечает, даже если их общая "точность" кажется ниже. Внедрение этих изменений — это вызов не только технический, сколько социально-технический, требующий смены индустриальных стандартов оценки ИИ для создания более надежных и правдивых систем.
Комментариев нет:
Отправить комментарий