Большие данные — не всегда лучше: MIT-разработчики нашли способ гарантировать оптимальные решения с минимальным набором данных
17 ноября 2025 г.
В эпоху искусственного интеллекта и больших данных кажется аксиомой: чем больше информации, тем точнее модель. Тренировка нейросетей на миллиардах записей, анализ гигантских датасетов для прогнозирования климата или оптимизации логистики — это норма, требующая огромных вычислительных мощностей, энергии и времени. Но что, если для решения сложных задач достаточно крошечного, тщательно подобранного набора данных? Исследователи из Массачусетского технологического института (MIT) только что доказали это на практике, разработав математический фреймворк и алгоритм, которые гарантируют нахождение оптимального решения с минимальным количеством измерений. Их подход не просто экономит ресурсы — он меняет парадигму принятия решений в условиях неопределённости, от планирования метро в мегаполисе до оптимизации цепочек поставок и энергосетей.
Представьте ситуацию: вы — городской планировщик в Нью-Йорке, и вам нужно проложить новую линию метро под землёй. Тысячи потенциальных маршрутов через сотни кварталов, каждый с неизвестными затратами на строительство — от грунтовых вод до инженерных препятствий. Традиционно вы бы заказали полевые исследования по всей сети, чтобы собрать максимум данных. Но такие исследования дороги и времязатратны. Как выбрать всего несколько точек, где данные гарантируют, что вы найдёте самый дешёвый маршрут? Новый метод MIT отвечает: с помощью структуры проблемы и математики.
"Данные — один из ключевых элементов экономики ИИ. Модели обучаются на всё больших объёмах, поглощая колоссальные ресурсы. Но большинство реальных задач имеют структуру, которую можно использовать. Мы показали, что с тщательным отбором вы гарантируете оптимальные решения с маленьким датасетом, и даём метод, чтобы определить именно те данные, которые нужны", — говорит Асу Оздэглар, профессор математики в Департаменте электротехники и компьютерных наук (EECS) MIT, глава Schwarzman College of Computing и главный исследователь в Лаборатории информации и систем принятия решений (LIDS).
Оздэглар — со-старший автор статьи, опубликованной в arXiv (arxiv.org/pdf/2505.21692), вместе с со-ведущими авторами Омаром Беннуной (аспирант EECS MIT) и его братом Амином Беннуной (бывший постдок MIT, ныне ассистент-профессор в Northwestern University), а также со-старшим автором Саурбхом Амином, со-директором Центра исследований операций MIT, профессором Департамента гражданской и экологической инженерии и главным исследователем LIDS. Работа будет представлена на Конференции по обработке нейронной информации (NeurIPS).
#### Гарантия оптимальности: от теории к алгоритму
Большая часть недавних исследований в области исследований операций фокусируется на том, как лучше использовать существующие данные для решений. Но команда MIT задалась другим вопросом: **какие минимальные данные нужны, чтобы оптимально решить проблему?** С таким знанием можно собирать в разы меньше информации, экономя время, деньги и энергию на экспериментах и обучении ИИ.
Исследователи начали с точной геометрической и математической характеристики "достаточности" датасета. Каждое возможное множество затрат (время в пути, расходы на строительство, цены на энергию) делает какое-то решение оптимальным. Эти "регионы оптимальности" делят пространство решений. Датасет достаточен, если он позволяет определить, в каком регионе лежит истинная стоимость — без лишних деталей.
Эта характеристика стала основой практического алгоритма, который находит наименьший достаточный датасет. Теоретический анализ показал: часто достаточно крошечного, стратегически выбранного набора данных.
"Когда мы говорим, что датасет достаточен, мы имеем в виду, что он содержит ровно ту информацию, которая нужна для решения задачи. Не нужно точно оценивать все параметры — нужны данные, которые дискриминируют между конкурирующими оптимальными решениями", — объясняет Амин Беннуна.
На основе этих основ команда разработала итеративный алгоритм, который находит минимальный набор. Чтобы использовать инструмент, вводите структуру задачи (цель, ограничения) и известную информацию о проблеме. Например, в управлении цепочками поставок задача — минимизировать операционные затраты по сети из десятков потенциальных маршрутов. Компания может знать, что некоторые маршруты особенно дороги, но не иметь полной картины по другим.
Алгоритм работает циклами: "Есть ли сценарий, который изменит оптимальное решение так, что мои текущие данные этого не заметят?" Если да — добавляет измерение, захватывающее эту разницу. Если нет — датасет доказанно достаточен. В случае метро это подмножество кварталов для исследований, гарантирующее минимум затрат.
Затем собранные данные подаются в другой алгоритм команды, который находит оптимальное решение — например, маршруты поставок для минимальных затрат.
"Алгоритм гарантирует, что для любого сценария в пределах вашей неопределённости вы найдёте лучшее решение", — подчёркивает Омар Беннуна.
Оценки команды показали: с этим методом оптимальное решение гарантировано с гораздо меньшим датасетом, чем обычно собирают.
"Мы бросаем вызов заблуждению, что малые данные — это приблизительные решения. Это точные результаты достаточности с математическими доказательствами. Мы определили, когда гарантируете оптимальное решение с очень малыми данными — не 'вероятно', а с уверенностью", — говорит Саурбх Амин.
Применение: от метро к глобальным цепочкам
Метод применим к широкому классу структурированных задач принятия решений под неопределённостью. В планировании метро — выбор локаций для исследований, гарантирующий дешёвый маршрут. В цепочках поставок — минимальный набор пробных маршрутов для оптимальной сети. В оптимизации энергосетей — выбор точек для измерений, чтобы минимизировать потери без полного сканирования.
В эпоху ИИ это особенно актуально: обучение моделей на огромных датасетах жрёт энергию (например, GPT-4 потребовала эквивалент энергии небольшого города). Метод позволяет "умно" собирать данные, фокусируясь на структуре проблемы, а не на объёме.
"Это оригинальная работа с ясностью и элегантной геометрической характеристикой. Фреймворк предлагает свежий взгляд на эффективность данных в принятии решений", — комментирует Яо Се, профессор Georgia Tech (не участвовал в исследовании).
В будущем команда планирует расширить фреймворк на другие типы задач и сложные сценарии, включая шумные наблюдения. Это может революционизировать ИИ: вместо "больше данных = лучше" — "правильные данные = оптимально".
"Мы показали, что с умным отбором малый датасет гарантирует точные решения. Это меняет подход к данным в ИИ-экономике", — заключает Оздэглар.
Почему это важно для бизнеса, науки и общества
В мире, где данные — "новая нефть", метод MIT — это инструмент для рационального расхода. Для бизнеса: экономия на исследованиях цепочек поставок (миллиарды долларов в год). Для науки: ускорение симуляций климата или физики с минимальными вычислениями. Для общества: меньше энергозатрат на ИИ, что снижает углеродный след (тренировка одной модели может равняться полётам сотен самолётов).
Это не просто оптимизация — это сдвиг парадигмы: от слепого сбора данных к стратегическому. В эпоху, когда датасеты растут экспоненциально, MIT напоминает: качество побеждает количество.
Источники:
Оригинальный релиз MIT News (17 ноября 2025): https://news.mit.edu/2025/bigger-datasets-arent-always-better-1118
Статья в arXiv: https://arxiv.org/pdf/2505.21692
Подготовлено для X com @dcnchannel
Комментариев нет:
Отправить комментарий