вторник, 27 января 2026 г.

Agentic Vision интегрирована в Gemini 3 Flash

Agentic Vision интегрирована в Gemini 3 Flash, как указано в блоге Google: "Introducing Agentic Vision in Gemini 3 Flash".  Модель Gemini 3 Flash вышла ранее (декабрь 2025), а эта функция добавлена позже для улучшения визуального анализа через код.

Google представила Agentic Vision для Gemini 3 Flash в понедельник, внедрив функцию, которая преобразует способ анализа изображений ИИ-моделями, превращая статическую визуальную обработку в активный итеративный процесс исследования.Эта возможность, анонсированная в блоге компании, посвященном искусственному интеллекту, представляет собой отход от традиционных передовых ИИ-моделей, которые обрабатывают изображения за один просмотр. Когда обычные модели упускают мелкие детали — например, серийный номер на микрочипе или далекий дорожный знак — они вынуждены угадывать. Agentic Vision решает это ограничение, позволяя модели активно манипулировать изображениями и повторно анализировать их через выполнение кода.

Как работает Агентное зрение

В основе Агентного зрения лежит цикл «Думай, Действуй, Наблюдай», который обеспечивает многоэтапное визуальное рассуждение. На этапе «Думай» модель анализирует запрос пользователя и исходное изображение для формирования многоэтапного плана. На этапе «Действуй» она генерирует и выполняет Python-код для манипуляции изображениями — обрезки, поворота, аннотирования или выполнения вычислений. Этап «Наблюдай» добавляет преобразованное изображение в контекстное окно модели, позволяя проверить новые данные перед формированием окончательного ответа.

По данным Google, включение выполнения кода в Gemini 3 Flash обеспечивает стабильное улучшение качества на 5-10% в большинстве тестов для систем компьютерного зрения. Компания описывает выполнение кода как «один из первых инструментов, поддерживаемых Агентным зрением».

Практическое применение

Google продемонстрировал несколько практических сценариев использования этой технологии. PlanCheckSolver, платформа для проверки строительных планов на основе ИИ, повысила свою точность на 5%, внедрив возможность выполнения кода для итеративной проверки архитектурных чертежей высокого разрешения. Логи бэкенда компании демонстрируют агентный процесс в действии: Gemini 3 Flash генерирует код на Python для обрезки и анализа отдельных фрагментов — таких как края крыши или секции здания — чтобы подтвердить соответствие сложным строительным нормам.

Эта возможность также позволяет размечать изображения: модель может рисовать ограничивающие рамки и числовые метки над объектами, которые она распознаёт. Google продемонстрировал это на примере подсчёта пальцев в приложении Gemini, где модель использует «визуальный блокнот» для точного попикельного понимания.

Для визуальной математики Agentic Vision может анализировать таблицы высокой плотности и выполнять код на Python для визуализации результатов. Вместо того чтобы полагаться на вероятностные догадки при многоэтапных визуальных вычислениях, модель передаёт вычисления в детерминированную среду Python.

Доступность и дальнейшее развитие

Agentic Vision уже доступен через Gemini API в Google AI Studio и Vertex AI, а также постепенно появляется в приложении Gemini для пользователей, которые выбирают режим Thinking в выпадающем меню моделей.

Google отметила, что хотя Gemini 3 Flash в настоящее время отлично справляется с автоматическим определением необходимости увеличения мелких деталей, другие возможности, такие как поворот изображений или выполнение визуальных математических операций, всё ещё требуют явных указаний в промпте. Компания заявила, что работает над тем, чтобы сделать эти действия полностью автоматическими в будущих обновлениях, а также изучает возможность добавления дополнительных инструментов, включая веб-поиск и поиск по изображению.

Комментариев нет:

Отправить комментарий