← Назад в технический блог

Gemini 3.5 Pro: 10 обновлений ИИ-возможностей, которые стоит знать

Обновления Gemini 3.5 Pro: контекст 2M токенов, Deep Think, мультиагентная оркестрация
Два главных козыря Gemini 3.5 Pro: 2 млн токенов контекста и Deep Think — одно решает «не влезает», другое «не думает глубоко».

На Google I/O 2026 в мае Сундар Пичаи одновременно представил Gemini 3.5 Flash (уже в GA) и Gemini 3.5 Pro (флагманский превью). Pro — не просто увеличенная версия Flash: Google выбрал полную перестройку с нуля, а не инкрементальные улучшения, нацелившись на три самых сложных задачи современных frontier-моделей: сверхдлинный контекст, глубокое рассуждение и многошаговую оркестрацию агентов. В этой статье — разбор 10 ключевых апгрейдов с точки зрения разработчика и сравнение с Flash, Claude и GPT для выбора модели.

Сначала разберёмся: где Pro в линейке Gemini 3.5

На I/O 2026 Google выбрал стратегию двойного релиза:

  • Gemini 3.5 Flash: GA уже в мае, модель по умолчанию в Google AI Mode — скорость, стоимость и охват экосистемы.
  • Gemini 3.5 Pro: анонсирован в тот же день, но широкий доступ отложен; позиционируется как «максимальные возможности линейки» для сложного рассуждения, анализа целых репозиториев и долгих agent-задач.

По данным нескольких источников, перед релизом Pro Google всё переделал с нуля — внутренняя тестовая версия не дала ожидаемого качества рассуждения, и команда предпочла перестройку вместо поспешного запуска. Поэтому Flash доступен почти два месяца, а GA Pro всё ещё сдвигается (изначально — конец июня; к середине июля модель остаётся в корпоративном превью Vertex AI).

Для разработчиков: Flash — дефолт на сегодня; Pro — специализированное оружие, когда контекст и рассуждение должны быть на максимуме, а не универсальная замена.


Апгрейд 1: контекстное окно в 2 млн токенов

Самая заметная цифра Gemini 3.5 Pro — 2 миллиона токенов: вдвое больше Flash (1 млн) и крупнейший production-контекст среди актуальных frontier-моделей.

СравнениеМакс. контекстОтносительно Pro
Gemini 3.5 Pro2 млн токенов
Gemini 3.5 Flash1 млн токеновПоловина
GPT-5.x (расширенный уровень)~512 000 токенов~1/4
Claude Opus 4.x200 000 токенов~1/10

Что помещается в 2 млн токенов?

  • Средний TypeScript monorepo (~2000 файлов, ~200 строк каждый)
  • Три года экспорта Slack команды из 30 человек
  • Четыре полных SEC S-1 одновременно
  • Полный гражданский дело (иск, показания, доказательства, протоколы заседаний)

Ключевой вывод: влезает ≠ стоит грузить целиком. 2 млн токенов заметно увеличивают prefill-задержку и стоимость входа; если ответ спрятан в небольшом фрагменте, RAG + Flash часто выгоднее. Преимущество Pro проявляется, когда связи между файлами должны быть видны одновременно — аудит безопасности всего репозитория, перекрёстное сравнение договорных условий, долгий Agent без частой передачи контекста.


Апгрейд 2: режим Deep Think для глубокого рассуждения

Deep Think — продуктовое название Google для «расширенного вычисления при инференсе» (extended inference-time compute). Перед финальным ответом модель тратит больше циклов на промежуточные выводы и самокоррекцию, а не на быстрый pattern matching.

Управляется параметром API thinkingConfig, четыре уровня:

thinkingLevelСценарийВлияние на задержку
minimalПростые запросы, быстрый ответМинимальное
lowСтандартное дополнениеНизкое
mediumМногошаговое рассуждениеСреднее
highМатематические доказательства, архитектурные решения, оптимизация с ограничениямиМаксимальное
import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);

const model = genAI.getGenerativeModel({
  model: "gemini-3.5-pro",
  generationConfig: {
    thinkingConfig: { thinkingLevel: "high" }
  }
});

Важно про стоимость: токены рассуждения входят в бюджет контекста и тарифицируются по ставке выходных токенов. Сложная задача может съесть много токенов ещё до финального ответа. Deep Think — «переключатель для трудных задач», не режим по умолчанию.

Flash не поддерживает Deep Think — одна из эксклюзивных возможностей Pro.


Апгрейд 3: многошаговые agentic-циклы исследования

По сравнению с Gemini 3.1 Pro поколение 3.5 даёт заметный скачок в agentic-возможностях. Pro нативно поддерживает многошаговые циклы исследования: модель сама планирует маршрут поиска, обходит несколько источников, синтезирует внутри и только потом отвечает — вместо схемы «один поиск — один ответ» за один проход.

Прямое влияние на:

  • Анализ конкурентов и рынка: перекрёстное сравнение отчётов, пресс-релизов и продуктовой документации
  • Технический выбор: одновременный просмотр официальных docs, GitHub Issues и обсуждений сообщества
  • Комплаенс-ревью: поиск конфликтующих пунктов в объёмных нормативных базах

Если вы уже пользуетесь «глубоким исследованием» в Google AI Mode, версия на Pro теоретически справится со более сложными и длинными цепочками — реальный опыт стоит проверить после широкого GA.


Апгрейд 4: автономные workflow и оркестрация инструментов

По данным I/O и отчётов сторонних разработчиков, Gemini 3.5 Pro наследует agentic-архитектуру Flash и усиливает цепочки вызовов инструментов: модель может собрать в автономный workflow задачи вроде «читать код → запустить тесты → исправить баг → снова запустить тесты», не дожидаясь подтверждения на каждом шаге.

В связке с протоколом инструментов MCP Pro теоретически может:

  1. Обнаруживать доступные инструменты через MCP (filesystem, GitHub, база данных и т.д.)
  2. Самостоятельно выбирать порядок вызовов по сложности задачи
  3. Держать состояние долгих задач в окне 2 млн токенов

Для одиночных разработчиков и небольших команд это значит отдать модели больше «клеевой логики», а человеку оставить финальную проверку. В продакшене всё равно нужны границы прав и контрольные точки — автономность ≠ работа без присмотра.


Апгрейд 5: мультиагентная координация Google Antigravity

Линейка Gemini 3.5 тесно связана с Antigravity — платформой разработки, представленной Google в тот же период. Antigravity позволяет Pro разворачивать параллельных субагентов: разные подзадачи идут одновременно через независимых агентов, главный агент координирует и объединяет результаты.

Типичный workflow:

  • Субагент A: сканирование уязвимостей безопасности
  • Субагент B: проверка устаревших зависимостей
  • Субагент C: черновики PR с исправлениями
  • Главный агент: сводный отчёт и приоритизация

Это близко к модели «Orchestrator + Workers» из четырёх мультиагентных архитектур. Ценность Antigravity — продуктовая оркестрация и более низкий порог входа для собственного agent-фреймворка.

Если вы уже крутите OpenClaw или self-hosted Agent на облачном Mac, следите, откроет ли Antigravity self-hosted доступ — пока это в основном экосистема Google.


Апгрейд 6: мультимодальное понимание на уровне документов

Историческая сила Gemini — мультимодальность. 3.5 Pro усиливает рассуждение по изображениям и понимание на уровне документа — не просто OCR, а структурированный семантический разбор диаграмм, сканов и смешанных PDF.

Практические сценарии:

  • Загрузить архитектурные схемы и блок-схемы в контекст для генерации кода
  • Разобрать таблицы и рукописные пометки в отсканированных договорах
  • Совместное рассуждение по ключевым кадрам видео и субтитрам (точный объём — по официальной model card)

Для iOS / macOS-разработчиков: в контекст Pro можно положить скриншоты Xcode, отчёты Instruments и макеты — модель поймёт и «как выглядит интерфейс», и «что говорят метрики производительности». Flash тоже умеет, но длинный контекст Pro позволяет одновременно держать «всю дизайн-спеку + все скриншоты + кодовую базу».


Апгрейд 7: точность извлечения в длинном контексте

«Вместить 2 млн токенов» и «точно извлечь нужное после загрузки» — разные вещи. Классическая болезнь ранних long-context моделей — lost in the middle: когда ключевая информация в середине контекста, качество ответов резко падает.

Google заявляет улучшенную точность извлечения по всему окну в 3.5 Pro — приближаясь к 2 млн токенов, качество должно оставаться пригодным. Если это подтвердится, это напрямую решает, стоит ли «заливать всё целиком» вместо блочного RAG.

Рекомендация: после GA протестируйте на своём корпусе — needle-in-a-haystack: заройте ключевой факт на 500 тыс., 1 млн и 1,5 млн токенов и проверьте извлечение. Не опирайтесь только на цифры с презентации.


Апгрейд 8: скачок в бенчмарках frontier-рассуждения

На I/O Google намекнул, что 3.5 Pro вернёт и превзойдёт frontier-уровень на сложных бенчмарках вроде ARC-AGI-2 и Humanity's Last Exam (HLE) — компенсируя компромисс Flash в пользу скорости на абстрактном рассуждении.

К середине июля 2026 официальные бенчмарки ещё не опубликованы полностью, у третьих сторон нет честных сравнений на одном harness. Поэтому:

  • Вопрос «обгоняет ли рассуждение Claude Opus 4.8 / GPT-5.5» — пока видна лишь направленность, не вывод
  • Стратегия Google больше похожа на лидерство по длине контекста, чем на лобовую битву с Anthropic во всех agentic coding рейтингах

При выборе спросите себя: узкое место — «мало рассуждает» или «не влезает контекст»? Для первого ждите бенчмарки; для второго у Pro уже есть чёткое отличие.


Апгрейд 9: новая архитектура, пересобранная с нуля

Легко упустить, но важно для долгосрочных пользователей: Gemini 3.5 Pro — не 3.1 Pro с большим числом параметров, а версия, переобученная Google DeepMind после неудовлетворительных внутренних тестов.

Практические последствия:

  • Поведение может сильно отличаться от 3.1 Pro — существующие prompt-шаблоны и system prompts нужно перенастроить
  • Отложенный GA ради гарантии качества — плюс для продакшена, но ранняя документация и цены нестабильны
  • Частично общая agentic-инфраструктура с Flash — миграция Flash → Pro относительно лёгкая по toolchain

Апгрейд 10: открытый API и endpoint, совместимый с OpenAI

Pro будет доступен через несколько каналов:

КаналСтатус (15.07.2026)Примечания
Vertex AIКорпоративное превьюModel ID: gemini-3.5-pro-preview-06, нужен allowlist
Google AI StudioПосле GAДля быстрых экспериментов соло-разработчиков
Gemini API (REST/SDK)После GAОфициальные SDK Python / TypeScript
Endpoint, совместимый с OpenAIУже в AI StudioДля миграции достаточно сменить base URL в существующем OpenAI SDK
Подписка Gemini AdvancedОжидается с GAПотребительский вход

В сценариях длинного контекста Context Caching — ключевой рычаг стоимости: кэшированный ввод может быть ~на 90% дешевле обычного — удобно для «один большой контекст, много вопросов» (аудит репозитория, многоходовые юридические Q&A).

const cachedContent = await genAI.cacheContent({
  model: "gemini-3.5-pro",
  contents: [{ role: "user", parts: [{ text: largeContext }] }],
  ttl: "3600s"
});

const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");

Pro vs Flash vs конкуренты: одна таблица

ПараметрGemini 3.5 ProGemini 3.5 FlashClaude Opus 4.8GPT-5.5
Контекст2 млн токенов1 млн токенов200 000 токенов~512 000 токенов
Глубокое рассуждениеDeep ThinkНетExtended thinkingo-series
Цена входа (оценка)$12–15 / M$1.50 / M~$20 / M~$15 / M
Цена выхода (оценка)$36–45 / M$9 / M~$60 / M~$60 / M
Статус GAВ превьюGAGAGA
Лучший сценарийСверхдлинный контекст, анализ репозиторияЕжедневный высокий throughputAgentic-кодингСтруктурированные многошаговые задачи

Цены — оценка на этапе превью; после GA смотрите официальную страницу тарифов Google. Более полная стратегия маршрутизации моделей — в рейтинге OpenRouter Top10.


Как подключиться? Доступность и сроки

На 15 июля 2026:

  • Публичный список моделей Gemini API по-прежнему в основном gemini-3.5-flash и gemini-3.1-pro-previewширокого GA для gemini-3.5-pro ещё нет
  • Несколько источников указывают на ~17 июля как целевую дату GA, но Google не опубликовал официальную model card и тарифы — используйте как ориентир для планирования, не как продакшен-обязательство
  • Корпоративные пользователи могут запросить превью gemini-3.5-pro-preview-06 в Vertex AI

Для индивидуальных разработчиков сейчас:

  1. Гонять бизнес-логику и интеграцию инструментов на Flash
  2. Готовить prompts для Pro и модель бюджета (особенно Deep Think + длинный контекст)
  3. После GA сделать A/B: одна задача на Flash и Pro, решать маршрутизацию по реальному расходу токенов и качеству данных

Итог: кому ждать Pro, кому хватит Flash

Gemini 3.5 Pro — специализированный инструмент, не универсальная замена.

Командам, которым стоит ждать / приоритетно пробовать Pro:

  • Юриспруденция, финансы, комплаенс — перекрёстный анализ длинных документов
  • Аудит безопасности — весь код репозитория виден сразу
  • Долгие агенты — состояние сессии на часы без частого сжатия контекста
  • Сложное рассуждение — математика, архитектура, оптимизация с ограничениями; готовность платить задержкой и токенами за точность

Командам, которым Flash достаточно уже сейчас:

  • Ежедневная помощь в коде, правка одного файла
  • Высокопроизводительные API-пайплайны (поддержка, генерация контента, классификация)
  • Q&A по базе знаний, покрываемой RAG
  • Продакшен-пути, чувствительные к задержке

Из 10 апгрейдов реально меняют правила игры только две цифры: 2 млн токенов и Deep Think. Остальное (agentic-циклы, Antigravity, мультимодальность) Flash уже в большей части покрывает; Pro поднимает потолок. Сначала поймите, узкое место — «не влезает» или «недостаточно думает», и только потом решайте, платить ли за Pro.

Нужна среда сборки 24/7 для агентов?

Облачный Mac mini M4 на выделенном bare metal — для Xcode CI, self-hosted runner и постоянно работающих OpenClaw Agent — узлы Токио, Сингапур, Гонконг, оплата по дням

Читать дальше

Частые вопросы

Gemini 3.5 Pro или Gemini 3.5 Flash — как выбрать?

Для ежедневного диалога, высокого throughput и чувствительности к цене — Flash. Для полного контекста в 2 млн токенов, Deep Think и сложных agentic-циклов исследования — Pro. Цена Pro примерно в 8–10 раз выше Flash.

Можно ли уже использовать Gemini 3.5 Pro?

К середине июля 2026 Pro остаётся в корпоративном превью Vertex AI. Публичный Gemini API в основном предлагает gemini-3.5-flash и gemini-3.1-pro. Широкий GA ожидается во второй половине июля — сверяйтесь с официальной документацией Google.

Насколько дороже режим Deep Think?

Токены рассуждения входят в бюджет контекста и тарифицируются по ставке выхода. Сложная задача может съесть много токенов до финального ответа — включайте Deep Think только для трудных кейсов (математические доказательства, архитектурные решения).

Для чего подходит контекст в 2 млн токенов?

Аудит всего репозитория, перекрёстное сравнение юридических и нормативных документов, удержание состояния долгих агентов. Для правки одного файла или задач, закрываемых RAG, Flash + блочный поиск обычно быстрее и дешевле.

Можно ли вызывать Gemini 3.5 Pro через существующий OpenAI SDK?

Да. Google AI Studio предоставляет endpoint, совместимый с OpenAI; большинству существующих кодов на OpenAI SDK достаточно сменить base URL и имя модели.

Акция →