На Google I/O 2026 в мае Сундар Пичаи одновременно представил Gemini 3.5 Flash (уже в GA) и Gemini 3.5 Pro (флагманский превью). Pro — не просто увеличенная версия Flash: Google выбрал полную перестройку с нуля, а не инкрементальные улучшения, нацелившись на три самых сложных задачи современных frontier-моделей: сверхдлинный контекст, глубокое рассуждение и многошаговую оркестрацию агентов. В этой статье — разбор 10 ключевых апгрейдов с точки зрения разработчика и сравнение с Flash, Claude и GPT для выбора модели.
Сначала разберёмся: где Pro в линейке Gemini 3.5
На I/O 2026 Google выбрал стратегию двойного релиза:
- Gemini 3.5 Flash: GA уже в мае, модель по умолчанию в Google AI Mode — скорость, стоимость и охват экосистемы.
- Gemini 3.5 Pro: анонсирован в тот же день, но широкий доступ отложен; позиционируется как «максимальные возможности линейки» для сложного рассуждения, анализа целых репозиториев и долгих agent-задач.
По данным нескольких источников, перед релизом Pro Google всё переделал с нуля — внутренняя тестовая версия не дала ожидаемого качества рассуждения, и команда предпочла перестройку вместо поспешного запуска. Поэтому Flash доступен почти два месяца, а GA Pro всё ещё сдвигается (изначально — конец июня; к середине июля модель остаётся в корпоративном превью Vertex AI).
Для разработчиков: Flash — дефолт на сегодня; Pro — специализированное оружие, когда контекст и рассуждение должны быть на максимуме, а не универсальная замена.
Апгрейд 1: контекстное окно в 2 млн токенов
Самая заметная цифра Gemini 3.5 Pro — 2 миллиона токенов: вдвое больше Flash (1 млн) и крупнейший production-контекст среди актуальных frontier-моделей.
| Сравнение | Макс. контекст | Относительно Pro |
|---|---|---|
| Gemini 3.5 Pro | 2 млн токенов | — |
| Gemini 3.5 Flash | 1 млн токенов | Половина |
| GPT-5.x (расширенный уровень) | ~512 000 токенов | ~1/4 |
| Claude Opus 4.x | 200 000 токенов | ~1/10 |
Что помещается в 2 млн токенов?
- Средний TypeScript monorepo (~2000 файлов, ~200 строк каждый)
- Три года экспорта Slack команды из 30 человек
- Четыре полных SEC S-1 одновременно
- Полный гражданский дело (иск, показания, доказательства, протоколы заседаний)
Ключевой вывод: влезает ≠ стоит грузить целиком. 2 млн токенов заметно увеличивают prefill-задержку и стоимость входа; если ответ спрятан в небольшом фрагменте, RAG + Flash часто выгоднее. Преимущество Pro проявляется, когда связи между файлами должны быть видны одновременно — аудит безопасности всего репозитория, перекрёстное сравнение договорных условий, долгий Agent без частой передачи контекста.
Апгрейд 2: режим Deep Think для глубокого рассуждения
Deep Think — продуктовое название Google для «расширенного вычисления при инференсе» (extended inference-time compute). Перед финальным ответом модель тратит больше циклов на промежуточные выводы и самокоррекцию, а не на быстрый pattern matching.
Управляется параметром API thinkingConfig, четыре уровня:
| thinkingLevel | Сценарий | Влияние на задержку |
|---|---|---|
minimal | Простые запросы, быстрый ответ | Минимальное |
low | Стандартное дополнение | Низкое |
medium | Многошаговое рассуждение | Среднее |
high | Математические доказательства, архитектурные решения, оптимизация с ограничениями | Максимальное |
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);
const model = genAI.getGenerativeModel({
model: "gemini-3.5-pro",
generationConfig: {
thinkingConfig: { thinkingLevel: "high" }
}
});
Важно про стоимость: токены рассуждения входят в бюджет контекста и тарифицируются по ставке выходных токенов. Сложная задача может съесть много токенов ещё до финального ответа. Deep Think — «переключатель для трудных задач», не режим по умолчанию.
Flash не поддерживает Deep Think — одна из эксклюзивных возможностей Pro.
Апгрейд 3: многошаговые agentic-циклы исследования
По сравнению с Gemini 3.1 Pro поколение 3.5 даёт заметный скачок в agentic-возможностях. Pro нативно поддерживает многошаговые циклы исследования: модель сама планирует маршрут поиска, обходит несколько источников, синтезирует внутри и только потом отвечает — вместо схемы «один поиск — один ответ» за один проход.
Прямое влияние на:
- Анализ конкурентов и рынка: перекрёстное сравнение отчётов, пресс-релизов и продуктовой документации
- Технический выбор: одновременный просмотр официальных docs, GitHub Issues и обсуждений сообщества
- Комплаенс-ревью: поиск конфликтующих пунктов в объёмных нормативных базах
Если вы уже пользуетесь «глубоким исследованием» в Google AI Mode, версия на Pro теоретически справится со более сложными и длинными цепочками — реальный опыт стоит проверить после широкого GA.
Апгрейд 4: автономные workflow и оркестрация инструментов
По данным I/O и отчётов сторонних разработчиков, Gemini 3.5 Pro наследует agentic-архитектуру Flash и усиливает цепочки вызовов инструментов: модель может собрать в автономный workflow задачи вроде «читать код → запустить тесты → исправить баг → снова запустить тесты», не дожидаясь подтверждения на каждом шаге.
В связке с протоколом инструментов MCP Pro теоретически может:
- Обнаруживать доступные инструменты через MCP (filesystem, GitHub, база данных и т.д.)
- Самостоятельно выбирать порядок вызовов по сложности задачи
- Держать состояние долгих задач в окне 2 млн токенов
Для одиночных разработчиков и небольших команд это значит отдать модели больше «клеевой логики», а человеку оставить финальную проверку. В продакшене всё равно нужны границы прав и контрольные точки — автономность ≠ работа без присмотра.
Апгрейд 5: мультиагентная координация Google Antigravity
Линейка Gemini 3.5 тесно связана с Antigravity — платформой разработки, представленной Google в тот же период. Antigravity позволяет Pro разворачивать параллельных субагентов: разные подзадачи идут одновременно через независимых агентов, главный агент координирует и объединяет результаты.
Типичный workflow:
- Субагент A: сканирование уязвимостей безопасности
- Субагент B: проверка устаревших зависимостей
- Субагент C: черновики PR с исправлениями
- Главный агент: сводный отчёт и приоритизация
Это близко к модели «Orchestrator + Workers» из четырёх мультиагентных архитектур. Ценность Antigravity — продуктовая оркестрация и более низкий порог входа для собственного agent-фреймворка.
Если вы уже крутите OpenClaw или self-hosted Agent на облачном Mac, следите, откроет ли Antigravity self-hosted доступ — пока это в основном экосистема Google.
Апгрейд 6: мультимодальное понимание на уровне документов
Историческая сила Gemini — мультимодальность. 3.5 Pro усиливает рассуждение по изображениям и понимание на уровне документа — не просто OCR, а структурированный семантический разбор диаграмм, сканов и смешанных PDF.
Практические сценарии:
- Загрузить архитектурные схемы и блок-схемы в контекст для генерации кода
- Разобрать таблицы и рукописные пометки в отсканированных договорах
- Совместное рассуждение по ключевым кадрам видео и субтитрам (точный объём — по официальной model card)
Для iOS / macOS-разработчиков: в контекст Pro можно положить скриншоты Xcode, отчёты Instruments и макеты — модель поймёт и «как выглядит интерфейс», и «что говорят метрики производительности». Flash тоже умеет, но длинный контекст Pro позволяет одновременно держать «всю дизайн-спеку + все скриншоты + кодовую базу».
Апгрейд 7: точность извлечения в длинном контексте
«Вместить 2 млн токенов» и «точно извлечь нужное после загрузки» — разные вещи. Классическая болезнь ранних long-context моделей — lost in the middle: когда ключевая информация в середине контекста, качество ответов резко падает.
Google заявляет улучшенную точность извлечения по всему окну в 3.5 Pro — приближаясь к 2 млн токенов, качество должно оставаться пригодным. Если это подтвердится, это напрямую решает, стоит ли «заливать всё целиком» вместо блочного RAG.
Рекомендация: после GA протестируйте на своём корпусе — needle-in-a-haystack: заройте ключевой факт на 500 тыс., 1 млн и 1,5 млн токенов и проверьте извлечение. Не опирайтесь только на цифры с презентации.
Апгрейд 8: скачок в бенчмарках frontier-рассуждения
На I/O Google намекнул, что 3.5 Pro вернёт и превзойдёт frontier-уровень на сложных бенчмарках вроде ARC-AGI-2 и Humanity's Last Exam (HLE) — компенсируя компромисс Flash в пользу скорости на абстрактном рассуждении.
К середине июля 2026 официальные бенчмарки ещё не опубликованы полностью, у третьих сторон нет честных сравнений на одном harness. Поэтому:
- Вопрос «обгоняет ли рассуждение Claude Opus 4.8 / GPT-5.5» — пока видна лишь направленность, не вывод
- Стратегия Google больше похожа на лидерство по длине контекста, чем на лобовую битву с Anthropic во всех agentic coding рейтингах
При выборе спросите себя: узкое место — «мало рассуждает» или «не влезает контекст»? Для первого ждите бенчмарки; для второго у Pro уже есть чёткое отличие.
Апгрейд 9: новая архитектура, пересобранная с нуля
Легко упустить, но важно для долгосрочных пользователей: Gemini 3.5 Pro — не 3.1 Pro с большим числом параметров, а версия, переобученная Google DeepMind после неудовлетворительных внутренних тестов.
Практические последствия:
- Поведение может сильно отличаться от 3.1 Pro — существующие prompt-шаблоны и system prompts нужно перенастроить
- Отложенный GA ради гарантии качества — плюс для продакшена, но ранняя документация и цены нестабильны
- Частично общая agentic-инфраструктура с Flash — миграция Flash → Pro относительно лёгкая по toolchain
Апгрейд 10: открытый API и endpoint, совместимый с OpenAI
Pro будет доступен через несколько каналов:
| Канал | Статус (15.07.2026) | Примечания |
|---|---|---|
| Vertex AI | Корпоративное превью | Model ID: gemini-3.5-pro-preview-06, нужен allowlist |
| Google AI Studio | После GA | Для быстрых экспериментов соло-разработчиков |
| Gemini API (REST/SDK) | После GA | Официальные SDK Python / TypeScript |
| Endpoint, совместимый с OpenAI | Уже в AI Studio | Для миграции достаточно сменить base URL в существующем OpenAI SDK |
| Подписка Gemini Advanced | Ожидается с GA | Потребительский вход |
В сценариях длинного контекста Context Caching — ключевой рычаг стоимости: кэшированный ввод может быть ~на 90% дешевле обычного — удобно для «один большой контекст, много вопросов» (аудит репозитория, многоходовые юридические Q&A).
const cachedContent = await genAI.cacheContent({
model: "gemini-3.5-pro",
contents: [{ role: "user", parts: [{ text: largeContext }] }],
ttl: "3600s"
});
const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risks");
Pro vs Flash vs конкуренты: одна таблица
| Параметр | Gemini 3.5 Pro | Gemini 3.5 Flash | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| Контекст | 2 млн токенов | 1 млн токенов | 200 000 токенов | ~512 000 токенов |
| Глубокое рассуждение | Deep Think | Нет | Extended thinking | o-series |
| Цена входа (оценка) | $12–15 / M | $1.50 / M | ~$20 / M | ~$15 / M |
| Цена выхода (оценка) | $36–45 / M | $9 / M | ~$60 / M | ~$60 / M |
| Статус GA | В превью | GA | GA | GA |
| Лучший сценарий | Сверхдлинный контекст, анализ репозитория | Ежедневный высокий throughput | Agentic-кодинг | Структурированные многошаговые задачи |
Цены — оценка на этапе превью; после GA смотрите официальную страницу тарифов Google. Более полная стратегия маршрутизации моделей — в рейтинге OpenRouter Top10.
Как подключиться? Доступность и сроки
На 15 июля 2026:
- Публичный список моделей Gemini API по-прежнему в основном
gemini-3.5-flashиgemini-3.1-pro-preview— широкого GA для gemini-3.5-pro ещё нет - Несколько источников указывают на ~17 июля как целевую дату GA, но Google не опубликовал официальную model card и тарифы — используйте как ориентир для планирования, не как продакшен-обязательство
- Корпоративные пользователи могут запросить превью
gemini-3.5-pro-preview-06в Vertex AI
Для индивидуальных разработчиков сейчас:
- Гонять бизнес-логику и интеграцию инструментов на Flash
- Готовить prompts для Pro и модель бюджета (особенно Deep Think + длинный контекст)
- После GA сделать A/B: одна задача на Flash и Pro, решать маршрутизацию по реальному расходу токенов и качеству данных
Итог: кому ждать Pro, кому хватит Flash
Gemini 3.5 Pro — специализированный инструмент, не универсальная замена.
Командам, которым стоит ждать / приоритетно пробовать Pro:
- Юриспруденция, финансы, комплаенс — перекрёстный анализ длинных документов
- Аудит безопасности — весь код репозитория виден сразу
- Долгие агенты — состояние сессии на часы без частого сжатия контекста
- Сложное рассуждение — математика, архитектура, оптимизация с ограничениями; готовность платить задержкой и токенами за точность
Командам, которым Flash достаточно уже сейчас:
- Ежедневная помощь в коде, правка одного файла
- Высокопроизводительные API-пайплайны (поддержка, генерация контента, классификация)
- Q&A по базе знаний, покрываемой RAG
- Продакшен-пути, чувствительные к задержке
Из 10 апгрейдов реально меняют правила игры только две цифры: 2 млн токенов и Deep Think. Остальное (agentic-циклы, Antigravity, мультимодальность) Flash уже в большей части покрывает; Pro поднимает потолок. Сначала поймите, узкое место — «не влезает» или «недостаточно думает», и только потом решайте, платить ли за Pro.
Нужна среда сборки 24/7 для агентов?
Облачный Mac mini M4 на выделенном bare metal — для Xcode CI, self-hosted runner и постоянно работающих OpenClaw Agent — узлы Токио, Сингапур, Гонконг, оплата по дням
Читать дальше
Частые вопросы
Gemini 3.5 Pro или Gemini 3.5 Flash — как выбрать?
Для ежедневного диалога, высокого throughput и чувствительности к цене — Flash. Для полного контекста в 2 млн токенов, Deep Think и сложных agentic-циклов исследования — Pro. Цена Pro примерно в 8–10 раз выше Flash.
Можно ли уже использовать Gemini 3.5 Pro?
К середине июля 2026 Pro остаётся в корпоративном превью Vertex AI. Публичный Gemini API в основном предлагает gemini-3.5-flash и gemini-3.1-pro. Широкий GA ожидается во второй половине июля — сверяйтесь с официальной документацией Google.
Насколько дороже режим Deep Think?
Токены рассуждения входят в бюджет контекста и тарифицируются по ставке выхода. Сложная задача может съесть много токенов до финального ответа — включайте Deep Think только для трудных кейсов (математические доказательства, архитектурные решения).
Для чего подходит контекст в 2 млн токенов?
Аудит всего репозитория, перекрёстное сравнение юридических и нормативных документов, удержание состояния долгих агентов. Для правки одного файла или задач, закрываемых RAG, Flash + блочный поиск обычно быстрее и дешевле.
Можно ли вызывать Gemini 3.5 Pro через существующий OpenAI SDK?
Да. Google AI Studio предоставляет endpoint, совместимый с OpenAI; большинству существующих кодов на OpenAI SDK достаточно сменить base URL и имя модели.