В 2025–2026 заголовки tech-новостей повторяются: OpenAI и Microsoft объявляют Stargate, Meta докупает GPU на миллиарды, xAI строит в Мемфисе «крупнейший в мире кластер для обучения ИИ», суверенные фонды Саудовской Аравии и ОАЭ входят в дата-центры…
Типичная реакция: «Модели уже сильные — зачем снова скупать чипы?»
Ответ спрятан в ChatGPT. Вы отправляете сообщение, ждёте несколько секунд, получаете плавный ответ — кажется лёгким, а за кулисами круглосуточно работают тысячи GPU. Вычисления — не разовый CapEx, а постоянный операционный ресурс, как электричество. Кто больше запасает, эффективнее использует и дешевле доставляет — тот держит инициативу в следующем цикле ИИ.
Эта статья простым языком разбирает три вещи: сколько вычислений съедает один диалог ChatGPT, почему гиганты запасают чипы и что это значит для основателей и разработчиков. Стратегический разбор — в войне инфраструктуры вычислений ИИ; бюджет первого года — в стоимости серверов в первый год AI-стартапа.
Один диалог ChatGPT — что происходит внутри
Большая языковая модель — «вероятностная печатная машинка»: для каждого токена (примерно полслова — слово) она предсказывает следующий наиболее вероятный токен, пока не появится маркер конца. Это авторегрессивный инференс.
Простой вопрос-ответ обычно проходит так:
- Маршрутизация: сообщение через балансировщик попадает на сервер инференса и конкретный GPU.
- Prefill (предзаполнение): весь ввод (системный prompt, история, результаты RAG) один раз проходит через модель — строится KV Cache; вычислительно тяжёлая фаза.
- Decode (декодирование): на каждый сгенерированный токен читается весь KV Cache и выполняется forward pass — нагрузка на пропускную способность памяти.
- Постобработка: фильтры безопасности, форматирование, стриминг клиенту.
Грубые порядки величин (зависят от модели, контекста, мультимодальности — только для интуиции):
| Сценарий | Токены ввод + вывод | Профиль нагрузки | Аналогия |
|---|---|---|---|
| Короткий Q&A | ~500 ввод + 200 вывод | Миллисекунды, одна карта справляется | Спичка |
| Резюме длинного документа | ~80 000 ввод + 2 000 вывод | Тяжёлый prefill, KV Cache заполняет VRAM | Целая свеча |
| Agent с множеством tool calls | 10+ раундов, сотни тысяч токенов суммарно | Повторные prefill + длинный контекст | Постоянное отопление |
| Глобальный пик нагрузки | Миллионы токенов в секунду | Кластер + очереди | Электропотребление города |
«Магия» ChatGPT — это сжатие огромного объёма вычислений в несколько секунд ожидания; эти секунды — тысячи H100 / B200, работающих параллельно.
Поэтому Сэм Альтман не раз говорит о нехватке вычислений: не потому что модели нет, а потому что рост пользователей опережает поставку GPU. Очереди в пик, rate limit и замедление — это дефицит предложения.
Обучение — разовое вооружение, инференс — ежедневные патроны
Часто путают «обучить большую модель» и «запустить ChatGPT». Экономика принципиально разная:
| Измерение | Обучение (Training) | Инференс (Inference) |
|---|---|---|
| Частота | Крупная версия раз в несколько месяцев, циклично | Миллионы запросов в секунду, 24/7 |
| Форма затрат | Огромный CapEx: миллионы — миллиарды GPU-часов разом | Огромный OpEx: непрерывное сгорание по токену / GPU-часу |
| Техническая цель | Пропускная способность: быстрее пройти epoch | Задержка + стоимость: каждый токен дешевле и быстрее |
| Предпочтение по чипам | Кластер с высокой межсоединительной полосой (NVLink, InfiniBand) | Карты под инференс, квантование, batch-scheduling |
| Метафора | Построить нефтеперерабатывающий завод | Ежедневно снабжать город топливом |
Пре-тренинг уровня GPT-4, по оценкам отрасли, съедает десятки — сотни тысяч GPU-месяцев эквивалента A100/H100. Но после обучения счёт взрывается из-за ежедневных диалогов сотен миллионов пользователей по всему миру.
Распространённое правило: стоимость инференса растёт линейно (часто сверхлинейно) с числом пользователей; стоимость обучения относительно фиксирована. С конца 2022 по 2026 аудитория ChatGPT выросла на порядки — закупка GPU сместилась от «сделать модель» к «держать её живой для всех».
Зачем запасать чипы? Четыре правила
Правило 1: предложение жёсткое, спрос экспоненциальный
Топовые GPU NVIDIA (H100, H200, B200) упираются в CoWoS TSMC, поставки HBM и тестовые мощности. Даже на полной загрузке мировой спрос превышает предложение. Кто заказал раньше — получил раньше; полгода задержки могут добавить год ожидания. OpenAI, Microsoft, Meta и Google борются не за «есть ли GPU», а за «сколько поставят в Q3 2026».
Правило 2: свои вычисления = контроль затрат + независимость
Чистая аренда облачных GPU в фазе взрыва даёт три проблемы:
- Цена плавает: spot в пиках может вырасти в разы;
- Квоты непредсказуемы: облака приоритизируют свои модели и партнёров;
- Данные и compliance: enterprise требует данные в стране, без общей физической машины.
Многолетние контракты на GPU, инвестиции в ЦОД и собственные чипы (Google TPU, Amazon Trainium) превращают переменные затраты в предсказуемые фиксированные и фиксируют приоритет в цепочке поставок.
Правило 3: вычисления = пользовательский опыт
Пользователь не видит H100 vs TPU v6, но чувствует:
- плавный стриминг ответа (time-to-first-token);
- прочитан ли длинный документ (окно контекста, KV Cache);
- есть ли очередь в пик (размер кластера);
- выдержит ли agent 20 шагов (многораундовый инференс без обрыва).
В 2026 разрыв моделей сужается, но разрыв в опыте растёт — почти всегда из-за распределения вычислений. См. способность доставлять вычисления.
Правило 4: геополитика и «суверенитет вычислений»
Продвинутые AI-чипы под экспортным контролем; государства считают вычисления стратегическим ресурсом. Саудовская Аравия, ОАЭ, Франция, Япония строят локальные хабы — какой API можно использовать, зависит от того, где разрешены данные, а это требует локальных GPU.
Карта войны за вычисления: кто что покупает
В 2026 картина сводится к четырём типам игроков:
| Игрок | Стратегия | Типичные шаги |
|---|---|---|
| OpenAI + Microsoft | Привязка к облаку + гипермасштабный собственный строй | Stargate (многолетние инвестиции в ЦОД на сотни миллиардов), эксклюзивный хостинг инференса в Azure, расширение с Oracle и др. |
| Полный стек: TPU + ЦОД + Gemini | Каждое поколение TPU синхронно с Gemini; не всё на NVIDIA | |
| Meta | Open source + огромные запасы GPU | Llama снижает порог для отрасли, но лента и AI-ассистент всё равно жрут вычисления |
| Anthropic / xAI и др. | Мультиоблако + точечный собственный строй | AWS / Google; кластер xAI в Мемфисе для рывка в обучении |
Облака (AWS, Azure, GCP) — уже не просто «арендодатели GPU»: через инвестиции в модельные компании, экосистему чипов и enterprise-контракты они становятся «слой ОС» эры ИИ. Кто контролирует вход вычислений — контролирует поток токенов.
На поверхности покупают чипы; по сути — способность надёжно доставлять AI-сервисы следующие десять лет.
За пределами GPU: электричество, ЦОД и сеть
В заголовках — «ещё 100 000 GPU»; внутри отрасли чаще беспокоят:
- Электричество: кластер на 10 000 карт потребляет 15–20 МВт — как десятки тысяч домохозяйств. В США некоторые площадки ждут подключения к сети 2–4 года.
- Охлаждение: жидкостное охлаждение стало обязательным; плотность мощности на стойку превышает классическое воздушное.
- Сеть: обучение требует терабайтной связи между GPU (NVLink, InfiniBand); инференс — глобальную маршрутизацию с низкой задержкой.
- Земля и разрешения: экология, шум, вода задерживают проекты.
OpenAI и атомная энергетика, Microsoft и Three Mile Island, Google и морская вода в Финляндии — GPU — видимый фронт, электричество и земля — скрытое узкое место. Чипы есть, тока нет — кластер не запустится.
Монополия NVIDIA и маршрут «второго чипа»
На 2026 NVIDIA по-прежнему доминирует в обучении ИИ не только чипами, но и CUDA + cuDNN + TensorRT и всем стеком. Миграция на AMD MI300 или свой чип — дорого в инженерии.
Гиганты не ставят всё на одну компанию:
- Google TPU: собственный ASIC, TensorFlow / JAX, силён на крупном обучении;
- Amazon Trainium / Inferentia: цена для клиентов AWS;
- Microsoft Maia: первый собственный AI-ускоритель для инференса в Azure;
- AMD, Intel Gaudi: инференс и цена/производительность.
Для большинства стартапов краткосрочно нет варианта «уйти с NVIDIA» — API OpenAI / Anthropic или облачные GPU. Свой чип — игра триллионных капитализаций.
Что это значит для основателей и разработчиков
Не нужно играть на уровне Stargate, но три цепочки передачи важно понимать:
1. Цены API будут конкурировать — но не «бесплатный обед»
Вендоры моделей балансируют стоимость инференса и долю рынка: снижение цены → взрыв usage → дефицит вычислений → лимиты или структурное подорожание. Командам на API нужно закладывать стоимость токена в unit economics — см. разбор счёта эпохи Agent.
2. «Слои вычислений» реалистичнее «запасания вычислений»
Разные нагрузки — на разные уровни:
- Крупное обучение / полный fine-tuning → облачный GPU-кластер;
- Ежедневный инференс → API модели или managed inference;
- iOS/macOS CI, подпись, TestFlight → выделенные macOS-узлы (другой счёт, не GPU-война);
- Agent 24/7, лёгкие локальные модели → always-on Apple Silicon.
Обучать LLM на Mac, собирать Xcode на H100 — оба случая неверный слой.
3. На этапе первых 100 пользователей проблема вычислений «деформируется»
Маленькие команды редко покупают GPU, но сталкиваются с той же логикой дефицита в счёте API, очередях CI и узлах agent. См. AI-продукт: первые 100 пользователей (затраты и инфраструктура).
FAQ
В1: Сколько стоит H100 и почему её не купить?
Каталожная цена ~25 000–30 000 USD; в дефиците 2024–2026 на вторичном рынке наценка 1,5–2×. Microsoft, Meta и др. блокируют мощности рамочными контрактами — рознице и МСБ сложно получить поставку сразу.
В2: Покрывает ли ChatGPT Plus стоимость инференса?
При интенсивном использовании, длинном контексте и модели уровня GPT-4 один подписчик Plus (~20 $/мес) может стоить дороже в инференсе. OpenAI субсидирует через free→paid, маржу enterprise API и масштаб — это не простое «деление GPU-часа».
В3: Снижает ли open source влияние войны за чипы?
Open source убирает барьер «есть модель» (Meta Llama), но не «сколько GPU нужно, чтобы её запустить». Self-hosted Llama 70B всё равно требует несколько топовых карт; для большинства команд API остаётся оптимальным.
В4: Нужно ли это одиночному разработчику?
Если только API: достаточно цен, лимитов, SLA по задержке. AI-native продукт, agents или вертикальная модель — вычисления попадают в маржу, это обязательно.
В5: Есть ли место Apple Silicon?
Mac / Mac mini не участвуют в триллионном рынке обучения NVIDIA, но сильны в локальном инференсе, CI, выполнении agent, MCP-шлюзе. См. развёртывание MCP cloud Mac.
В6: Когда закончится война за вычисления?
Краткосрочно — никогда. Пока растут пользователи и автоматизация agent, инференс съедает новую мощность. Долгосрочно алгоритмы (MoE, квантование, speculative decoding) и специализированные чипы снижают цену токена — но общий объём растёт, как при падении цены кВт·ч при росте потребления.
Заключение: модель — витрина, вычисления — суть
Возвращаясь к вопросу: почему AI-компании лихорадочно покупают чипы?
ChatGPT доказал: большие модели — не лабораторная статья, а массовый потребительский продукт. Масса требует вычислений, вычисления — чипов, электричества, ЦОД и капитала на десятилетие.
В 2023 сравнивали «чья модель умнее»; в 2026 — «кто стабильнее и дешевле доставляет токены». Миллиардные заказы, атомные сделки и суверенные фонды — фронты одной войны.
Вычисления не видны — но каждый плавный ответ ИИ это сводка с линии фронта.
Гиганты борются за GPU — разработчики за предсказуемые вычисления
Война не только в дата-центрах. Команды с iOS-клиентами, macOS-agent или MCP-цепочками знают ту же логику по очередям сборки, подписи и узлам 24/7 — второй счёт за вычисления рядом с API-токенами.
Nuvcloud предлагает выделенные M4 Mac mini для CI/CD, удалённой разработки и always-on agents.Цены, или статьи война инфраструктуры вычислений и модель затрат первого года.