← Назад к блогу

Почему AI-компании скупают чипы? Война вычислений за ChatGPT

Кластер GPU в дата-центре: главное поле войны за AI-вычисления
За каждым диалогом ChatGPT работает вся цепочка поставок — от чипов до дата-центров.

В 2025–2026 заголовки tech-новостей повторяются: OpenAI и Microsoft объявляют Stargate, Meta докупает GPU на миллиарды, xAI строит в Мемфисе «крупнейший в мире кластер для обучения ИИ», суверенные фонды Саудовской Аравии и ОАЭ входят в дата-центры…

Типичная реакция: «Модели уже сильные — зачем снова скупать чипы?»

Ответ спрятан в ChatGPT. Вы отправляете сообщение, ждёте несколько секунд, получаете плавный ответ — кажется лёгким, а за кулисами круглосуточно работают тысячи GPU. Вычисления — не разовый CapEx, а постоянный операционный ресурс, как электричество. Кто больше запасает, эффективнее использует и дешевле доставляет — тот держит инициативу в следующем цикле ИИ.

Эта статья простым языком разбирает три вещи: сколько вычислений съедает один диалог ChatGPT, почему гиганты запасают чипы и что это значит для основателей и разработчиков. Стратегический разбор — в войне инфраструктуры вычислений ИИ; бюджет первого года — в стоимости серверов в первый год AI-стартапа.

Один диалог ChatGPT — что происходит внутри

Большая языковая модель — «вероятностная печатная машинка»: для каждого токена (примерно полслова — слово) она предсказывает следующий наиболее вероятный токен, пока не появится маркер конца. Это авторегрессивный инференс.

Простой вопрос-ответ обычно проходит так:

  1. Маршрутизация: сообщение через балансировщик попадает на сервер инференса и конкретный GPU.
  2. Prefill (предзаполнение): весь ввод (системный prompt, история, результаты RAG) один раз проходит через модель — строится KV Cache; вычислительно тяжёлая фаза.
  3. Decode (декодирование): на каждый сгенерированный токен читается весь KV Cache и выполняется forward pass — нагрузка на пропускную способность памяти.
  4. Постобработка: фильтры безопасности, форматирование, стриминг клиенту.

Грубые порядки величин (зависят от модели, контекста, мультимодальности — только для интуиции):

СценарийТокены ввод + выводПрофиль нагрузкиАналогия
Короткий Q&A~500 ввод + 200 выводМиллисекунды, одна карта справляетсяСпичка
Резюме длинного документа~80 000 ввод + 2 000 выводТяжёлый prefill, KV Cache заполняет VRAMЦелая свеча
Agent с множеством tool calls10+ раундов, сотни тысяч токенов суммарноПовторные prefill + длинный контекстПостоянное отопление
Глобальный пик нагрузкиМиллионы токенов в секундуКластер + очередиЭлектропотребление города

«Магия» ChatGPT — это сжатие огромного объёма вычислений в несколько секунд ожидания; эти секунды — тысячи H100 / B200, работающих параллельно.

Поэтому Сэм Альтман не раз говорит о нехватке вычислений: не потому что модели нет, а потому что рост пользователей опережает поставку GPU. Очереди в пик, rate limit и замедление — это дефицит предложения.

Обучение — разовое вооружение, инференс — ежедневные патроны

Часто путают «обучить большую модель» и «запустить ChatGPT». Экономика принципиально разная:

ИзмерениеОбучение (Training)Инференс (Inference)
ЧастотаКрупная версия раз в несколько месяцев, цикличноМиллионы запросов в секунду, 24/7
Форма затратОгромный CapEx: миллионы — миллиарды GPU-часов разомОгромный OpEx: непрерывное сгорание по токену / GPU-часу
Техническая цельПропускная способность: быстрее пройти epochЗадержка + стоимость: каждый токен дешевле и быстрее
Предпочтение по чипамКластер с высокой межсоединительной полосой (NVLink, InfiniBand)Карты под инференс, квантование, batch-scheduling
МетафораПостроить нефтеперерабатывающий заводЕжедневно снабжать город топливом

Пре-тренинг уровня GPT-4, по оценкам отрасли, съедает десятки — сотни тысяч GPU-месяцев эквивалента A100/H100. Но после обучения счёт взрывается из-за ежедневных диалогов сотен миллионов пользователей по всему миру.

Распространённое правило: стоимость инференса растёт линейно (часто сверхлинейно) с числом пользователей; стоимость обучения относительно фиксирована. С конца 2022 по 2026 аудитория ChatGPT выросла на порядки — закупка GPU сместилась от «сделать модель» к «держать её живой для всех».

Коротко: обучение решает «есть ли ChatGPT»; инференс — «можно ли им пользоваться, сколько стоит, насколько быстро». Главное поле боя сместилось из зала обучения в флот инференса.

Зачем запасать чипы? Четыре правила

Правило 1: предложение жёсткое, спрос экспоненциальный

Топовые GPU NVIDIA (H100, H200, B200) упираются в CoWoS TSMC, поставки HBM и тестовые мощности. Даже на полной загрузке мировой спрос превышает предложение. Кто заказал раньше — получил раньше; полгода задержки могут добавить год ожидания. OpenAI, Microsoft, Meta и Google борются не за «есть ли GPU», а за «сколько поставят в Q3 2026».

Правило 2: свои вычисления = контроль затрат + независимость

Чистая аренда облачных GPU в фазе взрыва даёт три проблемы:

  • Цена плавает: spot в пиках может вырасти в разы;
  • Квоты непредсказуемы: облака приоритизируют свои модели и партнёров;
  • Данные и compliance: enterprise требует данные в стране, без общей физической машины.

Многолетние контракты на GPU, инвестиции в ЦОД и собственные чипы (Google TPU, Amazon Trainium) превращают переменные затраты в предсказуемые фиксированные и фиксируют приоритет в цепочке поставок.

Правило 3: вычисления = пользовательский опыт

Пользователь не видит H100 vs TPU v6, но чувствует:

  • плавный стриминг ответа (time-to-first-token);
  • прочитан ли длинный документ (окно контекста, KV Cache);
  • есть ли очередь в пик (размер кластера);
  • выдержит ли agent 20 шагов (многораундовый инференс без обрыва).

В 2026 разрыв моделей сужается, но разрыв в опыте растёт — почти всегда из-за распределения вычислений. См. способность доставлять вычисления.

Правило 4: геополитика и «суверенитет вычислений»

Продвинутые AI-чипы под экспортным контролем; государства считают вычисления стратегическим ресурсом. Саудовская Аравия, ОАЭ, Франция, Япония строят локальные хабы — какой API можно использовать, зависит от того, где разрешены данные, а это требует локальных GPU.

Карта войны за вычисления: кто что покупает

В 2026 картина сводится к четырём типам игроков:

ИгрокСтратегияТипичные шаги
OpenAI + MicrosoftПривязка к облаку + гипермасштабный собственный стройStargate (многолетние инвестиции в ЦОД на сотни миллиардов), эксклюзивный хостинг инференса в Azure, расширение с Oracle и др.
GoogleПолный стек: TPU + ЦОД + GeminiКаждое поколение TPU синхронно с Gemini; не всё на NVIDIA
MetaOpen source + огромные запасы GPULlama снижает порог для отрасли, но лента и AI-ассистент всё равно жрут вычисления
Anthropic / xAI и др.Мультиоблако + точечный собственный стройAWS / Google; кластер xAI в Мемфисе для рывка в обучении

Облака (AWS, Azure, GCP) — уже не просто «арендодатели GPU»: через инвестиции в модельные компании, экосистему чипов и enterprise-контракты они становятся «слой ОС» эры ИИ. Кто контролирует вход вычислений — контролирует поток токенов.

На поверхности покупают чипы; по сути — способность надёжно доставлять AI-сервисы следующие десять лет.

За пределами GPU: электричество, ЦОД и сеть

В заголовках — «ещё 100 000 GPU»; внутри отрасли чаще беспокоят:

  • Электричество: кластер на 10 000 карт потребляет 15–20 МВт — как десятки тысяч домохозяйств. В США некоторые площадки ждут подключения к сети 2–4 года.
  • Охлаждение: жидкостное охлаждение стало обязательным; плотность мощности на стойку превышает классическое воздушное.
  • Сеть: обучение требует терабайтной связи между GPU (NVLink, InfiniBand); инференс — глобальную маршрутизацию с низкой задержкой.
  • Земля и разрешения: экология, шум, вода задерживают проекты.

OpenAI и атомная энергетика, Microsoft и Three Mile Island, Google и морская вода в Финляндии — GPU — видимый фронт, электричество и земля — скрытое узкое место. Чипы есть, тока нет — кластер не запустится.

Монополия NVIDIA и маршрут «второго чипа»

На 2026 NVIDIA по-прежнему доминирует в обучении ИИ не только чипами, но и CUDA + cuDNN + TensorRT и всем стеком. Миграция на AMD MI300 или свой чип — дорого в инженерии.

Гиганты не ставят всё на одну компанию:

  • Google TPU: собственный ASIC, TensorFlow / JAX, силён на крупном обучении;
  • Amazon Trainium / Inferentia: цена для клиентов AWS;
  • Microsoft Maia: первый собственный AI-ускоритель для инференса в Azure;
  • AMD, Intel Gaudi: инференс и цена/производительность.

Для большинства стартапов краткосрочно нет варианта «уйти с NVIDIA» — API OpenAI / Anthropic или облачные GPU. Свой чип — игра триллионных капитализаций.

Что это значит для основателей и разработчиков

Не нужно играть на уровне Stargate, но три цепочки передачи важно понимать:

1. Цены API будут конкурировать — но не «бесплатный обед»

Вендоры моделей балансируют стоимость инференса и долю рынка: снижение цены → взрыв usage → дефицит вычислений → лимиты или структурное подорожание. Командам на API нужно закладывать стоимость токена в unit economics — см. разбор счёта эпохи Agent.

2. «Слои вычислений» реалистичнее «запасания вычислений»

Разные нагрузки — на разные уровни:

  • Крупное обучение / полный fine-tuning → облачный GPU-кластер;
  • Ежедневный инференс → API модели или managed inference;
  • iOS/macOS CI, подпись, TestFlight → выделенные macOS-узлы (другой счёт, не GPU-война);
  • Agent 24/7, лёгкие локальные модели → always-on Apple Silicon.

Обучать LLM на Mac, собирать Xcode на H100 — оба случая неверный слой.

3. На этапе первых 100 пользователей проблема вычислений «деформируется»

Маленькие команды редко покупают GPU, но сталкиваются с той же логикой дефицита в счёте API, очередях CI и узлах agent. См. AI-продукт: первые 100 пользователей (затраты и инфраструктура).

FAQ

В1: Сколько стоит H100 и почему её не купить?
Каталожная цена ~25 000–30 000 USD; в дефиците 2024–2026 на вторичном рынке наценка 1,5–2×. Microsoft, Meta и др. блокируют мощности рамочными контрактами — рознице и МСБ сложно получить поставку сразу.

В2: Покрывает ли ChatGPT Plus стоимость инференса?
При интенсивном использовании, длинном контексте и модели уровня GPT-4 один подписчик Plus (~20 $/мес) может стоить дороже в инференсе. OpenAI субсидирует через free→paid, маржу enterprise API и масштаб — это не простое «деление GPU-часа».

В3: Снижает ли open source влияние войны за чипы?
Open source убирает барьер «есть модель» (Meta Llama), но не «сколько GPU нужно, чтобы её запустить». Self-hosted Llama 70B всё равно требует несколько топовых карт; для большинства команд API остаётся оптимальным.

В4: Нужно ли это одиночному разработчику?
Если только API: достаточно цен, лимитов, SLA по задержке. AI-native продукт, agents или вертикальная модель — вычисления попадают в маржу, это обязательно.

В5: Есть ли место Apple Silicon?
Mac / Mac mini не участвуют в триллионном рынке обучения NVIDIA, но сильны в локальном инференсе, CI, выполнении agent, MCP-шлюзе. См. развёртывание MCP cloud Mac.

В6: Когда закончится война за вычисления?
Краткосрочно — никогда. Пока растут пользователи и автоматизация agent, инференс съедает новую мощность. Долгосрочно алгоритмы (MoE, квантование, speculative decoding) и специализированные чипы снижают цену токена — но общий объём растёт, как при падении цены кВт·ч при росте потребления.

Заключение: модель — витрина, вычисления — суть

Возвращаясь к вопросу: почему AI-компании лихорадочно покупают чипы?

ChatGPT доказал: большие модели — не лабораторная статья, а массовый потребительский продукт. Масса требует вычислений, вычисления — чипов, электричества, ЦОД и капитала на десятилетие.

В 2023 сравнивали «чья модель умнее»; в 2026 — «кто стабильнее и дешевле доставляет токены». Миллиардные заказы, атомные сделки и суверенные фонды — фронты одной войны.

Вычисления не видны — но каждый плавный ответ ИИ это сводка с линии фронта.

Гиганты борются за GPU — разработчики за предсказуемые вычисления

Война не только в дата-центрах. Команды с iOS-клиентами, macOS-agent или MCP-цепочками знают ту же логику по очередям сборки, подписи и узлам 24/7 — второй счёт за вычисления рядом с API-токенами.

Nuvcloud предлагает выделенные M4 Mac mini для CI/CD, удалённой разработки и always-on agents.Цены, или статьи война инфраструктуры вычислений и модель затрат первого года.

LIMITEDАкция