2026년 5월 Google I/O에서 Sundar Pichai는 Gemini 3.5 Flash(이미 GA)와 Gemini 3.5 Pro(플래그십 프리뷰)를 동시에 공개했습니다. Pro는 Flash를 단순히 키운 버전이 아닙니다——Google은 점진적 개선 대신 처음부터 재설계했고, 목표는 현재 최고급 모델이 가장 어려워하는 세 가지입니다: 초장문 컨텍스트, 깊은 추론, 다단계 Agent 오케스트레이션. 이 글은 개발자 관점에서 10가지 능력 업그레이드를 풀고, Flash·Claude·GPT와의 선택 기준을 정리합니다.
먼저 알아둘 것: Pro가 Gemini 3.5 라인업에서 어디에 서나
Google은 I/O 2026에서 이중 트랙 출시 전략을 택했습니다:
- Gemini 3.5 Flash: 5월 즉시 GA, Google AI Mode 기본 모델. 속도·비용·생태계 커버리지가 핵심.
- Gemini 3.5 Pro: 같은 무대에서 공개됐지만 넓은 공개는 늦춤. 시리즈 내 최고 성능, 복잡한 추론·전체 저장소 분석·장시간 Agent 작업용.
주목할 점: 여러 보도에 따르면 Google은 Pro 출시 전 처음부터 다시 시작했습니다——내부 테스트 버전이 기대 추론 품질에 미치지 못해, 서두르지 않고 재구축을 선택한 것입니다. Flash는 이미 두 달 가까이 쓸 수 있는데 Pro GA가 계속 미뤄진 이유(원래 6월 말 목표, 7월 중순 기준 Vertex AI 기업 프리뷰)도 여기서 설명됩니다.
개발자 입장: Flash는 오늘의 기본값; Pro는 컨텍스트와 추론이 모두 한계에 닿을 때 쓰는 특수 무기이지, 전면 대체가 아닙니다.
업그레이드 1: 200만 token 컨텍스트 윈도우
Gemini 3.5 Pro에서 가장 눈에 띄는 숫자: 200만 token. Flash(100만)의 두 배이며, 현재 주류 최전선 모델 중 가장 큰 프로덕션급 컨텍스트입니다.
| 비교 대상 | 최대 컨텍스트 | Pro 대비 |
|---|---|---|
| Gemini 3.5 Pro | 200만 token | — |
| Gemini 3.5 Flash | 100만 token | 절반 |
| GPT-5.x 확장 티어 | 약 51.2만 token | 약 1/4 |
| Claude Opus 4.x | 20만 token | 약 1/10 |
200만 token이면 대략 무엇을 담을 수 있을까요?
- 중형 TypeScript monorepo(약 2000개 파일, 파일당 200줄)
- 30인 팀 3년치 Slack 내보내기 기록
- SEC S-1 공시 4부를 동시에 컨텍스트에 넣기
- 민사 소송 전체 기록(소장, 증언, 증거, 재판 기록)
핵심 판단: 컨텍스트에 담을 수 있다 ≠ 전량 넣을 가치가 있다. 200만 token을 로드하면 prefill 지연과 입력 비용이 크게 늘어납니다. 답이 자료 한 조각에만 있다면 RAG + Flash가 더 경제적일 때가 많습니다. Pro의 컨텍스트 강점은 파일 간 관계를 동시에 봐야 하는 경우——전체 저장소 보안 감사, 여러 계약 조항 교차 비교, Agent가 컨텍스트 인수인계를 피하고 싶을 때——에 드러납니다.
업그레이드 2: Deep Think 심층 추론 모드
Deep Think는 Google이 「확장 추론 시 계산」(extended inference-time compute)에 붙인 제품명입니다. 모델은 최종 답을 내기 전 더 많은 추론 사이클로 중간 유도와 자기 교정을 하며, 빠른 패턴 매칭만 하지 않습니다.
API의 thinkingConfig 파라미터로 제어하며, 네 단계가 있습니다:
| thinkingLevel | 적합한 상황 | 지연 영향 |
|---|---|---|
minimal | 단순 질의, 빠른 응답 | 최소 |
low | 표준 완성 | 낮음 |
medium | 다단계 추론 | 중간 |
high | 수학 증명, 아키텍처 결정, 다중 제약 최적화 | 최대 |
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI(process.env.GEMINI_API_KEY);
const model = genAI.getGenerativeModel({
model: "gemini-3.5-pro",
generationConfig: {
thinkingConfig: { thinkingLevel: "high" }
}
});
비용 주의: 추론 token은 컨텍스트 예산에 포함되며 출력 token 요금으로 청구됩니다. 중간 유도가 긴 난제는 최종 답 전에 상당한 token을 쓸 수 있습니다. Deep Think는 「어려운 문제 스위치」이지 기본 모드가 아닙니다.
Flash는 Deep Think를 지원하지 않습니다——Pro 전용 기능 중 하나입니다.
업그레이드 3: 다단계 Agentic 리서치 루프
Gemini 3.1 Pro 대비 3.5 세대는 Agentic 능력에서 뚜렷한 세대 점프가 있습니다. Pro는 네이티브로 다단계 리서치 루프를 지원합니다: 모델이 검색 경로를 스스로 계획하고 여러 정보원을 순회한 뒤 내부에서 종합해 답을 내지, 「한 번 검색·한 번 답변」 단일 라운드가 아닙니다.
영향이 직접적인 시나리오:
- 경쟁사·시장 분석: 여러 재무제표, 보도자료, 제품 문서 교차 비교
- 기술 스택 조사: 공식 문서, GitHub Issue, 커뮤니티 논의를 동시에 탐색
- 컴플라이언스 검토: 긴 정책 라이브러리에서 충돌 조항 찾기
Google AI Mode 「심층 리서치」를 이미 쓰고 있다면, Pro 기반 버전은 이론상 더 복잡하고 긴 조사 체인을 처리할 수 있습니다——다만 실제 체감은 넓은 GA 이후 직접 검증이 필요합니다.
업그레이드 4: 자율 워크플로와 도구 체인 오케스트레이션
I/O 발표와 서드파티 개발자 보고에 따르면 Gemini 3.5 Pro는 Flash의 Agentic 아키텍처를 이어받아 도구 호출 체인을 더 강화했습니다: 「코드 읽기 → 테스트 실행 → 버그 수정 → 재테스트」 같은 다단계 작업을 사용자 확인 없이 자율 워크플로로 이어 붙일 수 있습니다.
MCP 도구 프로토콜과 결합하면 Pro는 이론상:
- MCP로 사용 가능한 도구(filesystem, GitHub, DB 등) 탐색
- 작업 복잡도에 따라 호출 순서를 스스로 결정
- 200만 token 윈도우 안에서 장시간 작업 상태 유지
1인·소규모 팀에게는 더 많은 「접착 로직」을 모델에 맡기고 사람은 최종 결과만 검토하면 됩니다. 프로덕션에서는 권한 경계와 사람 체크포인트를 두는 것이 좋습니다——자율 ≠ 무인 운영.
업그레이드 5: Google Antigravity 멀티 Agent 협업
Gemini 3.5 시리즈는 Google이 같은 시기 공개한 Antigravity 개발 플랫폼과 깊게 연동됩니다. Antigravity는 Pro에 병렬 sub Agent를 배치할 수 있게 합니다: 서로 다른 하위 작업을 독립 Agent가 동시에 진행하고, 메인 Agent가 조율·결과 병합을 담당합니다.
전형적인 워크플로:
- sub Agent A: 보안 취약점 스캔
- sub Agent B: 의존성 버전 만료 확인
- sub Agent C: 수정 PR 초안 생성
- 메인 Agent: 보고서 종합 및 우선순위 정렬
이는 멀티 Agent 네 가지 아키텍처의 「Orchestrator + Workers」 패턴과 잘 맞습니다. Antigravity의 가치는 오케스트레이션 계층을 제품화해 자체 Agent 프레임워크 구축 문턱을 낮추는 데 있습니다.
클라우드 Mac에서 OpenClaw나 셀프호스트 Agent를 돌리고 있다면, Antigravity의 셀프호스트 연동 개방 여부를 지켜볼 만합니다——현재는 Google 생태계 내부가 중심입니다.
업그레이드 6: 전 모달리티 문서 수준 이해
Gemini 시리즈의 강점은 멀티모달입니다. 3.5 Pro는 이미지 추론과 문서 수준 이해를 강화했습니다——OCR로 글자만 뽑는 수준이 아니라 차트, 스캔본, 혼합 PDF를 구조화된 의미 분석으로 다룹니다.
실무 활용:
- 아키텍처·플로우 다이어그램을 컨텍스트에 넣고 코드 생성
- 스캔 계약서의 표와 손글씨 주석 분석
- 영상 핵심 프레임 + 자막 연합 추론(지원 범위는 공식 model card 기준)
iOS / macOS 개발자라면 Xcode 스크린샷, Instruments 리포트, 디자인 시안을 Pro 컨텍스트에 함께 넣어 「화면이 어떻게 생겼는지」와 「성능 데이터가 무엇을 말하는지」를 교차 이해시킬 수 있습니다——Flash에서도 가능하지만, Pro의 장문 컨텍스트 덕분에 「전체 디자인 스펙 + 모든 스크린샷 + 코드베이스」를 동시에 보는 것이 현실적입니다.
업그레이드 7: 장문 컨텍스트 검색 정확도 향상
「200만 token을 담을 수 있다」와 「담은 뒤에도 정확히 찾아낸다」는 다른 문제입니다. 초기 장문 모델의 고질병은 중간 망각(lost in the middle)——핵심 정보가 컨텍스트 중간에 묻히면 답 품질이 급락합니다.
Google은 3.5 Pro에서 전 윈도우 검색 정확도를 개선했다고 주장하며, 200만 token에 가까워도 쓸 만한 recall을 유지하려 합니다. 사실이라면 Pro를 「전량 주입」할지, 청크 RAG로 나눌지를 가르는 핵심이 됩니다.
권장: GA 후 자사 업무 코퍼스로 needle-in-a-haystack 테스트——50만·100만·150만 token 지점에 각각 핵심 사실을 묻고 모델이 정확히 꺼내는지 확인. 발표회 숫자만 믿지 마세요.
업그레이드 8: 최전선 추론 벤치마크 도약
Google은 I/O에서 3.5 Pro가 ARC-AGI-2, Humanity's Last Exam(HLE) 같은 고난도 추론 벤치에서 최전선을 회복·초과할 것을 시사했습니다——속도 최적화로 추상 추론이 약해진 Flash의 공백을 메우려는 전략입니다.
2026년 7월 중순 기준 공식 벤치마크는 아직 전부 공개되지 않았고, 서드파티도 동일 harness 공정 비교가 부족합니다. 따라서:
- 「추론 품질이 Claude Opus 4.8 / GPT-5.5를 넘는가」——지금은 방향만 보고 결론은 이릅니다
- Google 전략은 agentic coding 랭킹에서 Anthropic과 정면 승부보다 컨텍스트 길이 선두에 가깝습니다
선택 시 스스로에게: 병목이 「추론 깊이 부족」인가, 「컨텍스트에 안 들어감」인가? 전자는 벤치마크를 기다리고, 후자는 Pro가 이미 분명한 차별점입니다.
업그레이드 9: 처음부터 재설계한 새 아키텍처
놓치기 쉽지만 장기 사용자에게 중요한 점: Gemini 3.5 Pro는 3.1 Pro의 파라미터 확장이 아니라, Google DeepMind가 내부 테스트 미달 후 재학습한 버전입니다.
실무 영향:
- 행동 패턴이 3.1 Pro와 꽤 다를 수 있음——기존 prompt 템플릿·시스템 프롬프트 재튜닝 필요
- GA 지연은 품질 보장의 대가——프로덕션에는 좋지만 초기 통합 문서·가격은 불안정
- Flash와 Agentic 인프라 일부 공유——Flash에서 Pro로 옮길 때 도구 체인 변경은 상대적으로 작음
업그레이드 10: 개방 API와 OpenAI 호환 엔드포인트
Pro는 여러 채널로 공개됩니다:
| 채널 | 상태(2026.07.15) | 비고 |
|---|---|---|
| Vertex AI | 기업 프리뷰 | Model ID: gemini-3.5-pro-preview-06, allowlist 필요 |
| Google AI Studio | GA 후 개방 | 개인 개발자 빠른 실험용 |
| Gemini API(REST/SDK) | GA 후 개방 | Python / TypeScript 공식 SDK |
| OpenAI 호환 엔드포인트 | AI Studio 지원 중 | 기존 OpenAI SDK는 base URL만 바꿔 이전 |
| Gemini Advanced 구독 | GA와 동기 예상 | 소비자용 진입점 |
장문 컨텍스트에서는 Context Caching이 비용 레버입니다: 캐시 입력은 표준 입력보다 약 90% 저렴해, 「같은 큰 컨텍스트에 반복 질문」 워크플로(전체 저장소 감사, 다회차 법률 Q&A)에 적합합니다.
const cachedContent = await genAI.cacheContent({
model: "gemini-3.5-pro",
contents: [{ role: "user", parts: [{ text: largeContext }] }],
ttl: "3600s"
});
const model = genAI.getGenerativeModelFromCachedContent(cachedContent);
const result = await model.generateContent("Based on the context above, find all SQL injection risk points");
Pro vs Flash vs 경쟁 모델: 한 표로 정리
| 차원 | Gemini 3.5 Pro | Gemini 3.5 Flash | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| 컨텍스트 | 200만 token | 100만 token | 20만 token | 약 51.2만 token |
| 심층 추론 | Deep Think | 없음 | Extended thinking | o-series |
| 입력가(추정) | $12–15 / M | $1.50 / M | 약 $20 / M | 약 $15 / M |
| 출력가(추정) | $36–45 / M | $9 / M | 약 $60 / M | 약 $60 / M |
| GA 상태 | 프리뷰 중 | GA 완료 | GA 완료 | GA 완료 |
| 최적 시나리오 | 초장문 컨텍스트, 전체 저장소 분석 | 일상 고처리량 | Agentic 코딩 | 구조화된 다단계 작업 |
가격은 프리뷰 단계 추정치입니다. GA 후 Google 공식 요금 페이지를 기준으로 하세요. 더 넓은 모델 라우팅 전략은 OpenRouter Top10 랭킹을 참고하세요.
어떻게 붙이나? 현재 가용성과 타임라인
2026년 7월 15일 기준:
- 공개 Gemini API 모델 목록은 여전히
gemini-3.5-flash와gemini-3.1-pro-preview중심이며, gemini-3.5-pro 광범위 GA는 아직 없음 - 여러 보도는 GA 목표를 7월 17일 전후로 가리키지만, Google은 공식 model card·가격 공지를 내지 않았습니다——계획 참고용으로 두고, 미확인 버전에 프로덕션 의존을 미리 걸지 마세요
- 기업 사용자는 Vertex AI에서
gemini-3.5-pro-preview-06프리뷰 권한 신청 가능
개인 개발자 단계별 권장:
- Flash로 비즈니스 로직과 도구 체인 통합을 먼저 검증
- Pro용 prompt와 비용 예산 모델 준비(특히 Deep Think + 장문 컨텍스트)
- GA 후 A/B: 같은 작업을 Flash와 Pro에 각각 돌려 실제 token 소비와 품질로 라우팅 전략 결정
결론: Pro를 기다릴 팀, Flash로 충분한 팀
Gemini 3.5 Pro는 특수 도구이지 전면 대체가 아닙니다.
Pro를 기다리거나 우선 시험할 팀:
- 법무·금융·컴플라이언스——여러 장문 문서 교차 분석
- 보안 감사——전체 코드베이스를 동시에 봐야 함
- 장시간 Agent——세션이 수 시간 이어지고 컨텍스트 압축을 자주 하기 싫을 때
- 고난도 추론——수학·아키텍처·다중 제약 최적화, 지연과 token으로 정확도를 사려 할 때
지금 Flash로 충분한 팀:
- 일상 코딩 보조, 단일 파일 편집
- 고처리량 API 파이프라인(고객 지원, 콘텐츠 생성, 분류)
- RAG로 커버 가능한 지식베이스 Q&A
- 지연에 민감한 프로덕션 경로
10가지 업그레이드 중 게임 체인저는 사실 두 숫자뿐입니다: 200만 token과 Deep Think. 나머지(Agentic 루프, Antigravity, 멀티모달)는 Flash가 대부분 이미 커버하고, Pro는 그 위에서 상한을 올립니다. 병목이 「안 들어감」인지 「깊이 부족」인지 먼저 정한 뒤 Pro 비용을 지불할지 결정하세요.
Agent를 돌리려면 24/7 온라인 빌드 환경이 필요한가요?
클라우드 Mac mini M4 전용 베어메탈——Xcode CI, 셀프호스트 Runner, OpenClaw Agent 상시 운영에 적합. 도쿄·싱가포르·홍콩 노드, 일 단위 과금
더 읽기
자주 묻는 질문
Gemini 3.5 Pro와 Gemini 3.5 Flash 중 어떻게 고르나요?
일상 대화, 고처리량, 비용 민감하면 Flash; 200만 token 전량 컨텍스트, Deep Think 심층 추론, 복잡한 Agent 리서치 루프가 필요하면 Pro. Pro 단가는 Flash의 약 8–10배입니다.
Gemini 3.5 Pro는 지금 쓸 수 있나요?
2026년 7월 중순 기준 Pro는 Vertex AI 기업 프리뷰 단계이며, 공개 Gemini API는 gemini-3.5-flash와 gemini-3.1-pro 중심입니다. 광범위 GA는 7월 중하순 예상——Google 공식 문서를 기준으로 하세요.
Deep Think 모드는 비용이 얼마나 늘어나나요?
추론 token은 컨텍스트 예산에 포함되고 출력 token 요금으로 청구됩니다. 복잡한 문제는 최종 답 전에 많은 token을 쓸 수 있으니, 수학 증명·아키텍처 결정 같은 고난도 작업에만 켜는 것이 좋습니다.
200만 token 컨텍스트는 어떤 상황에 맞나요?
전체 저장소 코드 감사, 여러 법률·정책 문서 교차 비교, 장시간 Agent 세션 상태 유지에 적합합니다. 단일 파일 편집이나 RAG로 충분한 작업은 Flash + 청크 검색이 보통 더 저렴하고 빠릅니다.
기존 OpenAI SDK로 Gemini 3.5 Pro를 호출할 수 있나요?
가능합니다. Google AI Studio가 OpenAI 호환 엔드포인트를 제공하며, 대부분의 OpenAI SDK 코드는 base URL과 model 이름만 바꾸면 이전할 수 있습니다.