Gemini 4 Argon — 출력 100만 토큰과 Fairwind 단계 공개, Google이 말하는 프론티어 | DAKER 커뮤니티
긴 추론을 한 궤적으로 붙이려면, 모델의 출력 한도부터 다시 설계해야 합니다. Google DeepMind SVP이자 Google Chief AI Architect인 Koray Kavukcuoglu은 2026년 9월 30일 공식 블로그에서 차세대 프론티어 모델 Gemini 4 Argon을 발표했습니다. 소프트웨어 엔지니어링, 법률·금융 같은 엔터프라이즈 지식 업무, 사이버 보안 방어처럼 길고 다단계인 워크플로에 초점을 맞췄다고 설명합니다. 우선 Fairwind Program의 신뢰 사이버 방어 팀에게 단계적으로 풀리고, 광범위 개발자·엔터프라이즈·소비자 개방은 가드레일을 더 다진 뒤라고 적었습니다. 이 글에서는 발표 요지, 출력·가격, Google 내부 사례, 벤치마크 숫자, 사이버 방어, 네 갈래 안전장치, 이후 롤아웃을 공식 글 기준으로 길게 정리합니다.
Fairwind부터 시작하는 단계 공개
Argon은 “바로 전 세계 API에 연다”가 아니라, 프론티어 능력을 안전하게 푸는 단계 공개로 포지션을 잡았습니다. Google은 미국 정부의 자발적 사전 공개 모델 접근 절차에도 관여 중이라고 밝혔고, 초기 테스터 피드백으로 가드레일을 반복 개선한 뒤 개발자·기업·소비자에게 가능한 한 빨리 넓히겠다고 했습니다. 신뢰 사이버 방어자와 Google 내부에는 사이버 가드레일 없이 풀 능력을 제공한다고 명시했습니다. 유료 API 고객과 Google AI Ultra 구독자부터 넓히는 일정이 공식 글의 다음 단계입니다.
능력과 가드레일을 같이 올리는 롤아웃이라, 지금 당장 모든 개발자 API에 열린 상태는 아닙니다.
출력 100만 토큰, 그리고 도입 가격
긴 작업을 버티기 위해 출력 토큰 한도를 기존 6만 4천에서 산업계 최고 수준인 100만 토큰으로 늘렸다고 밝혔습니다. 한 궤적에서 수십만 토큰을 쓰며 깊게 추론할 여지를 준다는 설명입니다. 도입 가격은 입력 100만 토큰당 2달러, 출력 10달러이며, 캐시 입력은 입력가의 95% 할인입니다. 도입 기간이 끝나면 입력 4달러·출력 20달러가 적용된다고 합니다. 숫자와 일시는 Google 측 발표이므로, 실제 청구·지역·요금제 조건은 공식 가격표를 따르는 편이 안전합니다.
출력 100만 토큰은 단발 Q&A보다, 장기 에이전트·대규모 코드·문서 작업을 한 세션에 이어 붙이는 여유에 가깝습니다.
Google 내부에서 이미 쓰는 사례
수천 명의 Googler가 전문 코딩, 깊은 조사, 글쓰기 품질에서 Argon을 쓰고 있다고 소개했습니다. 공식 글이 든 내부 사례는 다음처럼 구체적입니다.
- 양자 알고리즘 최적화: 시공간 자원(큐비트×게이트)이 병목이 되는 서브루틴을 최적화하는 데 쓰였고, 한 예에서 공개된 기준선보다 40% 나은 결과를 수분 만에 냈다고 합니다.
- 메모리 효율: Argon 에이전트 팀이 플릿 프로파일링 텔레메트리를 분석해 데이터센터 메모리 최적화를 자율적으로 찾아 적용했고, 롤아웃 후 300 TiB 이상을 확보했으며 총 절감은 500 TiB~1 PiB로 예상한다고 적었습니다.
- 대규모 코드베이스 마이그레이션: C/C++를 Rust로 옮기는 작업이 re2·libgav1 같은 핵심 라이브러리의 수만 줄에서 Fuchsia Zircon 커널의 80만 줄 이상까지 스케일한다고 합니다. libgav1에서는 기존 Rust 포트의 SIMD 코드 3만 2천 줄을 프로파일 유도 실험과 컴파일러 출력 분석으로 안전한 Rust로 바꿔, 동일 영상 출력 기준으로 해당 Rust 포트보다 2.7배 빠른 메모리 안전 디코더를 만들었다고 밝혔습니다. 다만 이런 대규모 재작성은 자동·수동 감사, 에뮬레이션 테스트, 리뷰를 거친 뒤 프로덕션에 올린다고 강조했습니다.
내부 사례는 Google 인프라 분포에 맞춘 결과라 우리 환경에 그대로 이식된다고 단정할 수는 없습니다. 다만 “하루짜리 엔지니어링 워크플로를 붙이는 모델”로 읽히는 근거는 분명합니다.
코딩·지식업무·멀티모달 벤치마크
실세계 장기 소프트웨어 엔지니어링을 보는 DeepSWE v1.1에서 77.9%로 새 최고 수준이라고 적었습니다. 금융·코딩·법률·세무의 경제 영향을 GDP 기여로 가중하는 Vals Index에서도 선두라고 했고, Vals Finance Agent v2, Harvey Legal Agent Benchmark에서도 강한 성능을 보인다고 합니다. Zapier의 AutomationBench(핵심 비즈니스 기능의 종단 실행)에서는 51.3%로 1위라고 밝혔습니다. 긴 영상 이해 LVBench는 91.7%로 최고라고 합니다.
위 수치는 모두 Google 측 보고이며, 벤치 구성·채점·우리 업무 분포와는 다를 수 있습니다. 읽기 포인트는 점수 자체보다 “긴 다단계·도메인 특화·멀티모달 업무”로 평가축을 옮겼다는 데 있습니다.
방어 사이버 보안
Argon은 취약점을 자율적으로 찾고, 검증하고, 패치하도록 강하게 훈련됐다고 합니다. Wiz는 Scan for Good 이니셔티브에서 이미 Argon을 쓰고 있으며, 병원용 헬스케어 소프트웨어에서 민감 개인정보가 노출되는 치명적 취약점을 기존 프론티어 모델이 놓친 사례로 찾아냈다는 초기 시연을 소개했습니다. 보안 취약점 교정 능력을 보는 CWE-bench v1에서는 68%로 공동 1위라고 합니다. Google 내부 종합 취약점 벤치에서는 20개 언어의 복잡한 코드베이스에서 폭넓은 노출을 찾았고, Wiz의 블랙박스 침투 벤치에서는 공격면 발견·취약점 식별·PoC 검증에서 3.8 Flash Cyber를 웃돌았다고 비교했습니다.
방어용으로 풀리는 능력이라 해도, 오용 방지와 단계 공개가 같이 적혀 있다는 점이 이번 발표의 톤입니다.
광범위 공개 전, 네 갈래 안전장치
공식 글은 광범위 가용성 전에 네 영역을 강화한다고 정리했습니다.
- 오용 방어: 사이버·CBRN 공격 요청은 거절하면서 정당한 이중용도 연구는 보존하도록 Frontier Safety Framework에 맞추고, 내·외부 레드팀으로 견고성을 시험했다고 합니다.
- 프롬프트 인젝션 방어: 간접 프롬프트 인젝션에 가장 강한 모델이라 하며, Gray Swan Indirect Prompt Injection(IPI) 벤치에서 선두라고 합니다.
- 오정렬 모니터링: 사고 사슬과 행동을 감시해 사용자 의도를 넘는 실행을 중단하며, 모니터링 결과를 다시 학습에 넣어 회피를 학습시키지 않도록 주의했다고 합니다.
- 시스템 경화: 고위험 학습·평가 전에 샌드박스를 격리·봉인하는 등 에이전트 통제 로드맵에 맞춰 환경을 강화하고, 파트너와도 모범 사례를 공유하겠다고 했습니다.
마치며
Gemini 4 Argon은 가격표와 벤치마크 한 줄보다, 출력 길이·장기 코딩·방어 사이버·단계 공개라는 작업 단위를 키운 발표로 읽는 편이 맞습니다. Fairwind 접근권과 이후 유료 API·AI Ultra 일정을 공식 블로그에서 확인하고, 내부 PoC는 긴 저장소 작업·다단계 지식 업무부터 후보를 잡아 보면 됩니다. 여러분 팀에서는 Argon급 긴 출력 한도가 필요한 워크플로가 어디에 있습니까?
출처
- Google, Gemini 4 Argon: our next era of frontier intelligence (2026년 9월 30일, Koray Kavukcuoglu): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/