Gemini 4 Argon — 출력 100만 토큰과 Fairwind 단계 공개, Google이 말하는 프론티어 | DAKER 커뮤니티

Gemini 4 Argon 설명용 생성 이미지 (Google 로고 배지 포함)

긴 추론을 한 궤적으로 붙이려면, 모델의 출력 한도부터 다시 설계해야 합니다. Google DeepMind SVP이자 Google Chief AI Architect인 Koray Kavukcuoglu은 2026년 9월 30일 공식 블로그에서 차세대 프론티어 모델 Gemini 4 Argon을 발표했습니다. 소프트웨어 엔지니어링, 법률·금융 같은 엔터프라이즈 지식 업무, 사이버 보안 방어처럼 길고 다단계인 워크플로에 초점을 맞췄다고 설명합니다. 우선 Fairwind Program의 신뢰 사이버 방어 팀에게 단계적으로 풀리고, 광범위 개발자·엔터프라이즈·소비자 개방은 가드레일을 더 다진 뒤라고 적었습니다. 이 글에서는 발표 요지, 출력·가격, Google 내부 사례, 벤치마크 숫자, 사이버 방어, 네 갈래 안전장치, 이후 롤아웃을 공식 글 기준으로 길게 정리합니다.

Fairwind부터 시작하는 단계 공개

Argon은 “바로 전 세계 API에 연다”가 아니라, 프론티어 능력을 안전하게 푸는 단계 공개로 포지션을 잡았습니다. Google은 미국 정부의 자발적 사전 공개 모델 접근 절차에도 관여 중이라고 밝혔고, 초기 테스터 피드백으로 가드레일을 반복 개선한 뒤 개발자·기업·소비자에게 가능한 한 빨리 넓히겠다고 했습니다. 신뢰 사이버 방어자와 Google 내부에는 사이버 가드레일 없이 풀 능력을 제공한다고 명시했습니다. 유료 API 고객과 Google AI Ultra 구독자부터 넓히는 일정이 공식 글의 다음 단계입니다.

능력과 가드레일을 같이 올리는 롤아웃이라, 지금 당장 모든 개발자 API에 열린 상태는 아닙니다.

출력 100만 토큰, 그리고 도입 가격

긴 작업을 버티기 위해 출력 토큰 한도를 기존 6만 4천에서 산업계 최고 수준인 100만 토큰으로 늘렸다고 밝혔습니다. 한 궤적에서 수십만 토큰을 쓰며 깊게 추론할 여지를 준다는 설명입니다. 도입 가격은 입력 100만 토큰당 2달러, 출력 10달러이며, 캐시 입력은 입력가의 95% 할인입니다. 도입 기간이 끝나면 입력 4달러·출력 20달러가 적용된다고 합니다. 숫자와 일시는 Google 측 발표이므로, 실제 청구·지역·요금제 조건은 공식 가격표를 따르는 편이 안전합니다.

출력 100만 토큰은 단발 Q&A보다, 장기 에이전트·대규모 코드·문서 작업을 한 세션에 이어 붙이는 여유에 가깝습니다.

Google 내부에서 이미 쓰는 사례

수천 명의 Googler가 전문 코딩, 깊은 조사, 글쓰기 품질에서 Argon을 쓰고 있다고 소개했습니다. 공식 글이 든 내부 사례는 다음처럼 구체적입니다.

내부 사례는 Google 인프라 분포에 맞춘 결과라 우리 환경에 그대로 이식된다고 단정할 수는 없습니다. 다만 “하루짜리 엔지니어링 워크플로를 붙이는 모델”로 읽히는 근거는 분명합니다.

코딩·지식업무·멀티모달 벤치마크

실세계 장기 소프트웨어 엔지니어링을 보는 DeepSWE v1.1에서 77.9%로 새 최고 수준이라고 적었습니다. 금융·코딩·법률·세무의 경제 영향을 GDP 기여로 가중하는 Vals Index에서도 선두라고 했고, Vals Finance Agent v2, Harvey Legal Agent Benchmark에서도 강한 성능을 보인다고 합니다. Zapier의 AutomationBench(핵심 비즈니스 기능의 종단 실행)에서는 51.3%로 1위라고 밝혔습니다. 긴 영상 이해 LVBench는 91.7%로 최고라고 합니다.

위 수치는 모두 Google 측 보고이며, 벤치 구성·채점·우리 업무 분포와는 다를 수 있습니다. 읽기 포인트는 점수 자체보다 “긴 다단계·도메인 특화·멀티모달 업무”로 평가축을 옮겼다는 데 있습니다.

방어 사이버 보안

Argon은 취약점을 자율적으로 찾고, 검증하고, 패치하도록 강하게 훈련됐다고 합니다. Wiz는 Scan for Good 이니셔티브에서 이미 Argon을 쓰고 있으며, 병원용 헬스케어 소프트웨어에서 민감 개인정보가 노출되는 치명적 취약점을 기존 프론티어 모델이 놓친 사례로 찾아냈다는 초기 시연을 소개했습니다. 보안 취약점 교정 능력을 보는 CWE-bench v1에서는 68%로 공동 1위라고 합니다. Google 내부 종합 취약점 벤치에서는 20개 언어의 복잡한 코드베이스에서 폭넓은 노출을 찾았고, Wiz의 블랙박스 침투 벤치에서는 공격면 발견·취약점 식별·PoC 검증에서 3.8 Flash Cyber를 웃돌았다고 비교했습니다.

방어용으로 풀리는 능력이라 해도, 오용 방지와 단계 공개가 같이 적혀 있다는 점이 이번 발표의 톤입니다.

광범위 공개 전, 네 갈래 안전장치

공식 글은 광범위 가용성 전에 네 영역을 강화한다고 정리했습니다.

마치며

Gemini 4 Argon은 가격표와 벤치마크 한 줄보다, 출력 길이·장기 코딩·방어 사이버·단계 공개라는 작업 단위를 키운 발표로 읽는 편이 맞습니다. Fairwind 접근권과 이후 유료 API·AI Ultra 일정을 공식 블로그에서 확인하고, 내부 PoC는 긴 저장소 작업·다단계 지식 업무부터 후보를 잡아 보면 됩니다. 여러분 팀에서는 Argon급 긴 출력 한도가 필요한 워크플로가 어디에 있습니까?

출처