Google이 공개한 Antigravity Teamwork와 Gemini 3.7 Flash, 긴 과제에서 확인된 성과 | DAKER 커뮤니티

에이전트가 긴 과제를 어디까지 맡을 수 있는지는 이제 데모를 넘어 검증 방식과 결과 범위를 함께 따져봐야 하는 주제가 됐습니다. 2026년 8월 31일 Google이 공개한 Antigravity Teamwork 업데이트는 바로 그 지점에서 읽을 만한 발표입니다.

이번 소식의 핵심은 단순히 모델 하나의 성능이 아니라, Antigravity의 다중 에이전트 프레임워크 Teamwork를 Gemini 3.7 Flash와 결합했을 때 수학, 시스템, 오픈소스 작업에서 어떤 결과가 나왔는지에 있습니다. 짧은 요약은 Gemini Multi-Agent Teams in Antigravity, 자세한 내용은 Teamwork: When AI Becomes a Research Partner에서 확인할 수 있습니다.

에이전트 팀이 열린 문제를 풉니다

이번 발표에서 실제로 나온 내용

Teamwork는 에이전트 여러 개가 서로 제안하고, 비판하고, 수정하는 과정을 거치며 수 시간에서 수 일에 걸친 긴 과제를 풀도록 설계된 오케스트레이션 프레임워크로 소개됩니다. Google I/O에서 처음 공개한 기능의 업데이트이며, Antigravity의 유료 플랜에서 /teamwork-preview로 사용할 수 있다고 적혀 있습니다. 무료 플랜 전체 개방으로 설명되지는 않습니다.

Teamwork의 성과는 Gemini 3.7 Flash 단독이 아니라, 다중 에이전트 오케스트레이션과 함께 썼을 때의 결과로 제시됩니다.

Google은 이 조합이 연구와 엔지니어링의 긴 horizon 과제에서 성과를 냈다고 설명합니다. 여기서 중심은 3.7 Flash의 가격이나 단일 모델 성능표가 아니라, Teamwork와 결합된 작업 방식입니다.

수학과 이론전산에서 제시된 결과

원문에 따르면 수학·이론전산 영역에서는 열린 문제 7개를 다뤘습니다. Google 블로그는 Knuth’s Cycles Conjecture, sparse convex optimization, provable LLM quantization, prefix-matrix factorizations 등을 예시로 들며 TCSBench 71%를 함께 언급합니다. Antigravity 블로그는 FOCS·JMLR 계열 문제와 arXiv 링크, 그리고 Lean 검증 예외 조건을 표로 정리합니다.

7개 전부가 학술지 최종 게재 확정이라는 뜻은 아니며, 사람 전문가 검토와 Lean 검증 범위는 문제마다 다르게 제시됩니다.

특히 Long Proof 패턴은 전략을 병렬로 만들고, 반증 역할의 에이전트가 이를 깨 보며, 합성 트리로 후보를 합치는 방식으로 설명됩니다. 실패한 초안과 함정 목록을 다음 라운드에 남긴다는 점도 함께 적혀 있습니다. 소개된 패턴은 Iterative Coding, Distributed Coding, Long Proof, Self-Verification, Document Review이며, /teamwork-preview를 입력하면 Gemini가 프롬프트를 보고 적절한 패턴을 고른다고 합니다.

또한 Long Proof 결과 중 일부는 Gemini 3.1 Pro로 얻었고, 문제 1·3·4는 3.7 Flash로 재현했다고 적혀 있습니다. 원문은 Flash급 모델이 이런 수준의 PhD급 수학 연구를 낸 첫 사례라고 설명하지만, 동시에 일부 결과는 기본보다 높은 병렬 설정을 사용했다고 구분합니다. Antigravity에 공개된 버전은 비용과 능력을 균형 맞춘 설정이라고 덧붙입니다.

TCSBench에서는 3.7 Flash와 3.1 Pro를 함께 쓴 Long Proof가 71%를 기록했다고 적혀 있습니다. 이는 이전 TCSBench 논문의 3.6 Flash+3.1 Pro 67.7%보다 높은 수치이며, 원문 표현은 내부 테스트 기준 최고입니다. Flash와 Pro를 한 패턴 안에서 섞는 기능은 upcoming updates로 설명되므로, 이를 외부 공개 리더보드의 공식 1위처럼 단정해서 읽을 내용은 아닙니다.

수학 결과 표에는 문제마다 공개 문제 링크와 솔루션 링크가 붙어 있습니다. 예시로 FOCS 2025 서브스페이스 근사, JMLR 2021 희소 볼록 최적화, Jayaram 2026 임베딩, Feng et al. 2026 양자화, Bulanek et al. 2026 prefix-matrix, Knuth Cycles GitHub 등이 언급됩니다. arXiv 번호와 검증 조건은 원문 표를 그대로 따라 읽는 것이 좋습니다.

Erdős unit distance 항목은 인터넷 없이 초기 돌파를 재발견했다고 적혀 있지만, 이 한 줄을 전체 7개 문제가 모두 오프라인 환경에서 해결됐다는 뜻으로 넓혀 읽으면 안 됩니다. 항목별 조건은 서로 다릅니다.

에이전트 팀이 열린 문제를 풉니다

시스템 작업에서는 무엇을 보여줬나

시스템 영역에서는 Gemini 3.7 Flash로 사이클 정확 OoO RISC-V CPU 시뮬레이터를 처음부터 만들고, xv6를 셸까지 부팅했다고 적혀 있습니다. 100개가 넘는 RISC-V 표준 벤치마크를 시뮬레이션했고, BOOM 하드웨어 실행 대비 평균 사이클 정렬 오차 0.71%를 제시합니다. Spike 소스를 샌드박스에 넣어 치팅을 막았다는 설명도 포함됩니다.

0.71%는 모든 워크로드에 대한 보증이 아니라, unseen test workloads에서의 평균 사이클 정렬 오차로 제시된 수치입니다.

이 작업은 기능 정확성 단계와 사이클 타이밍 검증 단계로 나뉘어 설명됩니다. MSHR, ROB, Cache 같은 단위를 마이크로벤치와 트레이스로 검증하고, air-gapped Boom·Spike 참조와 잠금 동시 시뮬레이션으로 silent execution gap을 줄인다고 적혀 있습니다. 따라서 이것은 실제 칩 생산이 아니라 시뮬레이터 성과로 이해해야 합니다.

오픈소스 기여는 어떤 방식으로 확인됐나

오픈소스 쪽에서는 Eigen GeMV 단일 행·열 경로에 SIMD 빠른 경로를 추가해 업스트림에 반영했고, ParlayHash에서는 Swiss Parlay 최적화로 64스레드 초기 insert 처리량 2배, 단일 스레드 전체 1.5배, 요소당 메모리 약 25% 절감을 기록했다고 적혀 있습니다.

Eigen과 ParlayHash의 변경은 벤치마크 수치만이 아니라 외부 유지보수자의 코드 리뷰를 거쳐 업스트림에 반영된 결과로 제시됩니다.

즉, Google 내부 포크에서만 의미 있는 실험이 아니라 공개 프로젝트에 실제로 반영된 변경이라는 점을 원문이 강조합니다. 다만 이 본문에서 원문에 없는 커밋 해시나 추가 재현 정보를 덧붙일 필요는 없습니다. 필요한 링크는 Antigravity 글을 따라가면 됩니다.

Teamwork가 강조하는 방식과 한계

원문은 느슨한 다중 에이전트 구성이 초반 실수에 서로 동의하면서 잘못된 방향으로 확신을 키울 수 있다고 설명합니다. Teamwork는 이를 줄이기 위해 후보 생성, 스트레스 테스트, 강한 조각 합성의 루프를 설정 가능한 패턴으로 만들었다고 말합니다.

Teamwork는 사람 없는 완전 자동 연구실이 아니라, 사람이 방향과 최종 수락을 쥔 상태에서 반복을 압축하는 도구로 설명됩니다.

또 하나 중요한 점은 패턴이 실행 코드가 아니라 명세라는 설명입니다. 오케스트레이션 로직과 에이전트 설명이 분리되어 있어, 적대적 비판 루프 같은 장치를 다른 영역으로 옮길 수 있다고 적혀 있습니다. 런타임에 에이전트 수와 팀 구조가 바뀔 수 있다는 점도 함께 언급되므로, 이를 고정된 파이프라인으로 이해하면 원문과 어긋납니다.

Self-Verification 패턴은 올해 발표한 Aletheia 에이전트에서 영감을 받았다고 적혀 있습니다. FirstProof Challenge에서 연구급 수학 능력을 보였다고 소개하며, 이제 Antigravity의 /teamwork-preview에서 이 패턴을 사용할 수 있다고 설명합니다. 이것이 곧 Aletheia 전체 소스 공개를 뜻하는 것은 아닙니다.

또한 앞으로 몇 주 동안 /teamwork-preview에 더 많은 개선이 배포된다고 적혀 있습니다. 따라서 이번에 공개된 결과를 즉시 모든 기본 설정과 동일한 수준의 일반 기능으로 받아들이기보다는, 미리보기 명령과 롤아웃 기간을 함께 보는 편이 정확합니다.

이번 발표를 읽을 때 아닌 것으로 구분할 점

이번 글은 Gemini Omni 1.1 Flash의 영상 길이 소식과는 다른 발표입니다. 중심은 Teamwork 다중 에이전트와 3.7 Flash 조합의 결과입니다.

또한 Flash 모델이 사람 없이 수학 논문을 자동 게재한다는 발표도 아닙니다. Knuth 결과를 포함해 Lean 검증과 사람 검토 범위는 원문에서 분리되어 제시됩니다.

모든 유료 사용자에게 최고 병렬 설정이 기본으로 제공된다는 뜻도 아닙니다. Antigravity 버전은 비용과 능력을 균형 맞춘 설정이며, 일부 연구 결과는 더 높은 병렬을 사용했다고 적혀 있습니다.

TCSBench 71% 역시 외부 독립 재현이 완료됐다는 공지로 읽을 내용은 아닙니다. 원문은 내부 테스트와 기존 논문 대비 수치를 제시합니다.

마지막으로 Eigen·ParlayHash 최적화가 Google 독점 포크에만 존재한다는 뜻도 아닙니다. 원문은 업스트림 반영을 강조합니다.

한 페이지로 정리하면

2026년 8월 31일 Google은 Antigravity Teamwork 업데이트와 Gemini 3.7 Flash 조합의 성과를 공개했습니다. Teamwork는 /teamwork-preview로 유료 플랜에서 제공되며, 여러 에이전트가 서로 비판하고 수정하는 패턴을 통해 긴 과제를 다루는 프레임워크입니다. 공개된 결과에는 열린 문제 7개, TCSBench 71%, RISC-V 시뮬레이터의 평균 사이클 오차 0.71%, 그리고 Eigen·ParlayHash 업스트림 최적화가 포함됩니다. 다만 일부 수학 결과만 3.7 Flash로 재현됐고, Flash+Pro 혼합은 추가 업데이트로 예고됐습니다. 자동 논문 게재나 완전 무인 연구실을 선언한 발표는 아니며, 검증 방식과 적용 범위를 구분해서 읽는 것이 중요합니다.

참고 자료

Google Blog — Gemini Multi-Agent Teams in Antigravity (2026-08-31)
Antigravity Blog — Teamwork: When AI Becomes a Research Partner

이 발표에서 가장 주의 깊게 봐야 할 대목은 성과 수치 자체일까요, 아니면 검증 방식과 적용 범위의 구분일까요?