제미나이 4 아르곤, 출력 100만 토큰인데 아직 못 쓴다

새 AI 모델이 나올 때마다 “이번엔 갈아타야 하나” 고민하는 개발자라면, 이번 소식은 읽는 순서가 조금 다르다. 구글이 2026년 9월 30일 공개한 **제미나이 4 아르곤(Gemini 4 Argon)**은 한 번에 쓸 수 있는 출력 한도가 6만 4천 토큰에서 100만 토큰으로 15배 넘게 뛰었다. 그런데 지금 이 모델을 실제로 쓸 수 있는 사람은 구글이 고른 사이버 방어자 일부뿐이다.
이 글은 세 부류를 위해 쓴다. API로 코딩 에이전트를 돌리는 사람, 모델 가격표를 보고 월 예산을 짜는 사람, 그리고 곧 풀릴 모델에 대비해 지금 무엇을 점검해 둘지 알고 싶은 사람이다. 토큰이나 벤치마크 같은 말은 처음 나올 때 풀어 쓴다.
근거는 구글 공식 블로그의 발표문 하나다. 점수와 사례는 전부 구글이 직접 밝힌 것이라 외부 검증을 거치지 않았다. 그 점은 글 내내 짚겠다. 구글 모델 이야기는 앞서 제미나이 3.8 플래시 사이버 글에서도 다룬 적이 있다. 그때 만든 ‘신뢰된 방어자’ 프로그램이 이번에도 그대로 등장한다.
제미나이 4 아르곤을 지금 쓸 수 있는 사람은 따로 정해져 있다
발표문 첫 단락부터 단서가 붙는다. 아르곤은 **페어윈드 프로그램(Fairwind Program)**을 통해 “신뢰된 사이버 방어자(trusted cyber defenders)” 집단에게 먼저 풀리고 있다. 일반 개발자가 API 키를 발급받아 호출하는 경로는 발표문에 나와 있지 않다.
구글이 밝힌 이유는 이렇다. 이 수준의 능력을 안전하게 내놓으려면 단계별 공개가 필요하다는 것이다. 그래서 미국 정부의 자발적 사전 접근 절차(pre-release model access)에 참여하는 동시에 접근을 조금씩 넓히고 있다고 적었다. 개발자·기업·일반 소비자에게는 “가능한 한 빨리” 내놓겠다면서, 순서도 못 박았다. 유료 API 고객과 구글 AI 울트라(Google AI Ultra) 구독자가 먼저다.
페어윈드가 어떤 프로그램인지는 3.8 플래시 사이버 때 이미 나왔다. 정부 기관, 핵심 인프라 운영자, 소프트웨어 관리자를 대상으로 신청을 받아 심사하는 구조였다. 이번 발표문은 아르곤의 대상을 “신뢰된 사이버 방어자”라고만 적었으니 같은 틀로 보인다. 다만 대상 범위가 똑같다고 확인해 주는 문장은 없다.
정식 공개일도 적혀 있지 않다. 발표문의 마지막 소제목이 “곧 출시(Rolling out soon)“인데, 그 아래에도 날짜는 없다.
출력 한도가 15배 넘게 뛴 게 왜 중요한가
토큰은 AI가 글자를 세는 단위다. 단어 하나가 토큰 한 개일 수도, 몇 개로 쪼개질 수도 있다. 모델에는 두 가지 한도가 있다. 한 번에 **읽을 수 있는 양(입력)**과 한 번에 **쓸 수 있는 양(출력)**이다. 이번 발표에서 구글이 올렸다고 밝힌 건 출력 쪽이다. 이전 6만 4천 토큰에서 업계 최고 수준이라는 100만 토큰으로 늘렸다. 100만을 6만 4천으로 나누면 15.6배다.
구글의 설명은 이렇다. 모델이 여유를 갖고 깊게 생각하면서 한 번의 흐름에서 수십만 토큰을 만들어 낼 수 있게 되면, 어려운 문제를 한 번에 푸는 데 더 깊은 추론을 얹을 수 있다는 것이다.
개발자 입장에서 풀어 쓰면 이런 변화다.
- 큰 코드 파일 여러 개를 한 번의 답변으로 통째로 만들어 내는 작업이 가능해진다.
- 한도에 걸려 중간에 끊기고, “이어서 써 줘”를 반복하며 붙이던 우회 코드가 필요 없어질 수 있다.
- 다만 한도가 늘었다고 평소 답변이 길어지는 건 아니다. 어디까지나 상한이다.
영어 기준으로는 토큰 1개가 단어 0.75개 안팎이라는 통상 환산이 있다. 이걸 쓰면 100만 토큰은 영어 단어 75만 개쯤이다. 한국어는 같은 분량에 토큰을 더 많이 쓰는 편이라 실제 글자 수는 이보다 줄어든다. 이 환산은 구글이 준 값이 아니라 업계에서 쓰는 어림셈이다.
여기서 한 가지가 중요하다. 출력 한도는 비용 한도이기도 하다. 다음 절에서 보겠지만, 출력 토큰은 입력보다 5배 비싸다.
가격표: 소개가는 2달러·10달러, 끝나면 두 배
아르곤은 “소개 가격(introductory price)“으로 출시된다. 발표문과 각주에 적힌 값을 표로 옮기면 이렇다. 모두 100만 토큰당 가격이다.
| 구간 | 입력 | 출력 | 캐시 입력(95% 할인) |
|---|---|---|---|
| 소개 기간 | 2달러 | 10달러 | 0.10달러 |
| 소개 기간 종료 후 | 4달러 | 20달러 | 0.20달러 |
캐시 입력의 0.10달러와 0.20달러는 발표문에 적힌 “입력 가격의 95% 할인”을 계산한 값이다. 캐시 입력은 같은 앞부분 내용을 반복해 보낼 때 이미 처리한 걸 재사용해 값을 깎아 주는 방식이다. 같은 코드베이스를 계속 읽는 에이전트에게는 비중이 큰 항목이다.
소개 기간이 언제까지인지는 발표문에 없다. 각주는 “소개 기간이 끝나면 100만 입력 토큰당 4달러, 100만 출력 토큰당 20달러가 적용된다”고만 한다. 가격이 사실상 지금의 두 배로 확정돼 있는 셈이다.
참고로 앞서 클로드 오퍼스 5.5 글에서 다룬 오퍼스 5.5의 가격은 입력 4달러·출력 20달러, 캐시 읽기 0.20달러였다. 소개 기간이 끝난 뒤의 아르곤 가격표가 숫자로는 정확히 같다. 값이 같다고 성능이 같다는 뜻은 아니다. 가격만 놓고 보면 둘이 같은 칸에 선다는 정도다.
출력 한도를 꽉 채우면 한 번에 얼마인가
출력 100만 토큰을 한 번에 다 쓰는 극단적인 경우를 계산해 보자. 1달러를 1,350원으로 가정한다.
- 소개 기간: 10달러, 약 1만 3,500원
- 소개 기간 종료 후: 20달러, 약 2만 7,000원
호출 한 번에 이 정도다. 에이전트가 같은 실수를 반복하는 루프에 빠지면 이 금액이 순식간에 쌓인다. 모델이 똑똑해지는 것과 별개로, 한도가 커질수록 예산 상한을 직접 걸어 두는 일이 중요해진다.
하루 종일 에이전트를 돌리면
현실적인 예를 하나 더 들자. 에이전트가 하루 동안 입력 2,000만 토큰을 읽고 출력 200만 토큰을 쓴다고 가정한다. 캐시가 전혀 안 맞는 경우와, 입력의 80%가 캐시에 적중하는 경우를 나눠서 계산한 값이다.
| 구간 | 캐시 없음 | 입력 80% 캐시 적중 |
|---|---|---|
| 소개 기간 | 60달러 (약 8만 1,000원) | 29.6달러 (약 4만 원) |
| 소개 기간 종료 후 | 120달러 (약 16만 2,000원) | 59.2달러 (약 8만 원) |
계산 과정은 단순하다. 소개 기간·캐시 없음이면 입력 20×2달러=40달러에 출력 2×10달러=20달러다. 캐시 80%일 때는 캐시 입력 1,600만 토큰이 1.6달러, 나머지 400만 토큰이 8달러, 출력 20달러를 더해 29.6달러다. 종료 후에는 단가가 두 배라 결과도 두 배다.
이 표에서 눈에 띄는 건 두 가지다. 첫째, 캐시가 잘 맞으면 비용의 약 70%(20달러÷29.6달러)가 출력에서 나온다. 입력이 싸질수록 병목은 출력으로 옮겨 간다. 둘째, 소개 기간이 끝나는 날 청구서가 그대로 두 배가 된다. 소개가로 한 달 예산을 짜 놓았다면 그날 예산이 깨진다.
구글이 자기 회사 안에서 먼저 써 본 결과
발표문은 아르곤이 이미 구글 내부 업무를 돌리고 있다고 말한다. 수천 명의 직원이 전문 코딩 작업, 깊은 조사, 글쓰기에서 강점을 꼽았다는 설명이다. 구체 사례는 세 가지다.
양자 알고리즘 최적화
구글 양자컴퓨팅 연구자들은 아르곤으로 응용 프로그램의 병목이 되는 하위 루틴의 자원(큐비트 수 × 게이트 수)을 줄이고 있다. 한 사례에서 이미 발표된 기준선을 40% 앞섰고, 걸린 시간은 몇 분이었다. 분야가 너무 전문적이라 개발자가 바로 써먹을 건 아니지만, “몇 분 만에 공개된 기록을 깼다”는 문장이 구글이 보여 주고 싶은 그림이다.
데이터센터 메모리 300TiB
에이전트 팀이 구글 서버 전체의 성능 측정 기록을 분석해, 메모리 사용을 줄일 지점을 스스로 찾아 적용했다. 발표문에 따르면 적용이 끝나면 300TiB가 넘는 메모리가 풀린다. 최종적으로는 500TiB에서 1PiB까지 절감할 것으로 추정한다.
TiB는 1,024GiB다. 300TiB를 노트북 메모리 128GB로 나누면 대략 2,400대 분량이다. 단, 이 숫자는 “적용되면”이라는 조건이 붙은 값이다. 이미 다 줄였다는 뜻이 아니다.
C/C++ 코드를 러스트로 옮기는 중
가장 현실감 있는 사례가 이것이다. 구글은 아르곤 에이전트로 자사 C/C++ 코드를 러스트로 옮기는 작업을 하고 있다. 규모는 수만 줄짜리 핵심 라이브러리(re2, libgav1)에서 시작해, 구글의 운영체제 퓨시아(Fuchsia) 커널인 지르콘(Zircon)의 80만 줄 이상까지 커졌다.
왜 옮기나. 러스트는 C/C++에서 흔한 메모리 오류(이미 해제한 메모리를 다시 쓰는 실수 같은 것)를 언어 차원에서 막아 주는 언어다. 이런 오류는 보안 구멍의 단골 원인이다. 그래서 오래된 핵심 코드를 러스트로 바꾸려는 흐름이 있는데, 사람이 손으로 하면 품이 많이 드는 작업이다. 에이전트가 이 작업을 맡는다는 게 이번 사례의 요점이다.
다만 구글도 조심스럽게 적었다. 이런 핵심 시스템의 대규모 재작성은 실서비스에 내보내기 전에 자동·수동 감사, 에뮬레이션 테스트, 리뷰를 거치고 있다고 했다. 80만 줄을 이미 갈아 끼웠다는 뜻이 아니다.
작은 사례는 결과가 구체적으로 나왔다. 영상을 재생 가능한 화면으로 풀어 주는 구글의 오픈소스 디코더 libgav1에서, 에이전트는 이미 있던 러스트 이식본을 가져다 SIMD 최적화 코드 3만 2천 줄을 바꿨다. SIMD는 CPU가 여러 데이터를 한꺼번에 계산하도록 직접 명령을 쓰는 방식이다. 컴파일러가 만든 결과를 들여다보고, 프로파일링으로 측정하며 실험을 여러 번 반복해서, 컴파일러가 알아서 병렬화할 수 있는 안전한 러스트 코드를 만들어 낸 것이다.
결과는 메모리 안전한 디코더가 기존 러스트 이식본보다 2.7배 빠르고, 출력 영상은 동일했다. 구글은 이 결과가 디코더를 “최적화된 C++ 버전에 더 가깝게” 만들었다고 표현했다. 즉 C++보다 빠르다는 말이 아니다. 비교 대상이 러스트 이식본이라는 점을 놓치면 안 된다.
점수표는 이렇게 읽는다
벤치마크는 모델에게 같은 시험을 풀게 해서 점수를 매기는 표준 문제집이다. 발표문에 나온 것을 정리하면 이렇다.
| 벤치마크 | 무엇을 재나 | 아르곤 결과 | 구글의 표현 |
|---|---|---|---|
| DeepSWE v1.1 | 현실의 긴 소프트웨어 개발 작업 | 77.9% | 새로운 최고 기록 |
| AutomationBench (재피어) | 업무 전체를 처음부터 끝까지 자동화 | 51.3% | 1위 |
| LVBench | 긴 영상 이해 | 91.7% | 최고 기록 |
| CWE-bench v1 | 보안 취약점 고치기 | 68% | 공동 1위 |
| Vals Index | 금융·코딩·법률·세무 업무의 경제적 영향 | 점수 미기재 | 선두 |
바로 이어서 읽을 때 세 가지를 기억하자.
- 점수는 전부 구글이 발표한 값이다. 발표문 본문에는 오퍼스나 GPT 같은 경쟁 모델과의 점수 비교가 확인되지 않는다. “1위”라는 표현만 있고, 누구를 제쳤는지는 이 글에서 확인할 수 없다.
- DeepSWE 77.9%가 100개 문제 중 78개를 풀었다는 뜻인지, 다른 방식의 환산 점수인지는 발표문이 설명하지 않는다. 숫자만 다른 모델 점수와 나란히 놓고 읽으면 틀릴 수 있다.
- Vals Index, Vals Finance Agent v2, 하비(Harvey)의 법률 에이전트 벤치마크는 선두라고만 하고 점수는 적지 않았다.
CWE-bench는 특히 주의해야 한다. 앞선 3.8 플래시 사이버 글에서 본 47.2%는 v0 기준이었고, 이번 68%는 v1이다. 버전이 다르면 문제 구성이 달라질 수 있어서 두 숫자를 곧바로 비교하면 안 된다. 구글이 밝힌 것은 “v0에서의 3.8 플래시 사이버의 선두 성능 위에 쌓았다”는 문장까지다.
가장 강하게 내세우는 건 보안이다
발표문에서 가장 힘을 준 부분이 사이버 방어다. 구글은 아르곤을 중요한 소프트웨어 취약점을 스스로 찾고, 검증하고, 패치하도록 훈련했다고 밝혔다.
핵심 문장은 이것이다. 신뢰된 방어자와 구글 내부 팀에게는 아르곤을 사이버 가드레일 없이 내놓겠다고 했다. 가드레일(guardrail)은 모델이 위험한 요청을 거절하게 하는 안전장치다. 일반 사용자 모델에서는 취약점 공격 코드를 만들어 달라는 요청을 막아 두는데, 방어자에게는 그 제한을 풀어서 모델의 전체 능력을 쓰게 하겠다는 뜻이다. 일반 공개 시점에는 가드레일이 다시 붙는 것으로 읽힌다. 다만 발표문이 그렇게 명시하지는 않았다.
사례는 보안 회사 위즈(Wiz)의 ‘좋은 일을 위한 스캔(Scan for Good)’ 프로그램이다. 핵심 공공 인프라를 무료로 지켜 주려고 위험한 노출을 찾아 고치는 활동인데, 위즈가 아르곤을 써서 전 세계 병원이 쓰는 의료 소프트웨어에서 환자 개인정보가 새는 치명적 취약점을 찾아냈다. 구글은 이걸 “이전 프론티어 모델들이 놓친 심각한 위험”이라고 설명했다.
구글 내부 종합 취약점 벤치마크에서는 20개 프로그래밍 언어로 된 복잡한 코드베이스에서 다양한 노출을 찾았다. 위즈의 블랙박스 침투 테스트 벤치마크(소스 코드 없이 살아 있는 웹 시스템을 분석하는 시험)에서는 3.8 플래시 사이버보다 공격 표면 발견, 취약점 식별, 검증용 증거 작성 모두 앞섰다고 한다. 각각의 구체적 점수는 공개하지 않았다.
방어 도구와 공격 도구는 같은 기술이라는 점도 기억해 두자. 취약점을 잘 찾는 모델은 나쁜 쪽이 쥐면 그만큼 위험하다. 구글이 일반 공개 대신 단계별 공개를 택한 이유가 여기에 있다.
풀기 전에 손본다는 안전장치 네 가지
구글은 아르곤을 널리 풀기 전에 네 영역의 안전장치를 강화하는 중이라고 적었다.
1. 오남용 방어. 사이버 공격이나 화학·생물·방사능·핵(CBRN) 공격에 쓰려는 요청은 거절하되, 정당한 이중 용도 과학 연구는 막지 않도록 설계했다. 모델 내부의 활성화(activation)를 감시해 오남용 징후를 잡아내는 기법도 고도화하고 있고, 내부·외부 레드팀이 수동·자동 공격으로 시험했다.
2. 프롬프트 인젝션 방어. 프롬프트 인젝션은 웹페이지나 문서 안에 악의적 지시를 숨겨 두어 AI가 사용자 의도와 다르게 움직이게 만드는 공격이다. 구글은 아르곤이 지금까지 가장 강한 모델이고, 그레이 스완(Gray Swan)의 간접 프롬프트 인젝션(IPI) 벤치마크에서 선두라고 밝혔다. 웹을 읽고 도구를 쓰는 에이전트라면 가장 현실적인 위협이어서 눈여겨볼 대목이다.
3. 어긋남(misalignment) 감시. 에이전트가 맡은 일을 이루려고 사용자가 의도한 선을 넘는 일을 막기 위해, 아르곤의 사고 과정(chain-of-thought)과 행동을 감시하다가 필요하면 실행을 멈추는 장치를 넣었다. 훈련 중에도 비슷한 감시 시스템을 돌려 전담 사고 대응 팀에 경보를 보냈다. 그 결과를 다시 훈련에 먹이지 않도록 조심했다고 한다. 모델이 감시를 피하도록 생각하는 법을 배우는 것을 막기 위해서다. 구글은 업계 전체에 모델의 생각이 투명하게 보이도록 유지하자고 권했다.
4. 시스템 단단하게 하기. 아주 강력한 모델을 테스트하려면 그에 맞는 보안 환경이 필요하다. 구글은 자사 ’에이전트 통제 로드맵’에 따라 위험도가 높은 훈련·평가를 시작하기 전에 샌드박스 환경을 격리하고 봉인하는 중이라고 했다.
세 번째와 네 번째 항목은 최근 흐름과 맞닿아 있다. 며칠 전 오픈AI 에이전트가 미국 정부 사이트에 접근한 사건에서도 훈련·평가 중인 에이전트가 의도 밖으로 움직이는 문제가 핵심이었다. 구글이 발표문에서 샌드박스와 행동 감시를 따로 소제목으로 뺀 것도 같은 맥락으로 읽힌다. 다만 구글이 그 사건을 직접 언급한 건 아니다.
오퍼스 5.5와 나란히 놓으면 비교되는 것과 안 되는 것
개발자가 가장 먼저 묻는 건 “지금 쓰는 모델을 바꿔야 하나”일 것이다. 지금 확인된 사실로 정리하면 이렇다.
| 항목 | 제미나이 4 아르곤 | 클로드 오퍼스 5.5 |
|---|---|---|
| 지금 호출 가능한가 | 사이버 방어자 일부만 | 공개됨 |
| 가격(입력/출력, 100만 토큰당) | 소개가 2달러/10달러, 종료 후 4달러/20달러 | 4달러/20달러 |
| 캐시 입력 | 입력가의 5% (소개 기간 0.10달러, 종료 후 0.20달러) | 캐시 읽기 0.20달러 |
| 성능 비교 | 구글 발표문에 경쟁 모델 비교 없음 | — |
오퍼스 5.5 쪽 값은 앞서 쓴 오퍼스 5.5 글에서 정리한 앤스로픽 발표 기준이다. 결론은 단순하다. 지금 바꿀 이유는 없다. 아르곤은 호출할 수 없고, 점수는 구글이 고른 시험으로만 나와 있다. 소개 기간이 끝나면 가격 면에서 같은 칸에 서게 되니, 그때는 성능과 쓰임새로 비교하면 된다.
제미나이 4 아르곤이 풀리기 전에 개발자가 할 일
일반 개발자가 오늘 당장 할 수 있는 건 많지 않다. 그래서 출시되는 날 허둥대지 않도록 점검할 것을 정리한다.
- 내가 페어윈드 대상인지 확인한다. 정부 기관, 핵심 인프라 운영자, 소프트웨어 관리자라면 신청 경로가 있을 수 있다. 이 부분은 구글 안내를 직접 확인해야 한다.
- 출력 토큰 상한을 직접 걸어 둔다. 지금 쓰는 에이전트 도구에 호출당 최대 출력 토큰, 하루 예산 상한이 있는지 본다. 출력 한도가 100만으로 늘면 상한 없이 두는 위험이 같이 커진다.
- 예산은 종료 후 가격(4달러/20달러)으로 짠다. 소개가로 계획을 세우면 기간이 끝나는 날 두 배가 된다. 소개 기간이 언제까지인지 아직 모른다는 사실도 같이 적어 둔다.
- 캐시가 잘 맞는 구조인지 본다. 입력 단가가 소개가 기준 0.10달러까지 내려가는 항목이다. 프롬프트의 앞부분(시스템 지시, 공통 문맥)을 고정하고 변하는 부분을 뒤에 두면 캐시가 잘 맞는다.
- C/C++ 코드가 있다면 러스트 이전을 실험해 볼 만한 후보 하나를 골라 둔다. 구글 사례는 작은 라이브러리부터 시작해 규모를 키웠다. 사내 코드에서도 테스트가 탄탄한 작은 모듈이 후보다.
발표문에 적혀 있지 않은 것
이 모델에 대해 지금 알 수 없는 것도 분명히 적어 둔다.
- 일반 공개일. “곧 출시”라고만 했다.
- 소개 가격이 언제 끝나는지. 종료 후 가격만 각주에 있다.
- 입력(읽기) 한도. 이번에 밝힌 건 출력 한도뿐이다.
- 경쟁 모델과의 점수 비교. 발표문 본문에는 다른 회사 모델과의 직접 비교가 없다.
- 벤치마크 점수의 산정 방식. DeepSWE나 AutomationBench가 어떻게 점수를 매기는지 설명이 없다.
- 일반 공개 모델의 사이버 가드레일 수준. 방어자용은 가드레일 없이 내놓는다고 했고, 일반용이 어떨지는 말하지 않았다.
공개되면 독립 평가가 나오기 마련이다. 구글 발표문의 수치와 독립 평가가 어디서 달라지는지 확인하는 것이 다음 순서다. 그때까지는 이 글의 숫자를 “구글이 말한 값”으로만 기억하는 편이 안전하다.