최상위 경쟁에 돌아온 Google. 앞선 업무, 뒤처진 평가, 실제 이용 조건까지 나눠봅니다.
Gemini 4 Argon은 일부 종합·업무 자동화 평가에서 최상위 모델과 경쟁할 수준을 보였습니다. 다만 코딩 평가에서도 승패가 갈리고, 일반 공개와 출시 할인 조건은 따로 확인해야 합니다. 지금 필요한 일은 전면 교체보다 우리 업무로 비교할 준비입니다.
01. ‘구글이 돌아왔다’는 말, 근거가 있습니다
확인 기준: 2026년 10월 7일, 한국시간. Google이 9월 30일 발표한 새 모델의 정식 명칭은 Gemini 4 Argon입니다. 아르곤은 여러 단계를 오래 수행하는 코딩, 기업 지식 업무, 사이버보안 방어를 겨냥합니다. Google 공식 발표
외부 평가기관 Artificial Analysis의 Intelligence Index에서 아르곤은 53점을 기록했습니다. GPT-6 Astra와 같고, GPT-6.1 Sol보다 1점 높습니다.
| 모델·추론 설정 | 지능 지수 |
|---|---|
| Gemini 4 Argon · high | 53 |
| GPT-6 Astra · max | 53 |
| GPT-6.1 Sol · max | 52 |
Artificial Analysis의 9월 30일 공개 평가. 각 모델의 최고 추론 설정 기준이며, 이 지수는 정답률(%)이 아닙니다. 외부 평가 원문
이 결과는 ‘다시 비교해볼 만한 후보가 됐다’는 근거입니다. 1점 차이로 모든 실무의 우열이 결정되지는 않습니다. 또 ChatGPT와 Claude는 서비스 이름이기도 하므로, 실제 비교에서는 어떤 모델과 설정을 썼는지까지 맞춰야 합니다.

Google 캠퍼스 자료사진. Sam 촬영, 2025년 12월 공개. 아르곤 발표 현장이나 전용 연구시설을 보여주는 사진은 아닙니다. 사진 원본 · Unsplash License
02. Claude까지 넘었나요? 업무에 따라 달라집니다
Google이 공개한 비교표에서 네 가지 평가를 골라보면 강점과 한계가 함께 드러납니다. 아래의 Claude 비교 대상은 Opus 5.5입니다.
| 평가 | Argon | GPT-6 Astra | Opus 5.5 |
|---|---|---|---|
| 업무 자동화 | 51.3 | 41.4 | 42.5 |
| 코딩 A | 77.9 | 74.1 | 74.2 |
| 코딩 B | 55.0 | 65.5 | 62.3 |
| 터미널 작업 | 57.4 | 58.2 | 66.4 |
위에서부터 AutomationBench, DeepSWE 1.1, FrontierSWE 2, Terminal-Bench 4의 공개 점수입니다. 높을수록 좋습니다. 출처: Google DeepMind 성능표. 서로 다른 평가의 숫자를 직접 비교하거나 평균 내어 종합 순위로 해석하지 않습니다.
업무 자동화 평가와 한 코딩 평가에서는 아르곤이 앞섭니다. 하지만 다른 소프트웨어 개발 평가에서는 GPT가, 터미널 작업 평가에서는 Claude가 앞섭니다. ‘코딩을 잘한다’는 말 안에도 서로 다른 능력이 들어 있다는 뜻입니다.
이 표 전체가 동일한 실험실에서 같은 환경으로 재측정된 결과는 아닙니다. Google의 방법론 문서는 자체 측정, 공식 리더보드, 다른 제공사의 발표 수치를 함께 사용했다고 밝힙니다. 예를 들어 아르곤의 DeepSWE 결과는 Google이 mini-swe 실행 환경으로 측정했습니다. 평가 방법론
실무에서는 ‘코드를 써준다’보다 우리 저장소를 읽고, 수정하고, 테스트까지 통과시키는가가 더 구체적인 질문입니다. 보고서 업무라면 자료를 많이 읽는 능력과 출처를 정확히 연결하는 능력, 제출 형식을 지키는 능력도 따로 봐야 합니다.
03. 환각이 줄었다면, 답변은 더 믿어도 될까요?
Artificial Analysis의 AA-Omniscience 평가에서 아르곤의 환각률은 15%, 정확도는 50%였습니다. 모르는 답을 억지로 만드는 대신 모른다고 인정하는 성향이 강해졌다는 분석입니다. 이 두 수치는 서로 다른 지표이므로 더해서 100%가 돼야 하는 관계가 아닙니다. 평가 결과와 해석
이 변화는 고객지원이나 사내 검색에서 유용할 수 있습니다. 확인되지 않은 계약 조건을 자신 있게 만들어내는 것보다, 근거가 부족하다고 알리고 담당자에게 넘기는 편이 낫기 때문입니다. 이는 평가를 바탕으로 한 AXC의 실무적 해석이며, 해당 업무에서의 개선을 직접 측정한 결과는 아닙니다.
환각률 15%를 ‘모든 답변이 85% 정확하다’로 읽으면 안 됩니다. 특정 질문 집합과 평가 방식에서 나온 수치입니다. 한국어 문서, 회사별 용어, 최신 사내 규정에 대해서도 같은 성능을 보장하지 않습니다.
예를 들어 ‘이 고객은 환불 대상인가요?’라는 질문을 시험한다면 정답을 맞히는지만 볼 것이 아닙니다. 규정이 누락됐을 때 추가 자료를 요청하는지, 다른 고객의 조건을 섞지 않는지, 근거 문서를 정확히 가리키는지도 함께 확인해야 합니다.
04. 새로 발표됐지만, 모두 바로 쓸 수 있지는 않습니다
Google의 초기 배포 대상은 Fairwind 프로그램의 신뢰받는 사이버보안 전문가와 테스트 참여자입니다. 10월 2일 공식 후속 정리에서도 단계적 공개와 초기 피드백 수집을 설명했습니다. Google의 10월 2일 안내
확대 공개는 유료 API 고객과 Google AI Ultra 구독자부터 시작할 예정이라고 발표했습니다. 다만 구독만 하면 지금 즉시 아르곤을 쓸 수 있다는 뜻은 아닙니다. 확인 시점에 검토한 공식 안내에서는 일반 공개 완료나 모든 대상의 이용 시작일을 확인하지 못했습니다. 공식 배포 계획
도입을 준비한다면 순서가 있습니다.
- 실제 접근 권한: 사용하는 계정과 API에서 아르곤이 제공되는지 확인합니다.
- 업무 적합성: 동일한 입력과 평가 기준으로 현재 모델과 비교합니다.
- 운영 조건: 호출 한도, 데이터 처리 조건, 장애 시 대체 경로를 확인합니다.
벤치마크가 좋다는 이유만으로 고객에게 즉시 도입 일정을 약속하기는 이릅니다. 접근이 열리기 전에는 평가할 업무와 정답 기준을 준비해두는 것이 현실적입니다.
05. 가격도 따라잡았나요? 할인과 정가를 나눠봐야 합니다
공식 발표의 API 가격은 다음과 같습니다. 아래 금액은 100만 토큰당 미국 달러이며, 소비자용 월 구독료가 아닙니다.
| 구분 | 입력 | 출력 |
|---|---|---|
| 출시 할인 가격 | $2 | $10 |
| 할인 종료 후 안내 가격 | $4 | $20 |
캐시 등 별도 할인 조건은 제외한 기본 입력·출력 단가입니다. Google 가격 안내와 각주
Artificial Analysis가 측정한 지능 지수 과제당 비용은 할인 기준 $1.99였습니다. 같은 평가에서 GPT-6 Astra의 약 60%였지만, GPT-6.1 Sol의 약 2.7배였습니다. 동일한 사용량을 정가로 계산하면 아르곤은 $3.98로 올라갑니다. 따라서 ‘GPT보다 무조건 저렴하다’고 묶어 말할 수 없습니다. 과제당 비용 비교
견적에서는 토큰 단가 외에 실제로 소비한 양도 중요합니다. 한 번의 답변으로 끝나는 업무와 여러 번 추론하고 도구를 호출하는 업무는 비용 구조가 다릅니다. 재시도가 늘어나면 최종 결과 한 건을 얻는 비용도 올라갑니다.
AXC가 권하는 비교 기준은 ‘검토를 통과한 결과물 한 건의 총비용’입니다. 모델 사용료에 재시도, 외부 도구, 사람의 수정 시간을 함께 기록하세요. 처음부터 출시 할인과 정가의 두 시나리오로 계산하면 가격 변경 이후에도 도입 판단을 유지하기 쉽습니다.
06. 우리 회사에서는 무엇부터 비교하면 좋을까요?
아래는 AXC가 제안하는 평가 방법입니다. 아르곤의 실제 고객 성과나 도입 보장 사례를 뜻하지 않습니다.

노트북 개발 작업 자료사진. Clémence Taillez 촬영, 2020년 6월 공개. 아르곤 사용 장면이나 AXC 고객 사례는 아닙니다. 사진 원본 · Unsplash License
한 번에 대표 업무 세 가지를 비교하세요
| 시험할 업무 | 통과 기준의 예 |
|---|---|
| 고객 문의 초안 | 정책에 맞고, 모르는 내용은 확인 요청 |
| 문서 기반 보고서 | 수치·출처가 맞고, 지정 형식 준수 |
| 코드 수정 | 기존 동작 유지, 관련 테스트 통과 |
업무별로 쉬운 사례만 고르지 말고, 정보 누락·상충하는 문서·예외 규칙이 있는 사례도 넣습니다. 처음에는 각 업무에서 10개 정도의 표본으로 차이를 찾고, 중요한 차이가 보이면 표본을 넓혀 확인하는 방식으로 시작할 수 있습니다. 10개가 충분한 통계 검증이라는 뜻은 아닙니다.
입력과 기회를 맞춰야 결과를 믿을 수 있습니다
같은 원자료, 같은 도구 접근권한, 같은 통과 기준을 사용합니다. 추론 설정과 시간·비용 상한도 기록하세요. 한 모델에는 여러 번 수정 기회를 주고 다른 모델에는 한 번만 묻는 식의 비교는 피합니다.
성공률뿐 아니라 완료 시간, 재시도 횟수, 사람의 수정 시간, 승인된 결과 한 건의 비용을 같이 남깁니다. 품질이 비슷하다면 운영 부담을 줄이는 모델이 더 적합할 수 있습니다. 반대로 단가가 낮아도 사람이 매번 고쳐야 한다면 이점이 줄어듭니다.
잘하는 업무부터 제한적으로 맡기세요
비교가 끝나면 모든 업무를 한꺼번에 옮기기보다, 기준을 통과한 업무부터 연결합니다. 보고서 초안은 새 모델로 만들되 계약 변경이나 고객에게 보내는 최종 메시지는 승인 단계를 거치게 할 수 있습니다.
모델이 바뀌어도 고객 데이터 접근권한, 실행 기록, 중단 수단은 유지해야 합니다. 이 구조는 AI 에이전트의 권한과 운영 통제에서 자세히 다뤘습니다.
07. 이번 소식에서 봐야 할 변화
아르곤의 등장은 기업이 최상위 AI를 고를 때 다시 비교할 후보가 생겼다는 소식입니다. 종합 지수와 특정 업무 점수는 가능성을 보여주지만, 실제 선택은 업무별 결과로 마무리해야 합니다.
AXC는 이번 변화를 여러 모델을 같은 업무 기준으로 평가하고 바꿔 쓸 수 있는 구조의 가치가 커진 신호로 봅니다. 모델 이름이 바뀔 때마다 업무 흐름을 처음부터 다시 만들 필요가 없도록, 입력 자료·도구 권한·평가 기준을 모델 선택과 분리해두는 방식입니다.
지금 할 일은 세 가지입니다. 아르곤의 접근 범위를 확인하고, 현재 모델의 업무 성과와 비용을 기록하고, 동일한 표본으로 새 모델을 비교할 준비를 하는 것입니다. 그러면 다음 모델이 등장해도 유행보다 근거를 먼저 보고 결정할 수 있습니다.
참고 자료와 이미지 출처
- Google — Gemini 4 Argon 발표 · 2026년 9월 30일. 모델 성격, 초기 배포, 가격 확인.
- Google DeepMind — Gemini 성능표 · 비교 점수 확인. 게시 후 갱신될 수 있습니다.
- Google DeepMind — 아르곤 평가 방법론 · 자체 측정과 외부 발표 수치의 출처 구분.
- Artificial Analysis — 아르곤 외부 평가 · 2026년 9월 30일. 지능 지수, 환각·정확도, 과제당 비용 확인.
- Google — 9월 AI 업데이트 정리 · 2026년 10월 2일. 단계적 배포 상태 확인.
이 글은 공개 자료를 검토한 분석이며, AXC가 아르곤을 직접 실행해 측정한 결과는 아닙니다. 수치와 이용 조건은 2026년 10월 7일 확인 기준입니다.
표지는 AXC가 제작한 AI 생성 개념 이미지입니다. 본문의 실제 사진 두 장은 각 사진 아래에 작가·원본·라이선스를 표시했으며, 크기 축소와 WebP 변환만 적용했습니다.
내 일에는 어떻게 적용할까요?
Gemini 4 Argon은 일부 종합·업무 자동화 평가에서 최상위 모델과 경쟁할 수준을 보였습니다. 다만 코딩 평가에서도 승패가 갈리고, 일반 공개와 출시 할인 조건은 따로 확인해야 합니다. 지금 필요한 일은 전면 교체보다 우리 업무로 비교할 준비입니다.
내 일에 적용하기AI와 기술을 실제 업무에 연결합니다.
프로젝트 시작하기 


