Gemini 4 Argon, 구글 벤치마크 18개 중 12개 1위…내부선 "코딩 약하다" 평가도
퍼진 주장
“구글의 새 모델 Gemini 4 Argon은 벤치마크 점수와 달리 실제 사용에서는 성능이 떨어진다.”
출처 2개 · Newsmesis 검증

무슨 일이
구글이 공개한 자체 비교표에서 Gemini 4 Argon은 장기 소프트웨어 개발 벤치마크 DeepSWE v1.1 점수가 77.9%로, 앤트로픽의 Claude Opus 5.5(74.2%)를 앞섰다. 그런데 블룸버그는 10월 1일 일부 구글 직원이 이 모델이 실제 업무에서는 벤치마크만큼 성과를 내지 못하고 일부 코딩 작업에 어려움을 겪는다고 평가한다고 보도했다. 구글은 코딩 등에서 성능이 떨어진다고 말하는 것은 정확하지 않다고 반박했다. 현재 Argon은 검증을 거친 사이버 보안 방어 기관에만 제공되고 있어, 외부에서 실사용 성능을 확인하기는 아직 어렵다.
확인된 사실
- SiliconANGLE에 따르면 구글 비교표에서 Argon의 DeepSWE v1.1 점수는 77.9%로 Opus 5.5(74.2%)보다 높았고, GPT-6 Astra는 Opus 5.5보다 0.1%포인트 낮았다.
- SiliconANGLE에 따르면 VentureBeat는 구글 차트의 벤치마크 18개 중 12개에서 Argon이 단독 1위라고 집계했다. Terminal-Bench 4.0은 Opus 5.5가, FrontierSWE v2는 Astra가 앞섰다.
- 9to5Google이 전한 블룸버그 보도에 따르면 일부 구글 직원은 실제 업무에서 성능이 떨어지고 일부 코딩 작업에 약하다고 했다. 반면 다른 직원은 최전선 모델이라는 데 폭넓은 공감대가 있다고 말했다.
- SiliconANGLE에 따르면 현재 이용 대상은 구글 내부 팀과 Fairwind 프로그램 회원뿐이다. 이 프로그램에는 크라우드스트라이크, 팰로앨토 네트웍스 등 650곳 넘는 기관이 가입했다. 유료 개발자와 AI Ultra 구독자에게 언제 열릴지는 정해지지 않았다.
- SiliconANGLE에 따르면 출시 기념 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며, 프로모션이 끝나면 Opus 5.5와 같은 4달러·20달러가 된다. 9to5Google도 정가 4달러·20달러에 도입 가격은 절반이라고 전했다.
아직 모르는 것
- 어느 쪽 의견이 얼마나 많은지는 알 수 없다. 9to5Google이 전한 블룸버그 보도는 신원이 밝혀지지 않은 소수 직원의 발언을 양쪽에서 인용했을 뿐, 조사 결과가 아니다.
- 코딩 문제가 특정 작업에 한정된 것인지 모델 전반의 문제인지 확인되지 않았다. 구글은 부진하다는 표현 자체를 부인하고 있고, Argon의 코딩 성능을 독립적으로 평가한 결과도 아직 나오지 않았다.
- 벤치마크 우위가 독립 검증에서도 유지될지는 미지수다. 18개 비교표는 구글이 직접 만든 것이고, 대부분의 개발자가 쓰게 될 모델은 사이버 제한이 걸린 버전이다.
- 확대 공개 시점과 그 전에 모델이 바뀔지는 알려지지 않았다.
왜 중요한가
코딩 에이전트용으로 Argon, Opus 5.5, GPT-6 Astra 중 하나를 고르려는 개발자는 독립 검증이 가능해질 때까지 구글이 직접 내놓은 벤치마크 표에 의존해야 한다. 프로모션이 끝나면 Argon의 가격은 Opus 5.5와 같아지기 때문에, 벤치마크와 실사용 성능의 차이는 곧 비용 대비 효율 문제가 된다.
주장
- 확인됨구글 자체 차트에서 Gemini 4 Argon은 DeepSWE v1.1에서 77.9%를 기록해 Claude Opus 5.5(74.2%)를 앞섰다.
- 확인됨VentureBeat는 구글 차트의 벤치마크 18개 중 12개에서 Argon이 단독 1위라고 집계했다.
- 확인됨블룸버그는 구글 직원들이 Gemini 4의 실제 성능이 벤치마크 점수와 항상 일치하지는 않는다고 봤다고 보도했다.
- 미확인Gemini 4 Argon은 실제 사용에서 일부 코딩 작업에 어려움을 겪는다.
- 확인됨구글은 Gemini 4가 코딩 등에서 성능이 떨어진다고 말하는 것은 정확하지 않다고 밝혔다.
- 확인됨Argon은 현재 구글 내부 팀과 650곳 넘는 기관이 가입한 Fairwind 프로그램 회원만 쓸 수 있다.
- 확인됨Argon의 출시 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며 프로모션 후 4달러·20달러가 된다.
- 확인됨Argon의 출력 한도는 100만 토큰으로, 이전 Gemini 모델의 6만 4천 토큰에서 늘었다.
관련 기사
이 기사를 믿어도 되는 이유
65%출처 지도 · 매체 2곳 / 기사 2건
- SiliconANGLE
- 기사 1siliconangle.comreport
- 9to5Google
- 기사 19to5google.comreport
신뢰도 점수 산정 방식
- 출처 신뢰도
- 교차 확인
- 1차 출처
- 본문 대조 검증 주장
- 반대 증거 없음
- 안정화
- 출처 표기
- AI 공개
본문 대조 검증 주장은 인용 출처 본문과 atom 단위로 일치함. 가중치는 고정, 설명 가능함.
사람 책임성
- 독립 출처 그룹 2개 / 출처 2개
- Drafted by the Newsmesis judgment agent (agent-cli); human approval required before publishing.
검증 장부 · 8
- 주장: 구글 자체 차트에서 Gemini 4 Argon은 DeepSWE v1.1에서 77.9%를 기록해 Claude Opus 5.5(74.2%)를 앞섰다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
- 주장: VentureBeat는 구글 차트의 벤치마크 18개 중 12개에서 Argon이 단독 1위라고 집계했다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
- 주장: 블룸버그는 구글 직원들이 Gemini 4의 실제 성능이 벤치마크 점수와 항상 일치하지는 않는다고 봤다고 보도했다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
- 주장: Gemini 4 Argon은 실제 사용에서 일부 코딩 작업에 어려움을 겪는다.상태: 미확인검증 경로미검증검증자 검증 시스템
출처 본문 기준 atom 단위 검증 없음.
- 주장: 구글은 Gemini 4가 코딩 등에서 성능이 떨어진다고 말하는 것은 정확하지 않다고 밝혔다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
- 주장: Argon은 현재 구글 내부 팀과 650곳 넘는 기관이 가입한 Fairwind 프로그램 회원만 쓸 수 있다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
- 주장: Argon의 출시 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며 프로모션 후 4달러·20달러가 된다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
- 주장: Argon의 출력 한도는 100만 토큰으로, 이전 Gemini 모델의 6만 4천 토큰에서 늘었다.상태: 확인됨검증 경로검증됨검증자 검증 시스템
추출된 atom 하나 이상이 인용 출처 본문과 일치 확인됨.
업데이트 로그 · 0
AI는 가속, 승인은 사람.