미스트랄 Large 4, 보안 82% 대 독립 종합 32위

보안 점검에 AI를 쓰려다 “그건 도와드릴 수 없습니다”라는 답을 받아 본 적이 있다면, 오늘 나온 모델 이야기가 남의 일이 아니다. 프랑스 미스트랄(Mistral AI)이 2026년 10월 6일 미스트랄 Large 4(Mistral Large 4, 이하 ML4)의 공개 미리보기를 냈다. 발표문에 따르면 실제 오픈소스 소프트웨어의 취약점을 재현한 뒤 고치게 하는 시험에서 ML4는 82%로 모든 모델 중 가장 높았고, 클로드 오퍼스 5.5와 GPT-6 Astra는 거의 0점이다.
미스트랄이 붙인 이유는 “못해서”가 아니라 “거절해서”다. 방어하는 쪽은 취약점이 진짜인지 직접 재현해 보는 데서 시작하는데, 닫힌 모델의 안전장치가 바로 그 작업을 막을 수 있다는 설명이다. 그런데 독립 평가 기관 Vals AI가 같은 날 올린 종합 지수에서 ML4는 44개 모델 중 32위다. 한 모델에 두 얼굴이 있는 셈이라, 이 글은 두 숫자를 나란히 놓고 읽는다.
이 글은 세 부류를 위해 쓴다. 코딩 에이전트나 사내 도구에 붙일 오픈 모델을 고르는 개발자, 보안 업무에 AI를 쓰고 싶은 사람, 그리고 “오픈웨이트”나 “MoE”라는 말을 처음 들어 보는 사람이다. 용어는 처음 나올 때 풀어 쓴다.
근거는 미스트랄 공식 발표문 전문, 같은 날 열린 미스트랄 모델 문서 페이지, Vals AI의 모델별 결과 페이지, Hacker News 반응이다. 발표문의 벤치마크 숫자는 전부 미스트랄이 직접 적은 값이고, 일부는 외부 기관이 쟀다고 하지만 이 사이트가 그 원자료를 열어 재현한 것은 없다. 반대로 Vals AI 숫자는 이 사이트가 페이지에서 직접 읽은 값이다. 모델 가중치(학습된 숫자 파일)는 아직 풀리지 않아서 파일을 열어 확인한 내용도 없다.
미스트랄 Large 4에서 지금 쓸 수 있는 것과 아직 없는 것
미스트랄은 이번 공개를 “퍼블릭 프리뷰”라고 부른다. 정식 출시가 아니라 계속 다듬는 중인 미리보기라는 뜻이고, 발표문도 “빠르게 개선되고 있다”고 쓴다.
| 항목 | 상태 |
|---|---|
| API | 오늘부터 미스트랄 스튜디오에서 미리보기 API로 사용 가능, 모델 이름은 mistral-large-4 |
| 가중치 | “이달 말까지 공개” 예고, 지금은 없음 |
| 라이선스 | 발표문과 모델 문서 어디에도 적혀 있지 않음 |
| 구조 상세·추가 벤치마크·후처리 방법 | 가중치와 함께 공개 예고 |
| 사이버 능력 확장판 | 보안 업계 리더·검증된 파트너·국가기관에게 “완화된 검열”로 먼저 제공해 레드팀(공격 시험) 중 |
오픈웨이트는 가중치 파일을 누구나 내려받아 자기 서버에서 돌릴 수 있게 푼다는 뜻이다. 소스 코드까지 전부 여는 오픈소스와는 다르지만, 내 환경에서 돌리고 내 업무에 맞게 추가 학습(미세조정)까지 할 수 있다는 점이 핵심이다. ML4는 아직 이 단계 앞에 서 있다. 그래서 지금 하는 이야기는 “공개된 API로 잰 점수”이고 “내 서버에서 돌려 본 결과”가 아니다.
1조 개 중 490억 개만 일하고, 한 번에 100만 토큰을 읽는다
모델 문서 페이지가 적은 사양은 이렇다.
| 항목 | 내용 |
|---|---|
| 구조 | 세분화된 전문가 혼합(MoE) |
| 총 파라미터 | 1.05조 개(발표문은 “1조”로 표기) |
| 토큰당 활성 파라미터 | 490억 개 |
| 이미지 인코더 | 16억 개 |
| 맥락 길이 | 100만 토큰 |
| 입력 | 텍스트와 이미지 |
| 학습 데이터 | 160개 넘는 언어, EU 공식 언어 전부 포함 |
| 학습 장비 | 엔비디아 Grace Blackwell GPU 3,800개, 유럽 내 미스트랄 자체 데이터센터 |
MoE(전문가 혼합)는 모델 안에 전문가 역할의 작은 덩어리를 아주 많이 두고, 토큰 하나를 처리할 때마다 그중 일부만 불러 쓰는 구조다. 회사에 전문가가 수백 명 있어도 한 안건에는 몇 명만 회의에 들어오는 것과 같다. 자세한 설명은 리플렉션 Beam 글에 풀어 뒀다.
두 숫자가 각각 다른 비용을 정한다. 총 파라미터 1.05조는 메모리를, 활성 파라미터 490억은 속도와 연산량을 정한다. 490억은 전체의 약 4.7%다. 파일 크기만 단순 계산하면 이렇다. 아래는 이 사이트의 계산이고 미스트랄이 낸 숫자가 아니다. 돌릴 때는 맥락 저장 공간 같은 여유 메모리가 더 든다.
| 숫자 표현 | 파라미터 1개당 | 1.05조 개일 때 파일 크기(단순 계산) |
|---|---|---|
| 16비트 | 2바이트 | 약 2,100GB |
| 8비트 | 1바이트 | 약 1,050GB |
| 4비트 | 0.5바이트 | 약 525GB |
4비트로 줄여도 525GB라서 일반 PC는 물론 고급 워크스테이션 한 대로도 어렵고, 서버급 장비가 필요하다. 이 사이트가 앞서 확인한 GLM-5.3의 총 파라미터는 7,533억 개이니 ML4는 그보다 약 1.4배 크다. 같은 날 다룬 Beam(5,010억 개, 활성 230억 개)과 비교하면 총 크기와 활성 크기가 둘 다 약 2.1배다. Qwen3.8-Max는 총 2.4조 개에 활성 950억 개였으니, ML4의 총 크기는 그 약 44%, 활성 크기는 약 절반이다.
거절하는 모델은 0점을 받는다: 보안 시험 82%의 속사정
발표문의 사이버 보안 대목이 이 모델의 간판이다. 미스트랄이 적은 숫자는 세 가지다.
- Artificial Analysis(AI 모델을 독립적으로 비교하는 곳)의 사이버 지수에서 세계 5위권이고, 중국 밖에서 만든 오픈웨이트 모델 중에서는 “큰 차이로” 1위다.
- 그 지수의 시험 하나, 곧 실제 오픈소스 소프트웨어의 취약점을 재현한 뒤 패치까지 하게 하는 시험에서 82%로 전 모델 중 최고다.
- 보안 대회 문제 40개를 모은 Cybench에서 93%를 풀었다.
그리고 같은 대목에 이 문장이 있다. 클로드 오퍼스 5.5와 GPT-6 Astra 같은 선두 닫힌 모델은 같은 시험에서 거의 0점인데, 그 작업을 거절하기 때문이라는 것이다. 미스트랄의 논리는 이렇다. 소프트웨어를 지키는 일은 “이 결함이 진짜다”를 직접 재현해 보는 데서 시작하는데, 닫힌 모델의 안전 필터가 그 요청을 공격 행위로 보고 막을 수 있다. 사고 대응 중에 쓰던 모델이 갑자기 거절을 시작하면 그 자체가 보안 위험이라는 주장도 덧붙인다.
여기서 읽을 때 걸리는 것이 세 가지 있다.
첫째, 점수의 원인은 미스트랄의 설명이다. 거의 0점이라는 사실과 “거절해서”라는 해석을 함께 적었을 뿐, 그 모델들이 실제로 어떤 문장으로 거절했는지는 발표문에 없다. 이 사이트가 이 해석을 직접 재현하지는 못했다.
둘째, 어느 버전으로 쟀는지가 적혀 있지 않다. 발표문은 레드팀 파트너가 같은 모델을 “완화된 검열과 확장된 사이버 능력”으로 쓴다고 쓴다. 지금 누구나 쓰는 미리보기 API가 82%를 낸 바로 그 설정인지 알 수 없다.
셋째, 거절을 덜 한다는 말과 반대되는 숫자도 같이 있다. 발표문은 ML4가 JailbreakBench, StrongREJECT, AgentHarm의 사이버 관련 악성 요청에서 거절률이 모든 오픈 모델보다 높다고도 쓴다. 두 말을 같이 읽으면 “취약점 재현·패치 같은 방어 작업은 하고, 악의적인 요청은 막는다”는 구분이 된다. 문제는 그 선이 어디인지 발표문이 설명하지 않는다는 점이다. 보안 업무에 쓰려는 사람이 가장 먼저 시험해 볼 부분이 이곳이다.
독립 평가 Vals AI에서는 종합 32위, 법률 하나는 6위다
발표문만 읽으면 “다 잘하는 모델”처럼 보이기 쉽다. 그래서 같은 날 Vals AI가 올린 ML4 결과 페이지를 열어 같은 방식으로 잰 다른 모델과 나란히 놓았다. 이 글을 쓴 10월 6일 밤 기준이고, 점수는 앞으로 바뀔 수 있다. 괄호 안은 그 시험을 친 모델 수 중 순위다.
| 시험 | Large 4 | GLM 5.3 | DeepSeek V4 Pro 0813 | GPT-6 Astra | 클로드 오퍼스 5.5 |
|---|---|---|---|---|---|
| Vals Index(종합) | 48.05% (44개 중 32위) | 53.51% (16위) | 47.63% (34위) | 63.13% (6위) | 66.97% (3위) |
| Finance Agent v2 | 54.68% (22위) | 55.84% (18위) | 50.39% (39위) | 53.54% (28위) | 58.59% (9위) |
| Harvey’s Legal Agent | 15.83% (75개 중 6위) | 8.33% (23위) | 7.50% (24위) | 5.42% (31위) | 3.75% (38위) |
| Terminal-Bench 4.0 | 22.73% (44개 중 20위) | 38.89% (10위) | 14.14% (27위) | 59.60% (3위) | 65.15% (1위) |
표에서 읽을 수 있는 것을 정리하면 이렇다.
-
종합 지수에서 ML4는 DeepSeek V4 Pro 0813과 사실상 같은 줄이다. 48.05%와 47.63%는 차이가 0.42점인데 오차 범위(±1.1)보다 작다. GLM 5.3보다는 5.46점 낮고, 오퍼스 5.5와는 18.92점 벌어진다.
-
법률 에이전트 시험은 정말 6위다. 다만 점수 자체가 낮은 시험이다. 표의 다섯 모델 모두 15.83% 이하이고, 오퍼스 5.5는 3.75%다. 시험이 어려운 편이라는 뜻이지 “법률을 정복했다”는 뜻은 아니다. 같은 Vals AI의 Legal Research Bench에서는 ML4가 31.73%(74개 중 38위)로 GPT-6 Astra의 39.42%(27위)보다 낮다. 법률이라는 말이 붙은 시험 가운데 하나에서 앞섰다는 정도로 읽어야 한다.
-
금융 에이전트에서 GPT-6 Astra를 넘었다는 발표문 주장은 맞지만 간발이다. 54.68% 대 53.54%로 1.14점 차이이고, Astra 쪽 오차가 ±2.08이라 구간이 겹친다. GLM 5.3(55.84%)은 ML4보다 높다.
-
터미널 코딩 시험은 모델 사이가 크게 갈린다. ML4는 DeepSeek V4 Pro 0813은 이겼지만 GLM 5.3(38.89%)에는 16.16점 뒤진다.
-
거절률은 이 시험들에서 거의 문제가 아니다. Vals AI 페이지는 종합 지수 시험 전체에서 오퍼스 5.5의 거절률을 0.79%, GPT-6 Astra를 0.29%로 적는다. 금융·법률 같은 업무형 시험에서는 닫힌 모델도 거의 거절하지 않는다는 뜻이라, 거절 문제가 보안 요청에 몰려 있다는 미스트랄의 설명과 모순되지 않는다. 다만 이 숫자가 그 설명을 입증하지는 않는다. 보안 시험의 거절률은 이 페이지에 없고, ML4 쪽 거절률도 표시돼 있지 않았다.
그리고 두 가지 불일치가 눈에 띈다. 첫째, 발표문은 Terminal-Bench 4가 **28.3%**라고 쓰는데 Vals AI의 값은 **22.73%**다. 발표문의 숫자는 Artificial Analysis가 아직 공개하지 않은 평가 도구로 비공개 측정한 값이라고 각주에 적혀 있고, Vals AI는 다른 설정으로 쟀다. 같은 이름의 시험이라도 어떤 도구로 돌리느냐에 따라 점수가 바뀐다는 뜻이다. 둘째, 모델 문서는 맥락 길이를 100만 토큰으로 적는데 Vals AI 페이지는 51만 2천 토큰(512k), 최대 출력은 25만 6천 토큰으로 적는다. 어느 쪽이 지금 API의 실제 한도인지는 확인하지 못했다.
코딩 점수: 자사 숫자 넷과 사람이 매긴 점수 하나
발표문이 직접 밝힌 코딩 숫자는 이렇다.
| 시험 | ML4 점수 |
|---|---|
| DeepSWE v1.1 | 61.7% |
| SWE-Atlas-QnA | 59.4% |
| Terminal-Bench 4 | 28.3% |
| 코딩 에이전트 종합 지수 | 49.8%, DeepSeek V4 Pro 0813과 Qwen3.8 Max보다 위 |
비교 대상 점수는 발표문의 차트 이미지 안에 있어 글자로 읽을 수 없었다. 그래서 이 사이트가 확인한 건 미스트랄이 문장으로 밝힌 서열까지다. 다른 숫자는 하나 더 있다. 미스트랄은 Surge AI와 전문 평가자가 모델 이름을 가리고 코딩 품질을 1~5점으로 매기게 했다.
| 모델 | 평균 점수 |
|---|---|
| 클로드 오퍼스 5 | 4.22 |
| 미스트랄 Large 4 미리보기 | 3.74 |
| GLM-5.3 | 3.60 |
| Kimi K3 | 3.59 |
| GLM-5.2 | 3.40 |
5개 중 2위다. 이 표의 비교 상대가 오퍼스 5이고 오퍼스 5.5가 아니라는 점은 짚어 둔다. ML4와 GLM-5.3의 차이는 0.14점인데, 평가자 수나 표본 수가 발표문에 없어서 이 차이가 의미 있는지는 알 수 없다. 오퍼스 5와의 차이 0.48점은 더 분명하다. 이 사이트가 오퍼스 5.5 글에서 확인한 가격과 성능을 같이 놓고 보면, 닫힌 최상위 모델과의 거리는 아직 있다는 쪽이 정직한 읽기다.
업무 자동화·이미지·안전 쪽 숫자
발표문은 코딩 밖에서도 앞섰다고 말한다. 숫자만 옮기면 이렇다.
- AutomationBench: 지메일·구글 시트·슬랙·세일즈포스 같은 앱에 걸친 업무 흐름 657개. ML4는 59.9%이고 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro보다 위라고 한다.
- AA-Briefcase: 긴 지식 업무를 보는 시험. 1,393 Elo로 DeepSeek V4 Pro보다 위다.
- Dense 200(이미지 속 대상을 짚어내는 시각 시험): ML4 42%, GPT-6 Astra 41%. 1점 차이다.
- Lakera B3 공격 저항(숨겨진 지시문으로 모델을 속이는 공격을 얼마나 막는지): 93.3%. 미스트랄은 경쟁 모델 중 이보다 높은 점수를 보지 못했다고 쓴다.
- KORA(사용자에게 책임 있게 응답하는지 본다고 발표문이 소개하는 평가): 2점 만점에 1.691점. 미스트랄이 측정한 오픈 모델 중 최고 점수라고 한다.
이 숫자들도 대부분 미스트랄이 발표문에 적은 값이다. 앞 절에서 확인했듯 Vals AI라는 독립 눈금으로 다시 보면 “앞섰다”의 폭이 달라질 수 있다. 다만 이미지 쪽은 아직 독립 검증을 찾지 못했고, 발표문도 “일부 영역에서 닫힌 모델을 넘는다”고 표현을 좁혀 쓴다.
가격: 정가 옆에 절반 값이 같이 적혀 있다
발표문 하단의 카드와 Vals AI 페이지가 적은 가격은 입력 100만 토큰당 1.36달러, 출력 100만 토큰당 4.18달러다. 모델 문서 페이지에서는 이 숫자에 줄을 긋고 바로 옆에 절반 값을 나란히 적어 두었다.
| 항목(100만 토큰당) | 줄 그은 값 | 옆에 적힌 값 |
|---|---|---|
| 입력 | 1.36달러 | 0.68달러 |
| 캐시된 입력(이전에 보낸 같은 내용을 다시 보낼 때) | 0.14달러 | 0.07달러 |
| 출력 | 4.18달러 | 2.09달러 |
페이지에는 절반 값이 어떤 조건에서 적용되는지 설명이 없었다. 같은 문서의 다른 줄이 “배치 처리는 50% 할인”이라고 쓰고 있지만 그 말이 이 가격을 가리킨다는 근거는 없다. Hacker News의 한 댓글은 경쟁 모델 가격을 의식한 출시 할인으로 해석했는데, 추측이다. 그래서 아래 계산은 정가 기준으로 하고, 절반 값은 괄호로만 덧붙인다.
에이전트 작업 한 건이 입력 10만 토큰, 출력 2만 토큰을 쓴다고 가정해 보자(이 사이트의 가정이다).
- 입력 10만 토큰 = 0.1 × 1.36 = 0.136달러
- 출력 2만 토큰 = 0.02 × 4.18 = 0.0836달러
- 합계 약 0.22달러 (절반 값이면 약 0.11달러)
그런 작업을 하루 100건 돌리면 정가로 약 21.96달러(절반 값이면 약 10.98달러)다. 출력 단가가 입력의 약 3.1배라서 답이 길게 나오는 작업일수록 청구서가 출력 쪽으로 쏠린다. 캐시된 입력은 정가 입력의 약 10분의 1이니, 같은 긴 지시문을 반복해서 보내는 에이전트라면 캐시가 걸리는지부터 확인해야 한다.
단가표보다 더 눈여겨볼 값이 Vals AI 페이지에 있다. 종합 지수 시험 한 벌을 통째로 돌리는 데 든 비용과 시간이다.
| 모델 | 100만 토큰당 입력 / 출력 | 시험 한 벌 비용 | 걸린 시간 |
|---|---|---|---|
| DeepSeek V4 Pro 0813 | 1.32달러 / 3.96달러 | 3.352달러 | 64분 5초 |
| GLM 5.3 | 1.40달러 / 4.40달러 | 7.249달러 | 73분 13초 |
| 미스트랄 Large 4 | 1.36달러 / 4.18달러 | 13.78달러 | 105분 50초 |
| GPT-6 Astra | 10.00달러 / 50.00달러 | 18.46달러 | 27분 48초 |
| 클로드 오퍼스 5.5 | 4.00달러 / 20.00달러 | 32.14달러 | 79분 0초 |
ML4의 단가는 DeepSeek V4 Pro 0813이나 GLM 5.3과 거의 같은데, 시험 한 벌 비용은 각각 약 4.1배와 약 1.9배다. 이 페이지에는 토큰 사용량이 따로 적혀 있지 않지만, 단가가 비슷하고 청구액이 다르면 같은 일에 토큰을 더 쓴 것으로 읽는 게 자연스럽다. 이 사이트의 추정이고, 캐시 적용 여부나 추론 강도 설정 같은 변수가 있다. 걸린 시간은 미리보기 서버 부하의 영향도 받으니 가장 느렸다는 사실만 적어 둔다. 값이 싸 보이는 단가표와 실제 청구액이 갈리는 지점은 제미나이 3.8 플래시 글에서도 같은 방식으로 확인한 적이 있다.
점수가 말해 주지 않는 것
발표문과 모델 문서, Vals AI 페이지를 다 읽고도 남는 빈칸이 있다.
- 라이선스. 가중치가 풀릴 때 어떤 조건이 붙는지 모른다. 상업적 사용이나 재배포에 제한이 있으면 “오픈”의 무게가 달라진다.
- 82%가 어느 설정에서 나왔는지. 위에서 짚은 대로 일반 API인지 완화된 검열 버전인지 밝혀지지 않았다.
- 발표문 속 숫자의 독립 재현. Terminal-Bench 4처럼 도구가 다르면 점수가 바뀐다는 것이 오늘 확인됐다. 나머지도 같은 눈금으로 다시 잰 값이 나와야 비교가 된다.
- 맥락 길이. 100만인지 51만 2천인지 지금 API가 어느 쪽인지.
- 블라인드 평가의 규모. Surge AI 평가의 평가자 수, 문항 수, 오차.
Hacker News 반응도 갈렸다. 한쪽은 “벤치마크가 예상보다 좋다”, “비전과 사이버 점수가 인상적이다”였고, 다른 쪽은 “중국 회사들이 연구를 공개하니 따라잡는 게 당연하다”, “미스트랄이 최전선을 한 번이라도 밀어 올린 적이 있느냐”였다. 이 사이트가 읽은 범위에서는 둘 다 일부 맞다. 종합 지수는 중하위권이고, 법률 에이전트·보안 같은 좁은 시험에서 앞서 나가는 모양이다.
미스트랄 Large 4를 지금 써 볼 사람과 기다릴 사람
지금 해 볼 만한 사람은 보안 업무에 AI를 쓰다 거절에 막힌 사람이다. 스튜디오에서 미리보기 API를 열어 평소 막히던 방어 작업 한두 개(공개된 취약점 재현, 탐지 규칙 작성, 의심 코드 분석)를 그대로 넣어 보면, 82%라는 숫자가 내 일에서도 통하는지 바로 보인다. 같은 요청을 지금 쓰는 모델에도 넣어 거절 여부를 기록해 두면 비교 기준이 생긴다.
기다릴 만한 사람은 자체 서버에 올리려는 사람이다. 1.05조 파라미터는 4비트로 줄여도 525GB라서 장비 계획을 세우려면 가중치 파일의 실제 크기와 라이선스가 먼저 나와야 한다. 이달 말 공개를 기다리는 것이 맞다.
코딩 에이전트에 붙일 모델을 고르는 사람은 오늘 결론을 내릴 필요가 없다. 독립 눈금에서는 터미널 코딩 시험이 GLM 5.3보다 낮고, 종합 지수는 DeepSeek V4 Pro 0813 근처다. 가중치가 풀리고 다른 평가 기관이 같은 눈금으로 다시 쟀을 때 비교해도 늦지 않다. 가격이 정가인지 절반 값인지도 그 전에 정리될 가능성이 크다.
미스트랄은 ML4를 30억 유로 시리즈D 자금으로 세운 계획의 첫 이정표라고 소개한다. 발표문은 그 투자를 유럽 기술 기업이 모은 역대 최대 지분 투자라고 적었다. 가중치와 구조 설명이 풀리는 이달 말이 이 글의 빈칸이 채워지는 시점이다.