본문으로 건너뛰기
effidevFlutter · Cloudflare 엣지 · 클라우드 비용 최적화

클라우드플레어 Clef 공개, 제브보다 13배 빠른 버전

effidev

바늘이 빠르게 돌며 빛의 잔상을 남기는 작은 유리 다이얼과 바늘이 거의 움직이지 않은 큰 유리 다이얼이 유리 선반 위에 나란히 놓인 인디고·푸시아 톤 일러스트

고객 문의가 들어올 때마다 “급한 건가, 어느 팀으로 보낼까”를 AI에게 묻는 코드를 짜 본 적이 있다면, 이번 소식은 비용과 속도 계산을 다시 하게 만든다. 클라우드플레어가 2026년 10월 1일 판단 전용 모델 Clef(클레프) 와 Clef-flash를 공개했다. 클라우드플레어 Clef는 문장을 쓰지 않고 선택지마다 확률만 돌려준다. 그 덕에 가벼운 쪽의 응답 시간 중간값이 38.8밀리초(0.0388초)로 나왔다. 같은 표에서 비교 상대인 제브(Jev)는 524.1밀리초다.

이 글은 세 부류를 위해 쓴다. 챗봇 모델을 불러 분류·라우팅 같은 단순 판단을 시키고 있는 개발자, 그 호출 비용이 슬슬 신경 쓰이는 사람, 그리고 판단 전용 모델이라는 말을 처음 들어 본 사람이다. 용어는 처음 나올 때 풀어 쓴다.

근거는 클라우드플레어 공식 블로그의 발표문, Workers AI 모델 문서와 가격표, 허깅페이스 모델 페이지다. 점수와 속도는 전부 클라우드플레어가 직접 잰 값이라 독립 검증을 거치지 않았다. 그 점은 글 내내 짚는다. Clef가 올라탄 바탕 모델 중 큰 쪽은 앞서 다룬 Qwen3.8-27B 공개 글의 그 모델이다.

판단 전용 모델은 문장 대신 선택지에 확률을 붙인다

보통 챗봇 모델(LLM)은 글을 한 글자씩 이어 쓰면서 답한다. “이 문의는 급한가?“를 물으면 “네, 결제가 안 되고 있어서 급해 보입니다” 같은 문장이 돌아오고, 코드는 그 문장을 다시 읽어서 분기해야 한다. 같은 질문에도 답이 조금씩 달라질 수 있다.

판단 전용 모델(decision model) 은 질문과 선택지를 미리 정해 주면 선택지마다 확률만 돌려준다. 클라우드플레어가 든 예시가 이렇다. 고객 문의 “결제가 한 시간째 모든 고객에게 실패하고 있다”를 넣고 세 가지를 묻는다.

모델은 각 질문마다 허용된 선택지 전부에 확률을 붙여 돌려준다. 코드는 그 숫자를 보고 티켓을 배정하거나, 에스컬레이션을 걸거나, 확률이 낮으면 사람에게 넘긴다. 클라우드플레어는 이걸 “사람이 매번 끼지 않아도 에이전트가 판단하고 움직일 수 있다”는 말로 설명했다.

이 개념이 갑자기 나온 건 아니다. 앞서 타입세이프(Typesafe AI)가 2026년 9월 15일 판단 전용 모델 제브를 선보이며 화제가 됐다. 이번 발표문은 첫 문단에서 제브의 열기를 직접 언급하고, 제브와 API가 호환된다고 밝힌다. 그래서 제브를 쓰던 코드는 모델 이름만 바꿔서 시험해 볼 수 있다.

클라우드플레어 Clef는 직접 만든 두 모델이다

발표문과 모델 문서를 합치면 두 모델의 사양은 이렇다.

항목 Clef Clef-flash
바탕 모델 Qwen3.8-27B Qwen3.5-9B
역할 정밀도 우선 지연 시간 우선
크기 27B 9B
입력 글, JSON, 이미지, 영상(모델 문서 기준) 같음
컨텍스트 창 65,536토큰 65,536토큰
라이선스 Apache-2.0 Apache-2.0
입력 100만 토큰당 가격 0.24달러 0.09달러

컨텍스트 창은 모델이 한 번에 읽을 수 있는 양이다. 발표문은 Clef의 창이 64k로, 제브의 32k보다 넓다고 밝혔다. 이미지를 읽는 비전 인코더가 붙은 점도 제브와 다르다고 했다. 제브는 지금 글만 분류한다는 설명이다.

가중치는 허깅페이스에서 내려받아 직접 돌릴 수 있고, 클라우드플레어의 Workers AI에서 호스팅 모델로도 쓸 수 있다. 허깅페이스 두 모델 페이지에 라이선스가 Apache-2.0으로 표시돼 있는 걸 직접 확인했다.

학습 방식도 한 문단은 짚어 둘 만하다. 발표문에 따르면 Clef는 바탕 모델 Qwen3.8-27B를 얼려 둔 채 판단용 헤드와 저차원 어댑터(rank-256)를 같이 학습시켰고, Clef-flash는 Qwen3.5-9B로 같은 방식을 썼다. 선택지 점수를 매길 때는 글을 한 글자씩 만들지 않고 입력을 한 번 읽은 뒤 선택지를 병렬로 채점한다. 이 구조가 빠른 이유라는 게 클라우드플레어의 설명이다.

응답 시간은 중간값 38.8밀리초 대 524.1밀리초

클라우드플레어가 43개 평가에서 잰 응답 시간은 이렇다.

항목 Clef Clef-flash Jev
중간값(ms) 209.3 38.8 524.1
p95(ms) 238.6 122.4 536.0

중간값은 요청 100개를 느린 순서로 줄 세웠을 때 가운데 요청의 시간이다. p95는 100개 중 95개가 이 시간 안에 끝난다는 뜻이다. 중간값 기준으로 Clef는 제브보다 약 2.5배, Clef-flash는 약 13.5배 빠르다. 같은 표에 있는 라야(Laya)는 5.8밀리초로 더 빠르지만, 아래 점수표에서 품질이 크게 떨어진다.

클라우드플레어는 자사 위협 분석팀에서 쓴 사례도 밝혔다. 웹사이트 도메인을 받아 가져오고, 화면을 그리고, 분류하는 흐름 전체에 Clef는 2.2초가 걸렸다. 같은 흐름에 가장 빠른 범용 모델 gpt-oss-120b를 쓰면 4.7초가 걸렸고 분류 결과도 두 개뿐이었다. 클라우드플레어는 Clef가 한 사이트를 패션 사이트일 확률 95%, 쇼핑몰 85%, 피싱 1% 미만처럼 여러 범주에 한꺼번에 확률을 붙여 분류하는 식이라고 소개했다. 4.7을 2.2로 나누면 2.1배다.

속도가 이 정도면 판단 호출을 사용자 요청 경로 한가운데에 넣는 게 현실적이다. 발표문도 Clef를 에이전트의 핫패스에 두고, 행동을 실행하는 건 Workers AI의 다른 LLM에 맡기는 구성을 권한다. 이때 모델이 클라우드플레어의 엣지 GPU에서 돌기 때문에 네트워크 지연도 줄어든다고 했다.

점수표는 8승 2패, 플래시는 7승 3패다

발표문의 벤치마크 표는 10개 평가에서 Clef, Clef-flash, 제브, 디퓨전젬마 제브, 케브 9B, 라야를 비교한다. 제브와 직접 맞붙은 칸만 정리하면 이렇다.

평가 Clef Clef-flash Jev
BFCL(도구 호출 정확도) 98.47 98.76 95.75
ToolRet(도구 검색) 69.19 66.43 65.28
API-Bank 91.93 93.11 88.19
가전 시나리오 82.95 97.73 52.27
When2Call 72.37 65.58 80.97
BANKING77(은행 문의 분류) 94.20 90.93 79.74
CLINC150+OOS 97.43 66.77 89.27
BRIGHT 45.91 39.26 47.52
Amazon ESCI 57.48 57.39 55.21
PhishNChips(피싱 판별) 79.60 75.05 62.55

Clef는 8칸에서 제브를 앞서고 When2Call과 BRIGHT 두 칸에서 뒤진다. Clef-flash는 7칸에서 앞서고 When2Call·CLINC150+OOS·BRIGHT 세 칸에서 뒤진다. 가장 눈에 띄는 건 flash의 CLINC150+OOS다. 큰 모델은 97.43인데 가벼운 모델은 66.77이라 30점 넘게 벌어진다. 속도를 얻은 대가가 어디서 나타나는지 보여 주는 칸이다.

When2Call은 “도구를 불러야 할 때와 아닐 때를 가리는” 평가다. 두 Clef 모두 제브가 우세하다. 에이전트가 도구를 언제 쓸지 정하는 용도라면 이 칸을 먼저 보는 게 좋다. 또 PhishNChips는 Clef가 제브를 앞서지만, 같은 표의 디퓨전젬마 제브가 85.35로 둘 다 앞선다.

타입세이프 자체 평가 세트에서 클라우드플레어는 Clef가 제브를 4개 영역 중 3개에서 이겼다고 밝혔다. 수치는 이렇다.

업무 흐름 Clef Clef-flash Jev
송장 처리 64.7 57.1 61.8
고객 응대 76.3 77 76.0
보안 사고 62.9 61.7 61.7
에이전트 추적 관찰 68.5 69.8 71.6

Clef가 이긴 세 칸의 격차는 0.3점에서 2.9점이라 “이겼다”보다 “비슷하다”에 가깝다. 에이전트 추적 관찰은 제브가 3.1점 앞선다. 발표문은 Clef-flash가 속도를 감안하면 예외적으로 잘한다고 평가했지만, 송장 처리에선 제브보다 4.7점 낮다.

가격은 입력 100만 토큰당 0.24달러와 0.09달러

Workers AI 가격표에는 Clef가 입력 100만 토큰당 0.24달러(21,818 뉴런), Clef-flash가 0.09달러(8,182 뉴런)로 올라 있다. 두 모델 모두 가격표에는 입력 단가만 적혀 있고 출력 단가 줄은 없다. 토큰은 AI가 글자를 세는 단위이고, 뉴런은 Workers AI가 뒤에서 청구에 쓰는 단위다. 1,000뉴런당 0.011달러다.

제브의 공개 가격은 발표(2026년 9월 15일) 당시 입력 100만 토큰당 0.042달러였고 출력은 무료라고 적혀 있었다. 얼리 액세스 단계에서 나온 가격이라 지금과 다를 수 있다. 이 값을 기준으로 놓으면 이렇게 된다.

모델 입력 100만 토큰당 제브 대비
Jev 0.042달러 1배
Clef-flash 0.09달러 약 2.1배
Clef 0.24달러 약 5.7배

판단 한 번에 입력이 1,000토큰이라고 가정해 1만 번 호출하면 입력은 1,000만 토큰이다. Clef는 2.4달러, Clef-flash는 0.9달러, 제브는 0.42달러가 든다. 챗봇 모델로 같은 일을 시키면 얼마나 드는지는 발표문이 적지 않았다. 다만 제브 발표문은 일반 챗봇 모델의 입력 가격을 100만 토큰당 0.2달러에서 10달러 사이로 적어 뒀다.

무료로 써 볼 수도 있다. Workers AI는 무료 플랜과 유료 플랜 모두에 하루 10,000뉴런을 무료로 준다. 이 숫자를 모델별 단가로 나누면 Clef는 입력 약 45만 8천 토큰, Clef-flash는 약 122만 토큰이다. 1,000토큰짜리 판단이라면 하루에 각각 약 458번, 약 1,222번이다. 계산은 직접 한 값이다. 가격표가 “유료 결제 수단이 필요하다”고 따로 적은 모델 목록(키미·GLM·딥시크 계열)에 이 두 모델은 들어 있지 않다.

하루 1만 건을 분류하면 한 달에 얼마인가

가격표를 월 단위로 옮기면 감이 온다. 고객 문의를 하루 1만 건 받고, 건당 입력이 1,000토큰이라고 가정하자. 입력이 하루 1,000만 토큰, 30일이면 3억 토큰이다. 출력 비용은 가격표에 줄이 없으니 0으로 놓았다.

선택 입력 단가(100만 토큰당) 한 달 입력 비용
Clef 0.24달러 72달러
Clef-flash 0.09달러 27달러
Jev(발표 당시 가격) 0.042달러 12.6달러
일반 챗봇 모델(제브 발표문이 적은 범위) 0.2~10달러 60~3,000달러

챗봇 모델 쪽은 입력 비용만 센 값이다. 같은 발표문은 출력이 입력보다 약 5배 비싸다고 적었으니, 문장으로 답하게 하면 실제 청구는 이보다 늘어난다. 반대로 말하면 가장 싼 챗봇 모델과 Clef는 월 60달러와 72달러로 비슷하다. 가격만 보면 Clef가 이기는 건 중간 이상의 챗봇 모델을 쓰고 있을 때다. 가장 값싼 챗봇 모델을 쓰는 사람에게는 속도와 확률 출력이 갈아탈 이유가 된다.

계산은 위 가정에서 나온 값이다. 문의가 길어 입력이 3,000토큰이면 비용도 3배다. 무료 할당 하루 10,000뉴런은 Clef 기준으로 1,000토큰짜리 약 458건이라 이 규모에는 턱없이 모자라고, 시험용으로만 맞는다.

직접 불러 보는 방법

문서의 예제는 아주 짧다. 계정 번호와 토큰을 넣고 모델 이름 @cf/cloudflare/clef로 요청을 보내면 된다. 요청에는 세 가지가 들어간다.

선택지는 criteria에 이름과 설명으로 적는다. 예를 들어 어느 팀이 맡을지 묻는 질문이면 결제는 “결제·송장·환불”, 기술은 “장애·오류·설정”, 영업은 “요금제와 업그레이드”로 적는 식이다. 선택지를 바꿔도 모델을 다시 학습시킬 필요가 없다. 발표문은 판단 전용 모델이 새 분류 항목을 넣으려고 계속 재학습하지 않아도 어떤 입력에든 쓸 수 있다고 설명한다.

이미지를 같이 넣으려면 images에 최대 4장까지, 장당 4MiB·1,600만 화소 이내로 직접 담아 보내야 한다. 외부 주소(URL)는 받지 않는다. 글이 너무 길면 모델의 토큰 한도에 맞춰 잘린다는 문구도 문서에 있다. 확률이 낮은 판단은 사람에게 넘기는 길을 따로 만들어 두는 게 안전하다.

이미 LLM 호출 비용을 에지에서 관리하고 있다면 Cloudflare AI Gateway로 LLM API 비용·장애 제어 글의 구성에 판단 호출을 하나 더 얹는 식으로 시작해 볼 수 있다.

같이 나온 강화학습 미세조정 서비스는 아직 사람이 붙는 단계다

발표문의 후반부는 모델이 아니라 서비스 이야기다. 클라우드플레어는 Clef를 고객 용도에 맞게 다시 학습시켜 주는 강화학습(RL) 미세조정 서비스를 시작한다고 밝혔다. 단 지금은 클라우드플레어의 현장 파견 엔지니어(FDE) 팀이 직접 붙는 방식이고, 그 경험을 바탕으로 나중에 고객이 데이터를 모으고 학습하고 다시 배포하는 셀프서비스 플랫폼을 만든다고 했다. 셀프서비스 일정은 적혀 있지 않다.

그림은 이렇게 그려진다.

  1. AI Gateway: AI 호출을 전부 거치게 하면 요청 기록이 자동으로 데이터셋이 된다
  2. Workers AI: 기본 Clef로 시험 답안(롤아웃)을 만든다
  3. Containers: 채점하고 에이전트 행동을 되풀이해 보는 RL 샌드박스
  4. Trainer(신규): 미세조정한 모델의 가중치를 갱신한다
  5. Workers AI + 모델 가져오기(BYO): 학습이 끝난 모델을 다시 Workers AI에 올린다

클라우드플레어는 이 구성이 레플리케이트(Replicate) 인수 이후 진행해 온 Workers AI의 모델 가져오기 작업과 이어진다고 밝혔다. 사내 용도로는 신뢰·안전 신고 분류, 지원 요청 분류, 좋은 크롤러와 나쁜 크롤러를 가르는 봇 제품이 후보로 언급됐다. 이 서비스는 이미 관련 제품을 쓰는 고객과 설계 협력 파트너를 먼저 찾고 있다.

발표문이 말하지 않은 것

가격과 속도가 눈에 띄는 만큼 빠진 것도 분명하다.

지금 해볼 만한 것 세 가지

  1. LLM으로 분류·라우팅을 시키는 호출 하나를 골라 Clef-flash로 바꿔 본다. 정확도와 지연 시간을 같은 입력 100~200건으로 나란히 재 보면 판단이 선다. 질문마다 확률 기준선(예: 0.8 이하면 사람에게)을 정해 두면 안전하다.
  2. 무료 할당으로 먼저 돌려 본다. 하루 10,000뉴런이면 Clef-flash 기준 1,000토큰짜리 판단을 1,200번 넘게 시험할 수 있다. 결과를 기록해 두면 모델을 바꿀 때 기준이 된다.
  3. AI 호출을 AI Gateway에 거치게 해 둔다. 발표문이 미세조정 재료로 꼽은 게 이 요청·응답 기록이다. 지금 쓰는 기능이 아니더라도 데이터는 쌓아 두는 쪽이 유리하다.

클라우드플레어 Clef는 아직 초기 서비스라고 발표문 스스로 밝혔다. 한 번에 갈아타기보다 호출 하나부터 시험하는 쪽이 맞다.

출처: Cloudflare 블로그 — Introducing Clef · Workers AI Clef 모델 문서 · Workers AI 가격표 · TypeSafe AI — Introducing System One Models & Jev