클로드 소넷 5.5 출시, 가격은 그대로인데 터미널 벤치마크가 10.3%에서 70.6%로 뛰었습니다

Anthropic이 9월 28일 클로드 소넷 5.5를 출시했습니다. 토큰 가격은 소넷 5와 같은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러입니다. Anthropic은 소넷 5보다 출력 속도가 30% 이상 빨라졌고 작업당 비용은 최대 30% 낮아졌다고 밝혔습니다.

가장 눈에 띄는 숫자는 에이전트 코딩 벤치마크 Terminal-Bench 4.0입니다. 소넷 5가 10.3%였는데 소넷 5.5는 70.6%이고 오퍼스 5.5의 66.4%보다도 높습니다. 아래에서 벤치마크와 가격, 오퍼스 5.5와의 차이, API 코드가 깨지는 변경점까지 차례로 정리했습니다.

Anthropic 소넷 5.5 발표 보기

클로드 소넷 5.5란 무엇인가

클로드 소넷 5.5는 Anthropic이 “속도와 지능의 최적 조합”이라고 소개하는 중간 등급 모델입니다. 오퍼스 5.5와 같은 5.5 세대이고 오퍼스 5.5보다 빠르며 가격은 절반입니다.

항목 내용
출시일 2026년 9월 28일
모델 ID claude-sonnet-5-5
컨텍스트 창 100만 토큰
최대 출력 12만 8천 토큰 (Batch API 베타는 30만 토큰)
가격 입력 2달러, 출력 10달러 (100만 토큰 기준)
입력과 출력 텍스트와 이미지 입력, 텍스트 출력
사고 방식 적응형 사고 (기본 노력 수준 high)
지식 기준일 2026년 6월
제공처 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry, Claude 앱

Claude 앱에서는 노력 수준(effort)의 기본값이 medium이고, API에서는 high입니다. 노력 수준은 low, medium, high, xhigh, max 다섯 단계이며 높을수록 오래 생각하고 비용도 늘어납니다.

벤치마크로 본 소넷 5와 소넷 5.5 차이

Anthropic이 발표한 벤치마크 비교. 발표 표의 점수로 직접 그렸다

발표된 8개 벤치마크 전체를 표로 옮기면 다음과 같습니다. 앞의 6개는 백분율이고 뒤의 2개는 점수(Elo) 방식이라 그래프에서 뺐습니다.

분야 벤치마크 소넷 5.5 소넷 5 오퍼스 5.5
에이전트 코딩 Terminal-Bench 4.0 70.6% 10.3% 66.4%
에이전트 코딩 FrontierCode 1.1 (Max) 46.2% 42.4% 54.4%
에이전트 코딩 CursorBench 4.0 55.5% 34.1% 57.8%
컴퓨터 사용 OSWorld 2.1 80.1% 57.0% 81.8%
추론 Humanity’s Last Exam 64.5% 54.9% 67.7%
시각 인식 Chartography 61.6% 15.6% 64.4%
지식 업무 GDPval-AA v2.1 1844 1449 1846
지식 업무 AA-Briefcase v1.1 1811 1359 1822

소넷 5.5는 8개 모두에서 소넷 5를 넘어섭니다. 오퍼스 5.5와의 격차는 대부분 몇 점 안쪽이고, Terminal-Bench 4.0에서만 소넷 5.5가 앞섭니다. 백분율 항목 중에는 FrontierCode 1.1(Max)이 8.2점 차이로 가장 크게 벌어져 있습니다.

Terminal-Bench 4.0은 10.3%에서 70.6%로, Chartography는 15.6%에서 61.6%로 올랐습니다. 소넷 5 점수가 특히 낮았던 두 항목에서 오른 폭이 가장 큽니다.

Anthropic은 소넷 5.5가 소넷으로는 처음으로 화면 스크린샷만 보고 포켓몬 레드를 클리어했다고 밝혔습니다.

발표 페이지에는 프롬프트 하나로 HTML 애니메이션을 만드는 데모 영상도 실려 있습니다. 찌르레기 400마리가 무리 지어 나는 군무, 바람이 만드는 모래 언덕, 작은 시계 24개로 만든 시계를 소넷 5.5와 소넷 5의 생성 속도를 나란히 비교한 영상입니다. 아래는 그 영상의 두 장면이고, 어느 모델의 화면인지는 영상에서 구분됩니다.

출처 : Anthropic 소넷 5.5 발표 페이지 데모 영상 한 장면 (© Anthropic)

출처 : Anthropic 소넷 5.5 발표 페이지 데모 영상 한 장면 (© Anthropic)

가격은 같은데 작업당 비용이 줄어든다는 말의 의미

토큰 단가는 소넷 5와 똑같습니다. 그런데 Anthropic은 작업 하나를 끝내는 데 드는 비용이 최대 30% 줄어든다고 설명합니다. 같은 일을 더 적은 토큰으로 끝내기 때문입니다.

발표에는 고객사의 수치가 실려 있습니다. 모두 Anthropic이 공개한 고객 평가이고 각사의 작업 조건에서 나온 값입니다.

고객사 발표 내용
Balyasny Asset Management 금융 작업에서 답변 하나에 약 12만 1천 토큰 사용 (소넷 5는 49만 7천 토큰)
Box 더 정확하고 2.4배 빠르며 전체 토큰 12% 절감
Zendesk 티켓 처리 20% 빨라짐
Atlassian Rovo 에이전트 최대 30% 빨라짐
Epic Games 수만 줄 코드 작업에서 상위 등급 모델 수준의 품질

토큰 사용량 차이는 가격표에 드러나지 않습니다. 단가가 같아도 답변 하나에 쓰는 토큰이 4분의 1이면 청구액도 그만큼 달라집니다. 다만 이 수치는 특정 작업에서 나온 값이라 내 작업에서도 같은 폭으로 줄어든다고 볼 수는 없습니다. 실제 비용은 내 프롬프트로 노력 수준별로 돌려 봐야 확인됩니다.

소넷 5.5와 오퍼스 5.5 가격 비교

항목 소넷 5.5 오퍼스 5.5
입력 (100만 토큰) 2달러 4달러
출력 (100만 토큰) 10달러 20달러
캐시 읽기 0.20달러 0.20달러
캐시 쓰기 (5분) 2.50달러 5달러
지연 시간 빠름 보통
기본 노력 수준 (API) high medium

Batch API로 요청하면 입출력 모두 50% 할인입니다. 소넷 5.5는 프롬프트 캐시를 읽을 때 기본 입력 가격의 10%만 냅니다. 소넷 5.5는 기본 단가가 오퍼스 5.5의 절반이라 위 벤치마크에서 격차가 작은 작업이라면 소넷 쪽 비용 효율이 높습니다.

소넷 5에서 소넷 5.5로 옮길 때 깨지는 API 변경점 5가지

가격이 같다고 모델 ID만 바꾸면 되는 업그레이드는 아닙니다. 공식 문서는 소넷 5에서 돌던 코드에 영향을 주는 변경점 5가지를 미리 안내합니다.

모델 ID 교체는 다음과 같습니다.

model = "claude-sonnet-5"  # Before
model = "claude-sonnet-5-5"  # After
변경점 내용
생각 끄기 thinking: {"type": "disabled"}를 보내면 400 오류가 납니다. {"type": "between_tools"}로 바꿔야 하고 low, medium, high 노력 수준에서만 됩니다
강제 도구 호출 tool_choice를 any나 tool로 지정하면 400 오류가 납니다. auto와 엄격한 도구 사용(strict)을 함께 쓰라고 안내합니다
사고 블록 사고 블록은 그것을 만든 모델과 대화에 묶입니다. 2026년 8월 31일 이후 만든 계정은 기본으로 검사하고, 이전 대화를 수정한 뒤 사고 블록을 다시 보내면 400 오류가 납니다. 대화를 덧붙이기만 하는 방식으로 유지해야 합니다
컴퓨터 사용 도구 Claude API와 Google Cloud에서 computer_20251124 도구를 거부합니다. computer_toolset_20260801로 옮겨야 합니다. Amazon Bedrock은 기존 도구를 받습니다
어드바이저 도구 소넷 5.5를 실행 모델로 쓸 때 오퍼스 4.8, 오퍼스 4.7, 소넷 5는 어드바이저로 쓸 수 없습니다

이 다섯 가지와 별개로 응답 모양이 바뀌는 부분도 있습니다. 도구 호출 사이에 나오는 진행 메모 중 한두 문장보다 긴 것은 thinking 블록으로 옵니다. 기본 표시 설정(display: "omitted")에서는 이 블록의 텍스트가 비어 있습니다. 그래서 이 메모를 사용자에게 스트리밍하던 앱은 오류 없이 도구 호출 사이에 조용해집니다. between_tools로 생각을 끄거나 thinking.display를 설정하면 텍스트가 돌아옵니다.

temperature, top_p, top_k를 기본값이 아닌 값으로 설정하면 400 오류가 나는 점도 문서에 적혀 있습니다.

노력 수준의 강도도 다시 맞춰졌습니다. 같은 high라도 소넷 5와 생각하는 양이 다르니 기존 설정을 그대로 옮기지 말고 다시 시험해 보라는 안내입니다. 공식 문서는 에이전트 코딩과 여러 단계 도구 사용에서는 잘 정의된 작업이면 medium에서 시작하고 어렵거나 긴 작업이면 high로 올리라고 권합니다.

소넷 5.5 안전 장치와 소넷 5 대체 동작

소넷 5.5는 사이버 보안 관련 요청에 오퍼스 5.5와 비슷한 안전 장치가 적용됩니다. 일상적인 디버깅은 허용되지만 위험도가 높은 요청은 거절될 수 있습니다. 이때 Claude API의 서버 측 대체(fallback, 베타)를 켜 두면 소넷 5로 다시 시도합니다. 사이버 방어 목적의 사용자는 Cyber Verification Program으로 단계별 접근을 신청할 수 있습니다. 생물학 관련 안전 장치는 소넷 5와 같습니다.

거절된 요청은 HTTP 200에 stop_reason: "refusal"로 돌아오고 정책 영역이 stop_details에 담깁니다. 서버 측 대체는 cyber와 frontier_llm 거절만 소넷 5로 재시도하고 bio, reasoning_extraction, general_harms 거절은 재시도하지 않습니다.

클로드 코드 클라우드 세션 사용법은 클로드 코드 클라우드 정식 출시 글에 정리했습니다. 오퍼스 5와 경쟁 모델의 가격 비교는 그록 4.7 출시, 오퍼스 5 코딩 점수 따라잡고 가격은 절반 글에서 다뤘습니다.

자주 묻는 질문

클로드 소넷 5.5 가격은 얼마인가요?

입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러로 소넷 5와 같습니다. 오퍼스 5.5는 4달러와 20달러입니다.

소넷 5는 계속 쓸 수 있나요?

발표 자료 기준으로 소넷 5는 여전히 제공됩니다. 소넷 5.5의 서비스 종료는 2027년 9월 28일보다 이르지 않다고 공지돼 있습니다.

소넷 5.5 컨텍스트 창은 얼마나 되나요?

100만 토큰이고 한 번에 최대 12만 8천 토큰까지 출력합니다. Batch API 베타 헤더를 쓰면 최대 출력이 30만 토큰입니다.

오퍼스 5.5 대신 소넷 5.5를 써도 되나요?

벤치마크에서는 대부분 몇 점 차이이고 가격은 절반이라, 잘 정의된 코딩과 문서 작업에는 소넷 5.5가 경제적입니다. 다만 FrontierCode 같은 어려운 코딩 벤치마크에서는 오퍼스 5.5가 8점가량 앞서니 어렵고 오래 걸리는 작업은 두 모델을 같은 조건에서 돌려 비교해 보는 방법이 확실합니다.

Categories:

Updated:

Leave a comment