Claude Opus 4.6 완벽 정리: 스펙, 벤치마크, 새 기능, 가격, API 변경사항 (2026)

2026년 2월 5일, Anthropic이 최신 AI 모델 Claude Opus 4.6을 발표했습니다. Anthropic이 “세계에서 가장 지능적인 모델”이라고 소개한 이 모델의 모든 특징을 정리합니다. 모델 스펙, 벤치마크, 가격, API 변경사항까지 실무에 필요한 내용을 빠짐없이 다룹니다.

이 글은 실제로 Claude Opus 4.6을 사용하여 작성되었습니다.


기본 스펙

항목스펙
모델 IDclaude-opus-4-6
컨텍스트 윈도우200K 토큰 (기본) / 1M 토큰 (베타)
최대 출력 토큰128K 토큰
입력 가격$5 / 1M 토큰
출력 가격$25 / 1M 토큰
1M 컨텍스트 가격$10 / $37.50 (200K 초과 시)
Fast Mode 가격$30 / $150 (최대 2.5배 빠른 출력)
US-Only 추가요금1.1배
출시일2026년 2월 5일

벤치마크 성능

Opus 4.6은 주요 벤치마크에서 업계 최고 성능을 기록했습니다.

벤치마크분야결과
Terminal-Bench 2.0에이전틱 코딩전 모델 중 최고 점수
Humanity’s Last Exam추론 능력전 모델 중 최고 점수
GDPval-AA지식 노동 (금융, 법률)GPT-5.2 대비 144 Elo 포인트 우위
MRCR v2장문 컨텍스트 검색76% 정확도 (Sonnet 4.5: 18.5%)

특히 GDPval-AA는 금융, 법률 등 실제 경제적 가치가 있는 지식 노동 태스크를 평가하는 벤치마크입니다. OpenAI의 GPT-5.2보다 144 Elo 포인트 앞서는 것은 유의미한 차이입니다.

MRCR v2(장문 컨텍스트 검색) 벤치마크에서 76% 대 18.5%의 차이는 압도적입니다. 100만 토큰 컨텍스트에서 특정 정보를 찾는 능력이 이전 모델(Sonnet 4.5)보다 4배 이상 향상되었습니다.


핵심 새 기능

1. Adaptive Thinking (적응형 사고)

Opus 4.6에서 가장 큰 변화입니다. 이전에는 Extended Thinking을 켜고 budget_tokens를 수동으로 설정해야 했습니다. 이제 모델이 스스로 얼마나 깊이 생각할지 판단합니다.

# 이전 방식 (deprecated)
response = client.messages.create(
    model="claude-opus-4-6",
    thinking={"type": "enabled", "budget_tokens": 10000},
    ...
)

# 새 방식 (권장)
response = client.messages.create(
    model="claude-opus-4-6",
    thinking={"type": "adaptive"},
    messages=[{"role": "user", "content": "복잡한 문제..."}]
)

Adaptive Thinking의 동작 방식:

  • effort: high (기본값) — 거의 항상 생각합니다. 복잡한 분석, 코딩, 추론에 적합
  • effort: medium — 중간 복잡도의 문제에서 필요한 만큼만 생각합니다
  • effort: low — 간단한 문제는 생각을 건너뛰고 바로 답합니다. 빠른 응답이 필요할 때
  • effort: max — Opus 4.6에서 새로 추가. 최대 능력을 발휘합니다. 비용이 높지만 가장 정확

thinking: {type: "enabled"}budget_tokensdeprecated되었습니다. 아직 동작하지만 향후 모델에서 제거될 예정입니다. Adaptive Thinking으로 마이그레이션을 권장합니다.

또한 Adaptive Thinking은 Interleaved Thinking을 자동으로 활성화합니다. 이전에는 별도의 베타 헤더(interleaved-thinking-2025-05-14)가 필요했지만, 이제는 필요 없습니다.

2. Agent Teams

Claude Code에서 여러 에이전트가 동시에 독립적으로 작업할 수 있는 기능입니다. 대규모 태스크를 분할하여 병렬로 처리합니다.

예를 들어 “코드베이스를 분석해줘”라는 요청에 대해:

  • 에이전트 A: UI/UX 분석
  • 에이전트 B: 아키텍처 분석
  • 에이전트 C: 보안 코드 리뷰

세 에이전트가 동시에 작업하고, 각자 보고서를 제출합니다. 순차 처리 대비 시간이 크게 단축되며, 독립적 관점에서 교차 검증이 가능합니다.

Agent Teams는 읽기 전용(read-heavy) 태스크에 특히 적합합니다. 코드 분석, 리서치, 문서 검토 등 파일을 읽고 분석하는 작업에서 진가를 발휘합니다.

3. 128K 출력 토큰

이전 모델의 64K에서 2배로 증가했습니다. 이것이 의미하는 것:

  • 더 긴 Thinking Budget — 복잡한 추론에 더 많은 내부 사고를 할 수 있음
  • 더 포괄적인 응답 — 긴 코드, 상세한 분석 보고서를 한 번에 생성 가능
  • 대규모 코드 생성 — 파일 전체를 한 번에 작성하는 작업에 유리

주의: 큰 max_tokens 값을 사용할 때는 HTTP 타임아웃을 방지하기 위해 스트리밍이 필요합니다. SDK에서 .stream().get_final_message()를 조합하면 이벤트를 개별 처리하지 않고도 전체 응답을 받을 수 있습니다.

4. Compaction API (베타)

서버 측 컨텍스트 압축 기능입니다. 대화가 컨텍스트 윈도우 한계에 가까워지면 API가 자동으로 이전 대화를 요약합니다.

이것이 가능하게 하는 것:

  • 사실상 무한한 대화 — 컨텍스트 윈도우 한계에 도달해도 대화가 끊기지 않음
  • 장기 실행 태스크 — 에이전트가 수십 분에 걸친 복잡한 작업을 중단 없이 수행
  • 자동 관리 — 개발자가 수동으로 컨텍스트를 관리할 필요 없음

Claude Code에서 이미 활용되고 있으며, 긴 코딩 세션에서 컨텍스트 한계 없이 작업을 이어갈 수 있습니다.

5. Fast Mode (Research Preview)

같은 Opus 4.6 모델을 최대 2.5배 빠른 속도로 실행하는 모드입니다.

response = client.beta.messages.create(
    model="claude-opus-4-6",
    max_tokens=4096,
    speed="fast",
    betas=["fast-mode-2026-02-01"],
    messages=[{"role": "user", "content": "리팩토링해줘..."}]
)

핵심: 모델 자체는 동일합니다. 지능이나 능력이 바뀌는 것이 아니라, 추론(inference) 속도만 빨라집니다. 다만 프리미엄 가격($30/$150 per MTok)이 적용됩니다.

반복적인 코드 리팩토링, 빠른 응답이 필요한 인터랙티브 작업에 적합합니다.

6. 1M 토큰 컨텍스트 윈도우 (베타)

기본 200K에서 1M 토큰으로 확장 가능합니다. 1M 토큰은 대략:

  • 영문 기준: 약 75만 단어 (소설 10권 분량)
  • 코드 기준: 약 3만~5만 줄의 코드
  • 문서 기준: 수백 페이지의 기술 문서

200K를 초과하는 프롬프트에는 프리미엄 가격($10/$37.50 per MTok)이 적용됩니다.

MRCR v2 벤치마크에서 76% 정확도(Sonnet 4.5: 18.5%)를 기록한 것은 이 장문 컨텍스트가 실제로 유의미하게 활용됨을 증명합니다.

7. Data Residency Controls

모델 추론이 실행되는 지역을 제어할 수 있습니다.

response = client.messages.create(
    model="claude-opus-4-6",
    inference_geo="us",  # 미국 내에서만 추론
    ...
)
  • "global" (기본값): 최적의 위치에서 추론
  • "us": 미국 내에서만 추론 (1.1배 가격)

규제 준수(compliance)가 필요한 기업 고객을 위한 기능입니다. HIPAA, SOC2 등 데이터 처리 위치가 중요한 환경에서 활용됩니다.


코딩 능력 향상

Opus 4.6은 이전 모델 대비 코딩 분야에서 크게 향상되었습니다.

  • 확장된 에이전틱 태스크 계획 능력 — 대규모 코드베이스에서 더 신뢰성 높은 작업 수행
  • 독립적 오류 감지 — 코드 리뷰와 디버깅에서 실수를 스스로 발견
  • 다국어 코딩 — 한국어 설명과 영문 코드를 혼합한 작업에서 향상
  • 사이버보안 탐지 — 보안 취약점 식별 능력 개선

Terminal-Bench 2.0에서 전 모델 중 최고 점수를 기록한 것은, 실제 터미널 환경에서 복잡한 코딩 태스크를 수행하는 능력이 가장 뛰어남을 의미합니다.


API 변경사항 (Breaking Changes)

Prefill 제거

어시스턴트 메시지 프리필(last-assistant-turn prefills)이 지원되지 않습니다. 프리필된 어시스턴트 메시지가 포함된 요청은 400 에러를 반환합니다.

대안:

  • Structured Outputs: 응답 형식 제어
  • System Prompt: 응답 스타일 가이드
  • output_config.format: JSON 출력

output_format → output_config.format

# Before (deprecated)
response = client.messages.create(
    output_format={"type": "json_schema", "schema": {...}},
    ...
)

# After (권장)
response = client.messages.create(
    output_config={"format": {"type": "json_schema", "schema": {...}}},
    ...
)

Deprecated 된 것들

Deprecated대체상태
thinking: {type: "enabled"}thinking: {type: "adaptive"}동작하지만 향후 제거
budget_tokenseffort 파라미터동작하지만 향후 제거
interleaved-thinking 베타 헤더자동 활성화 (헤더 불필요)무시됨
output_formatoutput_config.format동작하지만 향후 제거

가격 비교

모드입력 (per MTok)출력 (per MTok)특징
Standard$5$25기본 모드
1M Context (>200K)$10$37.50200K 초과 시 적용
Fast Mode$30$150최대 2.5배 속도
US-Only×1.1×1.1미국 내 추론 보장

참고로 같은 패밀리의 다른 모델과 비교하면:

모델입력출력위치
Claude Opus 4.6$5$25최고 성능
Claude Sonnet 4.5$3$15성능/비용 균형
Claude Haiku 4.5$0.80$4빠르고 저렴

사용 가능한 플랫폼

  • claude.ai — 웹 인터페이스 (Pro/Team/Enterprise 플랜)
  • Anthropic API — 직접 API 호출
  • Amazon Bedrock — AWS 클라우드
  • Google Cloud Vertex AI — GCP 클라우드
  • GitHub Copilot — VS Code/JetBrains IDE 통합
  • Claude Code — Anthropic 공식 CLI 도구

Claude 모델 패밀리 비교 (2026년 2월 기준)

모델모델 ID컨텍스트최대 출력특징
Opus 4.6claude-opus-4-6200K (1M 베타)128K최고 성능, 에이전트, 코딩
Sonnet 4.5claude-sonnet-4-5-20250929200K64K균형 잡힌 성능/비용
Haiku 4.5claude-haiku-4-5-20251001200K64K빠른 응답, 저비용

안전성 평가

Anthropic의 자체 평가에 따르면, Opus 4.6은:

  • 미정렬 행동(misaligned behavior)의 낮은 비율 유지
  • 최근 Claude 모델 중 가장 낮은 과잉 거부율(over-refusal rate)
  • “다른 프론티어 모델과 동등하거나 더 나은 안전성 프로파일” 달성

과잉 거부율이 가장 낮다는 것은, 정당한 요청을 불필요하게 거절하는 빈도가 줄었다는 의미입니다. 이전 모델에서 간혹 발생하던 “무해한 요청도 거절하는” 문제가 개선되었습니다.


Office 통합

Claude in Excel

장기 실행 태스크, 다단계 변경, 비정형 데이터 처리 성능이 향상되었습니다. 대용량 스프레드시트에서 복잡한 분석을 수행할 때 더 안정적으로 동작합니다.

Claude in PowerPoint (Research Preview)

PowerPoint 내에서 Claude를 사이드 패널로 사용할 수 있습니다. 디자인 시스템의 일관성을 유지하면서 프레젠테이션을 제작할 수 있습니다. 현재 리서치 프리뷰 단계입니다.


실제 사용 후기

이 블로그(yndl.dev)는 Claude Opus 4.6의 Claude Code를 사용하여 구축되었습니다. 실제 경험에서 느낀 점:

  • Agent Teams: 3명의 에이전트가 동시에 블로그를 분석하고 각각 1,000줄 이상의 보고서를 작성. 순차 처리 대비 시간이 크게 단축됨
  • Compaction: 수시간에 걸친 인프라 구축 세션에서 컨텍스트가 한계에 도달했지만, 자동 압축으로 작업을 이어갈 수 있었음
  • 코딩 능력: Docker, PHP, CSS, JavaScript를 넘나드는 풀스택 작업을 높은 정확도로 수행. 특히 WordPress의 블록 마크업 생성이 정확함
  • 디버깅: Caddy 설정 오류, CSS 특이성 문제 등을 빠르게 진단하고 해결책 제시

다만 한계도 있습니다:

  • 외부 서비스(Cloudflare, DNS)와의 상호작용 컨텍스트를 사전에 알지 못함
  • 개별 Best Practice는 정확하지만, 컴포넌트 간 체인(Cloudflare → Caddy → WordPress)의 상호작용은 놓칠 수 있음
  • “기술적 우아함”을 과대평가하는 경향 (실용적 판단은 여전히 사람의 영역)

마이그레이션 체크리스트

기존 Claude 모델에서 Opus 4.6으로 마이그레이션할 때 확인할 사항:

  1. thinking: {type: "enabled"}thinking: {type: "adaptive"}로 변경
  2. budget_tokens 제거, effort 파라미터 사용
  3. interleaved-thinking 베타 헤더 제거
  4. output_formatoutput_config.format으로 변경
  5. 어시스턴트 메시지 프리필 사용 중이라면 대안으로 전환
  6. Tool call arguments의 JSON 이스케이핑 변경 확인
  7. max_tokens 사용 시 스트리밍 적용 확인

요약

Claude Opus 4.6은 Anthropic의 가장 강력한 모델입니다. 핵심 요약:

  • 성능: Terminal-Bench, Humanity’s Last Exam, GDPval-AA에서 업계 최고
  • 새 기능: Adaptive Thinking, Agent Teams, Compaction, Fast Mode, 128K 출력
  • 1M 컨텍스트: 장문 문서 분석에서 76% 검색 정확도 (4배 향상)
  • 실용성: 코딩, 분석, 에이전틱 태스크에서 가장 신뢰할 수 있는 AI 모델
  • 주의사항: Prefill 제거, 여러 파라미터 deprecated — 마이그레이션 필요

이 글은 Claude Opus 4.6 (claude-opus-4-6)을 사용하여 작성되었습니다.
프로젝트: yndl.dev

참고 자료:
Anthropic 공식 발표 | API 문서 | AWS Bedrock | Google Vertex AI

댓글 남기기