
Anthropic은 2026년 9월 1일 Claude Fable 5.1과 Claude Mythos 5.1을 발표했습니다. 두 제품은 같은 기반 모델을 사용하지만 안전장치와 접근 조건이 다릅니다. Fable 5.1은 일반 기업과 개발자가 이용할 수 있고, Mythos 5.1은 심사를 거친 사이버보안 및 생명과학 기관으로 제한됩니다.
기업 관점에서 중요한 변화는 벤치마크 점수만이 아닙니다. 같은 능력에 서로 다른 권한과 안전 계층을 적용하는 구조가 정식 제품이 됐습니다. AI 에이전트가 여러 시간 동안 여러 애플리케이션을 오가며 행동한다면 모델 선택은 답변 품질뿐 아니라 라우팅, 승인, 데이터 보관, 실패 복구까지 포함해야 합니다.
이 글은 장시간 에이전트, 캐시가 포함된 실제 비용, 안전장치가 처리 경로를 바꾸는 방식에 초점을 맞춥니다. 기술적 배경은 🔗 대규모 언어 모델의 작동 방식에서 먼저 확인할 수 있습니다.
1. 같은 기반 모델을 Fable과 Mythos로 나눈 이유
Anthropic에 따르면 Fable 5.1과 Mythos 5.1은 같은 기반 모델입니다. Fable은 Claude 요금제, API, AWS, Google Cloud, Microsoft Foundry를 통해 제공됩니다. Mythos는 자격 심사를 통과한 사이버 방어 및 생명과학 조직을 위한 trusted access로 한정됩니다.
따라서 Fable 5.1을 도입해도 기반 모델의 모든 기능을 같은 조건으로 쓰는 것은 아닙니다. 침투 테스트, 익스플로잇 생성, 바이너리 취약점 스캔, 일부 이중용도 연구는 차단되거나 다른 모델로 전달될 수 있습니다.
| 계층 | 주요 사용자 | 제공 경로 | 기업 확인 항목 |
|---|---|---|---|
| Fable 5.1 | 일반 기업, 팀, 개발자 | Claude 제품, API, 클라우드 | 안전장치 개입, fallback, 보관 |
| Mythos 5.1 | 심사된 전문 조직 | trusted access | 자격, 지역, 모니터링, 30일 보관 |
| Opus fallback | 정책으로 재분류된 요청 | 제품 자동 처리 또는 API 설정 | 능력, 가격, 지연, 감사 기록 |
운영 로그에는 최종 답변만이 아니라 실제 모델, 라우팅 이유, 처리 시간을 남겨야 합니다. 그렇지 않으면 품질이나 비용이 달라진 원인을 사후에 설명하기 어렵습니다.
2. 공식 벤치마크는 후보 선정 자료다
Anthropic은 Fable 5.1이 AutomationBench에서 31.4%, CursorBench 3.2.0에서 73.4%를 기록했다고 밝혔습니다. AutomationBench의 Fable 5는 17.1%, Opus 5는 26.9%입니다. 공급자가 공개한 결과이므로 후보 모델을 고르는 데는 유용하지만 모든 회사가 같은 개선폭을 얻는다는 증거는 아닙니다.
제약 조건도 함께 봐야 합니다. Fable 5.1은 실제 안전장치를 켠 상태에서 평가됐고, 일부 개입은 0점 또는 다른 모델의 처리로 반영됩니다. OSWorld 2.0은 2026년 8월 작업 세트를 사용하므로 이전 버전과 직접 비교하지 말라는 설명도 있습니다.
초기 고객 사례에는 벤치마크가 보여주지 못하는 장시간 작업이 담겨 있습니다. Millennium은 약 100만 번 실행할 때 한 번 발생하고 수년 동안 원인을 찾지 못한 장애를 Fable 5.1이 외부 라이브러리를 역어셈블하고 core dump와 대조해 찾아냈다고 설명했습니다. MongoDB는 모델이 약 3일 동안 서비스 코드와 문서를 조사한 뒤, 수 시간 동안 스스로 검증하며 프로토타입을 만들었다고 밝혔습니다. Ramp는 38시간 동안 진행한 머신러닝 작업에서 모델이 라벨 데이터로 생긴 착시를 확인하고 이를 수정한 다음 여섯 개의 병렬 실험을 시작했다고 전했습니다.
이는 Anthropic이 출시 자료에 선정해 실은 협력사 경험이며 독립 평가나 보편적인 생산성 보장은 아닙니다. 실무에서 얻을 교훈은 최종 답변만 보는 대신, 모델이 읽을 수 있는 기록을 남기는지, 장시간 방향을 유지하는지, 결과를 검증하는지, 증거가 부족할 때 멈추는지를 함께 측정해야 한다는 점입니다.
기업 평가는 자사 문서, 코드, 예외 상황으로 구성해야 합니다. 금융 조사는 출처 추적, 고객 지원은 환불 권한, 코딩 에이전트는 테스트와 변경 범위를 확인합니다. 내부 지식이 중요하다면 🔗 RAG 2.0 구조를 활용해 모델 추론과 검색 품질을 나누어 점검해야 합니다.
3. 비용은 한 번의 Token보다 완료된 업무로 계산한다
Fable 5.1 가격은 입력 100만 Token당 10달러, 출력 100만 Token당 50달러입니다. 캐시 읽기는 100만 Token당 0.25달러로 Fable 5보다 75% 낮습니다. Anthropic은 일반 작업 약 25%, 높은 수준의 에이전트 작업은 최대 약 45%의 비용 감소를 추정하지만 공급자 계산이므로 보장된 절감액은 아닙니다.
장시간 에이전트는 저장소 규칙, 사내 정책, 참고 문서, 이전 단계 상태를 반복해서 읽습니다. 캐시 적중률이 높을 때는 도움이 되지만 입력이 계속 바뀌면 같은 절감률을 기대하기 어렵습니다.
effort 설정도 비교 결과를 바꿉니다. Fable 5.1은 Claude Code에서 High effort, Claude Cowork와 claude.ai에서는 Medium effort가 기본입니다. Anthropic은 Low 또는 Medium에서도 Fable 5와 비슷하거나 더 나은 결과를 더 낮은 비용으로 얻을 수 있다고 설명합니다. PoC에서는 effort, 도구, 중단 조건을 고정해야 합니다. 그렇지 않으면 같은 모델 이름으로 진행한 두 실험도 서로 다른 운영 조건을 비교하게 됩니다.
단순한 예로, 에이전트가 10만 Token의 고정 컨텍스트를 20단계에서 다시 읽으면 총 200만 Token입니다. 일반 입력 단가로만 계산하면 이 부분은 20달러지만, 전부 캐시 읽기 조건을 만족하면 읽기 비용은 0.5달러입니다. 최초 캐시 쓰기, 변하는 입력, 출력, 도구, 재시도는 제외한 예시이므로 총 청구액은 아닙니다. 그러나 컨텍스트 구조가 모델 표면 가격만큼 중요할 수 있다는 점은 보여줍니다.
다음 항목을 완료되고 승인된 업무 한 건 기준으로 기록합니다.
- Fable, fallback, 사람이 담당한 단계 수
- 입력, 출력, 캐시 읽기량
- 도구 실패, 권한 부족, 품질 불합격으로 인한 재실행
- 사용 가능한 결과까지 걸린 총시간
- API 외부의 검토와 수정 비용
보조 모델이나 GPU를 자체 운영한다면 활용률과 대기시간도 포함해야 합니다. 🔗 효율적인 GPU 관리와 🔗 Kubeflow 및 ixGPU 자원 분할은 인프라 계획에 참고할 수 있습니다.
4. 장시간 에이전트는 복구 가능한 절차가 필요하다
Fable 5.1은 여러 시간 동안 이어지는 조사, 브라우저 작업, 대규모 코드 변경, 여러 앱을 넘나드는 업무를 대상으로 합니다. 초기 단계의 잘못된 선택이 뒤 단계까지 전달되면 짧은 채팅보다 수정 비용이 훨씬 큽니다.
업무를 검증 가능한 체크포인트로 나누고 각 단계의 입력, 도구 결과, 판단 근거, 제한을 보관해야 합니다. 실패하면 마지막으로 검증된 상태에서 재개합니다. 모델이 완료했다고 말하는 것만으로는 통제가 되지 않습니다.
네 가지 게이트를 둘 수 있습니다.
- 시작 전: 데이터 범위, 허용 도구, 금지 행동을 정의합니다.
- 실행 중: 외부 메시지, 결제, 삭제, 권한 변경은 사람이 승인합니다.
- 전달 전: 형식, 인용, 테스트, 필수 항목을 결정적 검사로 확인합니다.
- 실패 후: 상태와 오류 유형을 남겨 사람이나 다른 모델이 이어받습니다.
5. 안전장치와 fallback은 사용자 경험을 바꾼다
Anthropic은 Fable 5.1의 사이버 안전장치 개입이 Fable 5보다 Claude Code 세션당 평균 약 60% 줄고, 무해한 생명과학 요청의 오탐도 초기 Fable 5보다 85% 감소했다고 설명합니다. 그러나 침투 테스트, 익스플로잇 생성, 바이너리 스캔과 일부 이중용도 과학 요청은 계속 제한됩니다.
이 수치는 합법적이고 승인된 내부 환경에서 검증해야 하는 공급자 주장입니다. 요청이 Opus 4.8이나 Opus 5로 이동하면 능력, 가격, 지연, 지원 주기가 달라질 수 있습니다. API 로그에는 실제 모델, 라우팅 이유, 정책 버전, 승인자를 기록하고 반드시 거부할 요청과 전문 환경에서 진행할 요청을 구분해야 합니다.
6. 30일 보관과 EFS는 계약 문제다
Fable 5.1과 Mythos 5.1은 안전 모니터링을 위해 기본 30일 데이터 보관을 요구합니다. Anthropic이 같은 날 발표한 Enterprise Frontier Safeguards는 활동 데이터를 고객이 관리하는 클라우드 환경에 저장하면서 장기간 악용 패턴을 탐지하는 구상입니다. 2026년 가을부터 단계적으로 제공될 예정이며, 대상 기업은 그 전까지 zero data retention을 사용할 수 있습니다.
책임 구분은 ‘고객 환경에 저장한다’는 설명보다 구체적입니다. 활동 기록은 고객의 Amazon S3, Azure Blob Storage, Google Cloud Storage에 저장하고 고객 관리 암호화 키, 접근 정책, 감사 로그를 적용할 수 있습니다. 자동화 시스템은 여러 세션과 계정에 걸친 일정 기간의 데이터를 분석하며 심각한 악용이나 자격 증명 유출 신호를 고객 팀에 직접 전달합니다. Anthropic 설명에 따르면 기본적으로 자사 직원의 사람 검토는 필요하지 않습니다. 고객 소유 스토리지, 고객 관리 키, 자동 검토는 각각 선택 사항이며 모델 동작, API 가격, rate limit을 바꾸지 않습니다.
Anthropic은 EFS 자체에는 별도 요금이 없다고 밝히지만 스토리지, 읽기·쓰기, 데이터 전송 비용은 고객의 클라우드 비용입니다. 구매 전 보관 항목과 기간, 접근자, 경보 조사 책임, 지역, 삭제, 법적 보존, SIEM 연계를 확인해야 합니다. 학습에 사용하지 않는다는 설명만으로 데이터 보관 조건을 알 수는 없습니다.
7. 업무를 고른 뒤 모델 계층을 결정한다
Fable 5.1은 여러 문서 조사, 어려운 장애 분석, 다단계 데이터 정리처럼 나누어 검증할 수 있는 고가치 업무의 후보입니다. Mythos 5.1은 일반 상위 요금제가 아니라 자격과 모니터링이 필요한 전문 계층입니다.
4주 시험에서는 첫째 주에 실제 업무와 금지 행동을 정하고, 둘째 주에 기존 모델 및 사람 기준과 비교합니다. 셋째 주에 도구, fallback, 승인 지점을 추가하고, 넷째 주에 승인 결과당 비용, 오류 유형, 복구 시간을 계산합니다. 검색 실패가 많다면 더 큰 모델을 사기 전에 🔗 RAG와 미세 조정의 차이를 확인해야 합니다.
이번 발표는 기업 모델 선택이 하나의 모델 이름에서 모델, 라우터, 정책, 보관, 책임자를 포함한 시스템 설계로 이동하고 있음을 보여줍니다.
기업 대규모 모델, 에이전트 거버넌스, GPU 인프라 소식은 AI-Stack의 후속 분석에서 계속 다루겠습니다.