모델 비교 글을 읽고 기본 모델을 바꿨는데 내 작업에서는 차이가 잘 안 느껴질 수 있습니다. 다른 사람이 시킨 일과 내가 시키는 일이 다르기 때문입니다. 버그 하나를 고치는 것과 화면 시안을 만드는 것을 같은 점수로 비교하기도 어렵습니다.
Opus 5와 Fable 5를 고를 때도 먼저 맡길 작업을 정하는 편이 낫다고 봅니다. 이 글은 두 모델을 직접 반복 측정한 벤치마크가 아닙니다. 기존 글의 실행 시간·비용 표는 원본 로그와 조건을 확인할 수 없어 제외하고, 내 프로젝트에서 비교할 수 있는 방법으로 바꿨습니다.
공식 성능 설명과 내 작업 결과를 나눈다
Anthropic은 Opus 5 발표에서 모델 성능과 비용을 비교합니다. 이런 자료는 후보를 고르는 출발점이지만, 발표에 사용한 작업·도구·평가 방식이 내 저장소와 같다는 뜻은 아닙니다. 2026년 9월에는 모델 세대도 계속 바뀌고 있으므로 제품군 이름뿐 아니라 실제 선택한 모델 ID와 비교 날짜를 남겨야 합니다.
가령 테스트 실패를 고치는 모델을 고른다면, 설명이 그럴듯한지보다 원래 실패한 테스트와 관련 회귀 테스트를 통과하는지 봅니다. 화면 작업이라면 해상도별 레이아웃, 키보드 조작, 요구한 상태가 구현됐는지처럼 비교 기준을 먼저 적습니다.
같은 출발점에서 짧은 작업을 반복한다
두 모델에 같은 커밋의 별도 작업 사본을 줍니다. 한 모델이 수정한 결과를 다음 모델의 시작점으로 사용하면 같은 문제가 아닙니다. 프롬프트뿐 아니라 접근 가능한 도구, 의존성, 테스트 명령, 시간 제한도 맞춥니다.
작업은 너무 크게 잡지 않습니다. ‘앱을 완성해줘’보다 ‘이 입력에서 재현되는 오류를 고치고 기존 동작을 유지해줘’처럼 성공 조건이 분명한 일이 비교에 적합합니다. 실행 중 사람이 도와줬다면 개입 횟수와 시간을 기록합니다.
아래는 결과를 채우기 위한 기록 형식입니다. 어느 모델이 우수하다는 실측 결과가 아닙니다.
| 항목 | 남길 내용 |
|---|---|
| 환경 | 커밋, OS, 도구 버전, 모델 ID, 추론 설정 |
| 입력 | 프롬프트 원문, 제공 파일, 허용 도구 |
| 완료 판정 | 테스트·화면 확인 결과, 미해결 조건 |
| 시간 | 자동 실행 시간과 사람이 수정한 시간 |
| 사용량 | 입력·출력·캐시 토큰, 도구 비용 |
| 실패 | 중단·한도 도달·잘못된 수정도 포함 |
몇 번 반복해도 표본은 작습니다. 가장 잘 나온 한 번만 골라 비교하지 말고 실패한 실행도 같이 남겨야 합니다. 한 모델에 익숙해서 프롬프트를 더 잘 썼다면 그 영향도 구분하기 어렵다는 점을 적습니다.
토큰 단가와 작업 비용은 다르다
API 비용은 입력·출력뿐 아니라 캐시 등 적용되는 항목을 나누어 계산해야 합니다. 단가가 낮아도 여러 번 재시도하면 전체 비용이 커질 수 있습니다. 정확한 단가는 비교 날짜의 공식 가격표를 사용합니다.
반면 구독 요금제는 API 종량제 비용과 같은 방식으로 환산할 수 없습니다. 특정 사용자가 한도에 도달하지 않았다는 경험도 모든 사람에게 같은 사용량을 보장하지 않습니다. 계정의 현재 조건과 실제 작업량을 확인해야 합니다.
가상의 예로 모델 A가 한 번에 2단위 비용으로 실패하고, 재시도에 2단위를 더 쓴다면 합계는 4입니다. 모델 B가 3단위로 끝냈다면 토큰당 단가와 별개로 그 작업에서는 B가 저렴합니다. 여기에 검토와 수정에 든 사람의 시간도 따로 기록하면 선택이 더 현실적입니다.
기본 모델은 작업별로 달라도 된다
작은 수정에서 충분히 잘하는 모델과 복잡한 분석을 맡길 모델을 구분할 수 있습니다. 다만 ‘디자인은 항상 이 모델’처럼 고정하기보다는 최근 작업 기록을 보고 조정하고 싶습니다.
끝내는 조건과 시간·사용량 상한을 함께 정하는 것도 중요합니다. “성공할 때까지 멈추지 마”라는 문장만으로 정확도나 비용이 통제되지는 않습니다. 상한에 도달하면 변경 내용, 실패한 검증, 남은 문제를 보고하도록 해야 다음 판단을 할 수 있습니다.
