이 글은 AI(Claude)와 함께 초안을 만들고 편집자가 검수했습니다. Claude를 만든 앤트로픽도 다루기 때문에, 각 회사가 자기 제품에 대해 적은 문서만 근거로 썼고 서로 비교한 독립 시험 결과는 아닙니다. 어느 쪽이 더 낫다고 말하지 않습니다.
「이 일엔 어떤 AI가 좋아요?」에 한 줄로 답하기는 어렵습니다. 대신 각 회사가 어떤 용도를 권하는지는 공식 문서에 적혀 있습니다. 그것을 작업별로 모았습니다.
작업별로 회사가 권하는 것
- 일상 문서·슬라이드·스프레드시트, 범위가 분명한 버그 수정: 앤트로픽은 Claude Sonnet 5.5를 이런 용도로 안내합니다. 더 빠르고 더 싼 쪽입니다.
- 길고 복잡한 개발 작업(큰 코드 이전, 점검): 앤트로픽은 Opus 5.5를, OpenAI는 GPT-6.1 Sol(코딩·컴퓨터 사용·전문 업무)을 권합니다. 두 곳 모두 이 용도의 점수를 자사 발표로 내놓았습니다.
- 장시간 개발 작업, 자동으로 일하는 에이전트: 구글 문서는 Gemini 3.8 Flash를 이 용도로 소개합니다.
- 음성 비서, 음성 합성: 구글은 낮은 지연의 음성 대화에 Gemini 3.8 Live를, 표현력 있는 음성 합성에 Gemini 3.8 Flash TTS를 안내합니다.
- 이미지: 구글은 4K 해상도와 글자가 들어간 복잡한 구성에 Nano Banana Pro를, 빠른 대량 제작에 Nano Banana 2를 안내합니다.
- 값이 가장 중요하고 양이 많은 일: 앤트로픽 문서는 Haiku급 작은 모델에서 시작해 부족하면 올리는 방식을, 구글은 Gemini 3.1 Flash-Lite를 안내합니다.
값을 줄이는 방법은 모델 바꾸기만이 아니다
앤트로픽 문서는 모델을 바꾸기 전에 「노력(effort) 설정」으로 지능과 속도·비용을 조절해 보라고 합니다. 또 두 회사 모두 같은 입력을 반복해서 쓸 때 값이 크게 내려가는 「캐시」를 제공합니다(OpenAI 0.10달러, 앤트로픽 0.20달러, 각각 100만 토큰당). 매번 같은 지침을 붙이는 일이라면 효과가 큽니다.
30분 시험법
앤트로픽 문서가 제안하는 순서를 우리 방식으로 줄였습니다.
- 매주 하는 일 세 가지를 고릅니다(예: 회의록 정리, 고객 답장 초안, 표 정리).
- 개인정보를 뺀 실제 자료 하나씩을 준비합니다.
- 같은 지시문을 두 개 도구에 똑같이 넣습니다.
- 정확도, 고칠 곳의 수, 걸린 시간 세 가지를 적습니다.
- 점수가 비슷하면 값이 싼 쪽, 한 번도 틀리면 안 되는 일이면 점수 높은 쪽을 고릅니다.
우리의 해석
사실: 회사들은 용도를 나눠서 안내하고, 점수는 자기 평가에서 가져옵니다.
해석: 「가장 좋은 AI」는 없고 「내 일에 맞는 가장 싼 AI」가 있습니다. 회사 발표 점수는 출발점일 뿐이고 내 자료로 확인한 결과가 기준입니다.
우리라면: 한 도구에 모든 일을 몰지 않고, 가벼운 일은 작은 모델, 어려운 일만 큰 모델로 나눕니다. 그리고 석 달에 한 번 같은 시험을 다시 돌립니다. 모델이 바뀌는 속도가 빠르기 때문입니다.
함께 읽은 글
모든 내용은 아래 공식 문서를 직접 열어 확인한 것입니다. 점수와 용도는 각 회사의 주장입니다.