이 글은 AI와 함께 초안을 만들고 편집자가 검수했습니다. 특정 제품의 구매·투자 권유가 아닙니다.
「주간 AI 소식 #1」에서 이야기했듯 모델은 매주 쏟아지고 가격은 내려갑니다. 대기업은 전담 팀이 평가하지만, 작은 팀은 갈아타는 순간 그 주 일정이 사라집니다. 우리가 정한 다섯 가지 기준을 공유합니다.
1. 모델이 아니라 「작업」을 기준으로 나눈다
「어떤 모델이 제일 좋은가」 대신 「이 작업에 얼마나 정확해야 하는가」를 먼저 묻습니다. 결과가 틀렸을 때 돌이킬 수 없는 일(공개 게시, 외부 발송, 숫자 보고)은 가장 강한 모델과 사람 검수를 씁니다. 틀려도 바로 고치는 일(초안, 분류, 요약)은 싼 모델로 충분합니다.
2. 갈아타기 전에 「우리 입력」으로 한 번 돌려 본다
벤치마크는 남의 문제입니다. 지난달에 실제로 처리한 입력 열 개 정도를 새 모델에 넣어 결과를 나란히 보고, 눈에 띄게 낫지 않으면 바꾸지 않습니다. 이 작업은 한 시간을 넘기지 않게 합니다.
3. 일하는 방식을 모델 밖에 둔다
지침, 문체 규칙, 금지 표현 같은 것은 한 모델의 설정 안에 숨기지 않고 문서로 보관합니다. 그래야 모델을 바꿔도 같은 결과를 기대할 수 있고, 새 모델이 같은 규칙을 지키는지 점검하기 쉽습니다.
4. 비용은 「건당」으로 본다
토큰 단가는 시간이 지나면 바뀝니다. 대신 「글 한 편, 이미지 한 장, 보고서 한 건을 만드는 데 드는 비용」을 기록합니다. 단가가 떨어져도 건당 비용이 줄지 않는다면 일하는 방식이 비효율이라는 뜻입니다.
5. 되돌릴 수 없는 행동은 끝까지 사람이 누른다
모델이 아무리 좋아져도 삭제, 결제, 외부 발송, 공개 게시는 사람의 확인을 거칩니다. 이것은 모델 성능의 문제가 아니라 책임의 문제입니다.
정리
모델 경쟁은 우리가 통제할 수 없지만, 어떤 일을 어떤 수준으로 맡길지는 우리가 정할 수 있습니다. 이 다섯 가지를 지키면 새 모델 소식이 불안이 아니라 「한 번 비교해 볼 거리」가 됩니다.