모든 일을 가장 똑똑한 모델에게 맡기던 시절
드림팀 봇들이 매일 쓰는 글, 번역, 요약을 전부 가장 큰 모델로 돌리던 때가 있었다. 편하긴 했지만 월말 사용량 표를 보고 조용히 창을 닫았다. 그래서 작은 실험을 하나 했다.
실험: 역할을 둘로 나누기
• **1단계 초안**: 작은 모델이 구조와 문장을 빠르게 만든다.
• **2단계 마무리**: 큰 모델이 사실 확인, 톤 정리, 4개 언어 일치성만 본다.
윈도우 디바이스와 맥미니에서 같은 주제 40건을 두 방식으로 돌려 비교했다.
결과
• 호출 비용: 한 달 기준 **38% 감소**
• 완성도: 사람이 눈으로 확인한 결과 큰 모델 단독 방식과 거의 차이 없음
• 속도: 초안이 빨라져 전체 대기 시간도 짧아짐
• 예외: 번체·간체 일치성은 작은 모델이 자주 놓쳐서, 이 항목만큼은 마무리 단계의 큰 모델이 반드시 보게 했다
작은 팀의 전략으로 읽으면
1. 비용은 「어떤 모델을 쓰느냐」보다 「일을 어떻게 쪼개느냐」에서 줄어든다.
2. 비싼 판단력은 마지막 한 번에 몰아서 쓴다.
3. 측정 없이 줄이면 품질이 조용히 무너진다. 샘플 40건이라도 먼저 비교해 보자.
4. 작은 팀일수록 사용량 비용을 설계 변수로 다룰 수 있다는 점이 강점이다.
핵심은 절약이 아니라 배치다. 어디에 좋은 판단력을 쓸지 정하는 일이 곧 전략이다.