음성인식 값이 8분의 1인데 안 바꿨습니다 — 전용 ASR 과 범용 모델을 같은 녹취로 견줬습니다
새로 나온 음성인식 모델이 처리 시간은 절반, 값은 8분의 1이었습니다. 게다가 우리가 알고 있던 약점을 정면으로 겨냥한 기능까지 들어 있었습니다. 같은 녹취 하나로 이틀에 걸쳐 재봤고, 결론은 안 바꾸는 쪽이었습니다.
지금 쓰는 방식과 그 방식의 약점
사내 문서 지식그래프 검색 도구에는 회의 녹취를 글로 옮기는 경로가 있습니다. 지금은 전용 음성인식 모델이 아니라 범용 멀티모달 모델로 돌립니다. 녹취를 5분 조각으로 자르고 조각 사이를 15초씩 겹쳐 둔 뒤, 조각마다 따로 모델을 부르는 구조입니다.
화자 구분은 기능이 아니라 프롬프트로 시킵니다. 말하는 사람이 바뀌면 '화자1' 처럼 표시하라고 지시문에 적어 둔 것이 전부입니다. 조각마다 따로 부르니 앞 조각의 '화자1' 과 뒤 조각의 '화자1' 이 같은 사람이라는 보장이 구조적으로 없습니다. 만들 때부터 알고 있던 약점입니다.
그 상태에서 한 제공사가 전용 음성인식 모델을 내놓으면서 ASR(음성을 글자로 옮기는 전용 모델) 가격 최대 95% 인하와 화자 분리를 함께 내세웠습니다. 값도 싸고 우리 약점을 그대로 겨냥한 문구라, 같은 녹취 파일 하나로 곧바로 견줬습니다.
같은 파일 하나로 나란히 돌렸습니다
비교 조건은 이렇게 잡았습니다. 한 고객사의 업무 설명 회의 28분(1,686초) 녹음, 모노 m4a, 참석자 2~3명입니다. 전용 ASR 쪽은 파일 전사 모델에 화자 분리를 켜고 한국어 힌트만 줬습니다. 범용 모델 쪽은 운영 중인 경로를 그대로 썼습니다.
미리 적어둘 한계가 하나 있습니다. 정답 원고에 해당하는 대조본이 없습니다. 실제 업무 용어와 앞뒤 문맥으로 맞고 틀림을 가른 눈 비교이지, 오류율 같은 정량 지표가 아닙니다.
축 | 전용 ASR | 범용 모델 |
|---|---|---|
걸린 시간 | 63초 | 142초 |
회당 비용(상대) | 1 | 약 8배 |
업무 용어 | 많이 틀림 | 대부분 맞음 |
화자 분리 | 3명으로 판정, 한 사람에게 280/307문장 쏠림 | 2명, 5분 조각 경계에서 번호 뒤바뀜 |
표의 셋째 줄이 판단을 갈랐습니다. 같은 대목에서 전용 ASR 은 업무 용어를 소리가 비슷한 엉뚱한 낱말로 바꿔 놓았고, 범용 모델은 그 자리를 전부 맞혔습니다. 전용 ASR 결과 중간에는 다른 언어 문장 한 줄이 통째로 끼어들기도 했습니다.
화자 분리도 기대와 달랐습니다. 전용 ASR 은 단어 한가운데에서 화자를 끊었습니다. '실사를 합 / 니까' 처럼 한 낱말이 두 사람의 발언으로 쪼개진 자리가 있었습니다. 대신 범용 모델이 아예 놓친 짧은 질문 한 줄은 따로 떼어 냈습니다. 둘 다 그대로 믿고 쓸 수준은 아니었습니다.

용어 사전을 넣으면 메워지는지 한 번 더 돌렸습니다
업무 용어를 못 맞히는 건 사전으로 메울 수 있는 종류의 문제로 보였습니다. 그래서 회의에 나온 업무 용어 10개를 핫워드(전사할 때 우선해서 맞히라고 미리 넣어 주는 단어 목록)로 등록하고 가중치를 5로 올려 같은 파일을 다시 돌렸습니다. 처리 시간과 토큰 사용량은 1차와 거의 같았습니다.
용어 등장 횟수 | 전용 ASR 기본 | 전용 ASR 핫워드 | 범용 모델 |
|---|---|---|---|
업무 용어 A | 14 | 24 | 46 |
업무 용어 B | 0 | 1 | 20 |
업무 용어 C | 1 | 0 | 13 |
업무 용어 D | 0 | 0 | 2 |
업무 용어 E | 0 | 8 | 2 |
명백한 오인식 | 8 | 1 | 0 |
나아진 축과 나빠진 축이 동시에 나왔습니다. 정리하면 셋입니다.
나아진 것 — 명백한 오인식이 8건에서 1건으로 거의 사라졌습니다
여전한 것 — 핵심 용어 두 개는 한 글자씩 어긋난 채였고, 용어 D 는 끝까지 한 번도 안 나왔습니다
나빠진 것 — 용어 E 가 0회에서 8회로 늘었는데, 실제로 그 말을 한 두 곳은 여전히 못 잡았습니다
마지막 줄이 이 실험에서 가장 중요한 결과였습니다. 늘어난 8회는 'E 는 E 는 E 는 E' 처럼 같은 낱말이 반복된 자리이거나, 다른 낱말 자리에 E 를 억지로 끼워 넣은 합성어였습니다. 정확도가 오른 것이 아니라 없던 말이 생긴 것입니다. 화자 쏠림은 오히려 더 심해졌고, 다른 언어가 끼어드는 현상도 그대로였습니다.
같은 유형을 9월 초에 이미 한 번 봤습니다. 범용 모델 쪽 전사에 용어집을 켰더니 한 제도 용어가 다른 제도 용어로 바뀐 적이 있습니다. 용어를 밀어 넣는 장치는 모델을 가리지 않고 없던 말을 만듭니다. 정확도를 올린다기보다 오류의 분포를 바꾼다고 보는 편이 맞습니다.
더 곤란한 점은 틀린 문장이 자연스럽다는 것입니다. 소리가 뭉개져 이상해진 문장은 눈에 띄지만, 사전이 만들어 낸 문장은 매끄럽게 읽힙니다. 대조본 없이 켜면 상태가 나빠진 것을 모르고 지나갑니다.

재는 축을 셋으로 놓고 하나씩 봤습니다
여기까지 나온 자료를 세 축으로 갈라 놓고 판단했습니다.
업무 용어 정확도 — 회의록의 값어치는 용어가 맞는 데서 나옵니다. 이름이 틀린 회의록은 분량이 아무리 정확해도 쓸 수가 없습니다. 이 축에서 전용 ASR 이 확실히 떨어졌습니다
비용 — 비율로는 8분의 1이지만 절대액으로는 전환을 정당화할 크기가 아니었습니다. 회당 차이가 커피 한 잔에 한참 못 미치고, 월 수십 회를 돌려도 그 배수만큼입니다
화자 분리 — 새 모델을 들여다본 이유가 이것이었는데 양쪽 다 쓸 수준이 아니었습니다. 한쪽은 한 사람에게 몰고 단어 중간을 끊고, 다른 쪽은 조각 경계에서 번호가 뒤바뀝니다
세 번째 축을 덧붙이면, 조각 경계 문제는 새로 안 사실이 아닙니다. 조각마다 따로 호출하는 코드 구조를 보면 예상되던 것이고, 새 모델이 그걸 대신 풀어 줄지가 관심사였는데 풀어 주지 못했습니다.
그래서 안 바꿨습니다. 화자 분리는 양쪽 다 보류로 두고, 조각 경계에서 번호가 바뀌는 문제는 남은 숙제로 그대로 남겼습니다.
95% 는 원가가 이미 작은 영역의 95% 였습니다
제일 눈길을 끈 숫자가 결국 제일 쓸모없는 숫자였습니다. 인하율 자체는 사실입니다. 다만 절감액은 인하율에 원가를 곱해야 나옵니다. 원가가 이미 작으면 인하율이 아무리 커도 곱한 값이 작습니다.
우리 경우가 그랬습니다. 회의 녹취 전사는 하루에 수천 건씩 도는 일이 아니라 회의가 있을 때 한 건씩 도는 일입니다. 8분의 1로 줄여도 한 달치를 모아 보면 전환 작업에 드는 시간값을 못 넘깁니다. 몇 퍼센트 싸졌나가 아니라 한 달에 얼마 아끼나로 환산한 뒤에 봐야 하는 이유입니다.
반대 조건도 분명히 적어 둘 필요가 있습니다. 하루 수천 건을 전사하는 서비스라면 8분의 1이 그대로 큰 돈입니다. 그때는 용어 정확도를 후처리로 메우면서 싼 쪽으로 가는 편이 답일 수 있습니다. 이 글의 결론은 규모가 뒤집히면 같이 뒤집힙니다.
스펙 숫자가 아니라 실제 쓰임으로 급을 정한 판단은 장비를 고를 때도 같은 모양이었습니다.
같은 축에서 저장장치를 고른 기록도 남겨 뒀습니다.

제조사 벤치마크와 우리 녹취는 다른 답을 줬습니다
제조사 기술보고서를 보면 이 모델의 한국어 인식 오류율이 비교 대상보다 좋습니다. 공개 벤치마크 기준 13.5% 대 19.7% 입니다. 그런데 우리 녹취에서는 뒤졌습니다.
두 가지가 겹쳤다고 봅니다. 첫째, 우리가 재는 것은 일반 한국어가 아니라 한국어 업무 전문용어입니다. 둘째, 우리가 필요했던 화자 분리는 그 보고서에 평가 항목 자체가 없었습니다. 자체 보고서라 유리한 조건이 섞였을 가능성도 있습니다.
공개 지표는 후보를 추리는 데까지만 쓰고, 채택은 우리 데이터로 다시 재는 편이 안전합니다. 같은 순서로 분류 모델을 골랐던 적이 있습니다.
정확도가 아쉬운 모델을 그대로 채택했던 사례도 같은 구조입니다.
가는 길에 틀렸던 것들
판단과 별개로, 조사 과정에서 확인 없이 믿었다가 틀린 것이 셋 있었습니다. 셋 다 직접 한 번 쳐 보는 데 1분이면 되는 것들이었습니다.
2차 출처가 카드 등록 없이 무료 사용량을 받는다고 적어 뒀는데 틀렸습니다. 콘솔이 결제 수단 없음으로 막았고, 가입 마무리 단계 자체가 결제 수단 등록이었습니다
공식 문서가 임시 파일 업로드는 특정 리전 전용이라고 했는데, 다른 리전 워크스페이스에서 그냥 됐습니다. 문서만 믿었으면 쓰지 않아도 될 스토리지를 따로 개설했을 겁니다
대행 판매처를 조사하다 만난 한 중개 플랫폼은 없는 모델 주소에도 200 을 돌려줬습니다. 상태코드로는 존재 여부를 알 수 없어, 가짜 모델명을 넣어 대조하고 나서야 알아챘습니다
도입 판단에 쓰는 점검 항목
이번 비교에서 실제로 썼던 순서를 그대로 적습니다.
이 일에서 틀리면 안 되는 것 하나를 먼저 정했나 — 회의록은 용어, 자막은 타이밍, 검색은 재현율입니다. 축을 안 정하면 싼 쪽과 빠른 쪽이 자동으로 이깁니다
인하율을 한 달 절감액으로 환산해 봤나 — 원가가 작은 영역이면 큰 인하율도 전환 근거가 안 됩니다
제조사 지표에 우리가 필요한 기능이 평가돼 있나 — 없으면 그 기능은 안 재본 것입니다
정확도를 올리는 장치를 켰을 때 대조본이 있나 — 없으면 오류가 늘어도 모릅니다
'지금은 안 바꾼다'와 '앞으로 안 쓴다'를 갈라 적었나 — 모델은 계속 갱신되므로 다음 버전이 나오면 같은 파일로 다시 잽니다
마무리
새 모델이 나올 때마다 제일 먼저 눈에 들어오는 건 인하율과 처리 시간입니다. 둘 다 재기 쉬운 숫자이고, 둘 다 우리가 그 도구로 무엇을 하려는지는 모르는 숫자입니다.
이번에 남은 건 비교 결과보다 비교하는 순서 쪽이었습니다. 축을 먼저 정하고 그 축으로 재면, 싸고 빠른 후보가 탈락하는 일이 생깁니다. 축을 안 정하고 재면 그런 일은 생기지 않습니다.
지금은 안 바꾸기로 했습니다. 다음 버전이 나오면 같은 녹취 파일로 다시 재려고 같은 조건을 그대로 적어 뒀습니다.