GOP(Goodness of Pronunciation)란? 문장 단위 점수만으로 부족한 이유
GOP 채점이 작동하는 방식, 소리 단위 점수가 문장 점수로는 알 수 없는 것을 알려주는 이유, 그리고 GOP가 여전히 못하는 네 가지.
결론
GOP는 Goodness of Pronunciation의 약자로, 문장 전체가 아니라 그 안의 소리를 하나씩 채점하는 방식입니다. Silke Witt와 Steve Young이 2000년에 발표했고, 언어 학습 앱에서 만나게 되는 발음 피드백은 지금도 대부분 이것을 바탕으로 합니다.
실제로 달라지는 것은 결과를 가지고 무엇을 할 수 있느냐입니다. 문장 점수 68은 “다시 해보세요”까지만 말합니다. 소리 단위 점수는 leave의 모음이 live의 모음으로 나왔다고 알려주고, 거기까지 나오면 무엇을 연습할지도 정해집니다.
점수가 만들어지는 과정
세 단계이고, 신비로운 구석은 없습니다.
1. 정렬. 시스템은 내가 무슨 말을 하려 했는지 이미 알고 있습니다. 문장을 고른 것도 입력한 것도 나이기 때문입니다. 그 텍스트를 써서 녹음을 구간으로 자르고, 예상되는 소리마다 구간 하나를 할당합니다. 이것을 강제 정렬이라고 부릅니다. 무슨 말을 했는지 맞히려는 것이 아니라, 예상된 각 소리가 내 음성의 어느 지점에서 일어났는지를 찾는 작업입니다.
2. 비교. 각 구간에 대해 원어민 음성으로 학습된 음향 모델이 두 가지를 묻습니다. 이 음성은 여기 와야 했던 소리에 얼마나 가까운가. 그리고 가장 비슷한 소리에는, 그게 무엇이든, 얼마나 가까운가. 두 답 사이의 간격이 점수입니다.
3. 집계. 소리 점수가 단어 점수로 묶이고, 단어 점수가 문장 점수로 묶입니다. 대부분의 앱은 이 셋 중 마지막 것만 보여줍니다. 정보가 사라지는 지점이 바로 거기입니다.
원논문은 이것을 사후확률로 정식화합니다. 한 음소의 점수는 음성이 주어졌을 때 예상 음소의 로그 확률을 구간 길이로 정규화한 값입니다. 원문을 직접 보고 싶다면 PDF가 공개되어 있습니다.
문장당 숫자 하나로 부족한 이유
두 사람이 I think this is the third one을 녹음했고 둘 다 68점을 받았다고 해봅시다.
첫 번째 사람은 모든 소리를 깨끗하게 냈지만 너무 서둘러서 구간 경계가 지저분해졌고 점수가 전반적으로 내려갔습니다. 두 번째 사람은 think, this, third를 두 종류의 TH가 아니라 /t/와 /d/로 냈고 나머지는 괜찮았습니다.
두 문제는 정반대의 처방을 요구합니다. 첫 번째 사람은 속도를 늦춰야 하고, 두 번째 사람은 무성 /θ/와 유성 /ð/를 다뤄야 합니다. 68이라는 숫자는 이 둘을 구분하지 못하고, “다시 해보세요”라는 조언도 마찬가지입니다.
이것이 발음 연습을 배움 없는 반복으로 바꿔놓는 결함입니다. 반복하면 숫자가 조금 움직이는데, 어떤 변화가 그것을 움직였는지는 끝까지 알 수 없습니다.
소리 단위 점수가 잘하는 것
떨어진 단어를 짚어낸다. 소리 수준의 점수가 있으면 앱은 방금 말한 문장 안의 특정 단어를 가리키며 그 단어가 떨어졌다고 알려줄 수 있습니다. 이건 실제로 당길 수 있는 레버입니다.
일관된 대치를 찾아낸다. 같은 대치가 일주일 동안 서로 다른 열 개 단어에서 나타난다면 한 시간을 쓸 값어치가 있는 패턴입니다. 문장 단위 점수는 패턴을 보여줄 수 없습니다. 세부를 담아둘 자리가 없기 때문입니다.
실수와 습관을 가른다. 열 번 중 아홉 번 제대로 내는 소리는 발목을 잡는 원인이 아닙니다. 한 번도 제대로 내본 적 없는 소리가 원인입니다.
빠르다. 모델이 한 번 돌고 나면 비교는 산수입니다. 서버도 대기도 필요 없으므로, 내 입이 무엇을 했는지 아직 기억하는 동안 결과가 돌아옵니다.
GOP가 못하는 네 가지
정직한 한계입니다. 아무 의심 없이 믿는 점수는 점수가 없는 것보다 나쁘기 때문입니다.
명료도 자체를 재지 않는다. 재는 것은 원어민 음성 모델로부터의 거리입니다. 둘은 상관관계가 있을 뿐 같은 것이 아니고, 진짜로 중요한 기준은 듣는 사람이 힘들이지 않고 따라오는지입니다. 명료도와 억양을 보세요.
정당한 변이를 감점한다. 영어에는 표준적인 변종이 여럿 있습니다. 주로 하나의 변종으로 학습된 모델은 나머지를 낮게 매깁니다. 주변 사람들이 말하는 대로 말한 단어를 점수가 부정한다면, 틀린 쪽은 대개 점수입니다.
녹음 조건에 민감하다. 배경 소음, 멀리 있는 마이크, 감기, 작은 목소리. 모두 발음이 전혀 달라지지 않았는데도 점수를 끌어내립니다. 날짜를 넘겨 비교하고 싶다면 같은 조건에서 녹음하세요.
목표를 알아야 한다. GOP는 예상 텍스트에 대고 음성을 채점합니다. 무슨 말을 하려 했는지 아무도 모르는 자유 발화는 채점할 수 없고, 그래서 열린 대화를 채점하는 앱은 다른 일을 하고 있으며 판정도 대체로 더 느슨합니다.
소리 단위 점수에 휘둘리지 않는 법
판결이 아니라 실마리로 다루세요. 쓸모 있는 순환은 짧습니다. 문장을 녹음하고, 어떤 단어가 떨어졌는지 보고, 그것에 대해 질문 하나를 던지고, 하나만 바꿔서 다시 녹음합니다. 어떤 단어가 서로 다른 문장에서 세 번 연속 떨어지면 믿어도 됩니다. 한 녹음에서 한 번 떨어진 것이라면 무시해도 됩니다.
Phonema는 행동할 수 있는 단위인 단어 수준에서 이것을 보여줍니다. 신호가 있는 곳이 소리 수준이라 엔진은 소리로 작동하지만, 화면에 나오는 것은 “말하려던 문장에서 또렷하게 나오지 않은 단어”입니다. 이 방법의 긴 버전은 영어 발음을 스스로 확인하는 방법에 있습니다.
자주 묻는 질문
음성 기술에서 GOP는 무엇의 약자인가요? GOP는 Goodness of Pronunciation의 약자로, Silke Witt와 Steve Young이 2000년에 발표한 채점 방식입니다. 발화 전체를 한 덩어리로 채점하는 대신 그 안의 소리를 하나씩 따로 평가합니다.
GOP 점수는 어떻게 계산되나요? 시스템은 먼저 그 문장에 들어 있어야 할 소리에 맞춰 녹음을 구간으로 나누고, 각 구간의 음성이 원래 와야 할 소리에 얼마나 가까운지와 가장 비슷한 소리에 얼마나 가까운지를 비교합니다.
문장마다 점수 하나로는 왜 부족한가요? 완전히 다른 이유로 두 사람이 같은 문장 점수를 받을 수 있고, 그 숫자만으로는 둘 다 무엇을 바꿔야 하는지 알 수 없습니다.
발음 점수가 내 말이 통하는지를 알려주나요? 알려주지 않습니다. 점수가 재는 것은 내 음성이 모델의 예상에 얼마나 가까운지이고, 명료도는 듣는 사람이 힘들이지 않고 따라오는지로 측정됩니다.