FA-Bench, 강제 정렬기의 음소 및 단어 단위 타임스탬프 정확도를 평가하는 벤치마크

Research

FA-Bench, 강제 정렬기의 음소 및 단어 단위 타임스탬프 정확도를 평가하는 벤치마크

대부분의 강제 정렬기 결과는 재현하기 어렵습니다. FA-Bench는 공개되어 있고 표준화된 기준선입니다. 30개 시스템의 음소 및 단어 단위 타임스탬프 정확도를 사람 언어학자가 표시한 경계와 비교해 채점했습니다. 깨끗한 오디오와 네 가지 열화 조건에서 모두 측정했습니다.

FA-Bench: A Benchmark for Evaluating Phone- and Word-Level Timestamp Accuracy in Forced Aligners

github.com/olewave/fa-bench · arXiv 논문

음소 및 단어 단위 타임스탬프의 정확도를 측정하는 오픈 벤치마크 FA-Bench를 공개합니다.

대부분의 강제 정렬기 결과는 재현하기 어렵습니다. 논문마다 서로 다른 음소 집합과 각자의 테스트 분할, 각자의 평가 지표를 사용합니다. 그래서 한 논문의 수치가 다음 논문의 수치와 같은 대상을 측정하는 경우는 드뭅니다. 그 결과 음성 연구자는 제대로 된 ablation 연구를 수행하지 못합니다. 음성 AI 엔지니어도 어떤 시스템을 배포해야 할지 판단하지 못합니다.

FA-Bench는 레이블을 병합하는 방식부터 각 경계를 채점하는 방식까지 평가 전체를 코드로 공개합니다. 모든 시스템이 같은 파이프라인을 거칩니다. 그래서 각 시스템의 수치를 다른 모든 시스템의 수치와 바로 비교할 수 있습니다.

테스트한 내용

30개 시스템을 채점했습니다. 오픈 모델 21개와 상용 API 9개입니다. 각 시스템은 깨끗한 오디오에서 실행합니다. 같은 오디오에 잔향, 노이즈, 음악, 웅성거림(babble)을 각각 더한 네 가지 열화 버전에서도 실행합니다. 모든 결과 표는 깨끗한 오디오의 점수와 열화 버전 네 개의 점수를 한 행에 놓습니다. 그래서 오디오가 어려워질수록 시스템이 정확도를 얼마나 유지하는지 확인할 수 있습니다.

채점에는 TIMIT의 낭독 음성과 Buckeye의 자발 발화 음성을 사용합니다. 두 코퍼스는 언어학자가 손으로 교정한 음소 및 단어 경계를 제공합니다. 이 경계가 기준입니다. FA-Bench는 자체 어노테이션을 추가하지 않습니다. 경계 시간은 코퍼스가 제공하는 그대로 유지하고, 음소 레이블은 공통 TIMIT-39 세트로 병합합니다.

결과는 두 개의 트랙으로 보고합니다. 정답 전사문 트랙에서는 각 시스템에 기준 단어가 주어지므로, 점수는 타이밍만 측정합니다. ASR 트랙에서는 각 시스템이 단어를 직접 인식하므로, 인식 오류가 타이밍 오류에 더해집니다. 두 트랙의 순위는 따로 매깁니다.

확인한 내용

Olign 1.0은 기준 전사문이 주어진 모든 시스템 가운데 단어 경계 F1이 가장 높습니다. 두 코퍼스 모두에서, 그리고 깨끗한 오디오와 노이즈를 더한 오디오 모두에서 그렇습니다.

20 ms 기준 단어 경계 F1, 정답 전사문 트랙입니다. 높을수록 좋습니다.

시스템 TIMIT core-test Buckeye test
클린 / 노이즈 클린 / 노이즈
Olign 1.0 0.782 / 0.669 0.744 / 0.659
MFA 3.4 0.644 / 0.624 0.682 / 0.583
Qwen3-ForcedAligner-0.6B 0.399 / 0.377 0.432 / 0.391
WhisperX 0.180 / 0.170 0.165 / 0.165

노이즈 값은 네 가지 열화 조건의 평균입니다. 노이즈를 더하면 Montreal Forced Aligner 3.4에 대한 Olign의 격차는 TIMIT에서는 0.138에서 0.045로 좁아지고, Buckeye에서는 0.062에서 0.076으로 벌어집니다.

대상 시스템

기준 전사문을 입력으로 받는 강제 정렬기입니다. BFA · Charsiu · CrisperWhisper · FALCON · MAPS · Montreal Forced Aligner 2.0과 3.4 · MMS-FA · NeMo Forced Aligner · NeuFA · Qwen3-ForcedAligner · stable-ts · TorchAudio-FA · UnitY2 · WhisperX

타임스탬프를 제공하는 오픈 ASR입니다. 각 모델이 단어를 직접 인식합니다. Parakeet-TDT · Qwen3-ASR · TorchAudio wav2vec2 · Whisper large-v3 · Whisper-timestamped

상용 API입니다. Olign · Amazon Transcribe · AssemblyAI Universal 3.5 · Azure AI Speech · Deepgram Nova-3 · ElevenLabs Scribe v2 · Google Chirp 2 · IBM Watson · Speechmatics

2단계 캐스케이드 19개도 함께 채점합니다. 이 캐스케이드에서는 ASR이 만든 단어의 타이밍을 정렬기 중 하나가 다시 맞춥니다.

채점 방법

측정에 앞서 시스템이 만든 각 단위를 기준의 단위와 짝지어야 합니다. FA-Bench는 두 가지 방식으로 짝을 짓습니다. 각 방식에는 사각지대가 있고, 다른 방식이 그 사각지대를 보완하기 때문입니다.

경계 MAE, 중앙값 오차, 부호 있는 오차는 레이블을 먼저 기준으로 삼아 짝을 짓습니다. 레이블에 Levenshtein 정렬을 수행한 뒤, 찾은 짝들의 시간을 비교합니다. 모든 수치에는 부트스트랩 95% 신뢰구간이 붙습니다. 10 ms, 50 ms, 100 ms 임계값 기준 정확도도 옆에 함께 나옵니다. 짝을 찾지 못한 음소는 이 평균에서 빠집니다. 그래서 어려운 음소를 건너뛰어도 여기서는 시스템에 불이익이 없습니다.

S, D, I, PER은 기준 음소가 왜 짝을 찾지 못했는지 보여 줍니다. S는 시스템이 다른 레이블로 바꾼 음소를, D는 시스템이 한 번도 출력하지 않은 음소를, I는 시스템이 지어낸 음소를 셉니다. MAE를 낮추려고 어려운 음소를 건너뛰는 시스템은 D에서 드러납니다. 그래서 MAE가 낮더라도 삭제율이 높다면 반드시 더 나은 것은 아닙니다.

20 ms 기준 경계 F1은 레이블과 시간을 함께 기준으로 삼아 짝을 짓습니다. 경계 양쪽의 단위가 기준과 일치하고 20 ms 이내에 놓일 때만 경계로 인정합니다. 발화의 양 끝 경계도 포함합니다. 이것이 대표 수치입니다. 음소를 건너뛰면 그 옆의 경계까지 잃습니다. 올바른 시점에 나온 치환은 점수를 받지 못합니다.

시간만 보는 정밀도, 재현율, 과분할, R-value는 Details 페이지에서 볼 수 있습니다. 이 지표들은 레이블을 무시합니다. 그래서 잘못된 단어에 붙어 있어도 시점이 맞으면 찾은 경계로 셉니다. 대표 F1은 이런 경계에 점수를 주지 않습니다.

단어 티어는 MAE와, 레이블을 확인하는 동일한 20 ms 기준 F1을 보고합니다. 음소에 의존하지 않으므로, 단어만 출력하는 시스템도 채점할 수 있는 유일한 티어입니다.

직접 실행해 보기

FA-Bench는 매니페스트와 레시피를 제공합니다. 오디오는 직접 구해야 합니다. TIMIT 코퍼스는 LDC에서 받고, Buckeye 코퍼스는 OSU 등록을 거쳐 받습니다. 두 코퍼스 모두 각자의 라이선스를 따릅니다. fabench init 명령을 실행하면 각 코퍼스가 어디에 있는지 묻습니다.

라이선스가 필요한 오디오를 다루기 전에 측정 체인을 먼저 점검해 볼 수 있습니다. 셀프 테스트는 합성 코퍼스를 만들고 그 위에서 전체 체인을 실행합니다. 각 게이트는 결과를 미리 정해 둔 정답과 비교합니다. 그래서 체인이 고장 나 있으면 게이트에서 실패합니다.

git clone https://github.com/olewave/fa-bench && cd fa-bench
uv venv --python 3.12 .venv && . .venv/bin/activate
uv pip install -e ".[test]"
fabench selftest
fabench gates

전체 결과는 GitHub에서 볼 수 있습니다. TIMIT 단어와 Buckeye 단어의 결과, 그리고 방법론 문서가 준비되어 있습니다.

FA-Bench는 PolyForm Noncommercial 1.0.0 라이선스로 공개됩니다. 연구, 교육, 개인 학습, 그리고 자선 단체, 교육 기관, 공공 안전 기관, 환경 단체, 정부 기관의 업무에는 무료로 사용할 수 있습니다. 상업적 이용에는 Olewave의 별도 라이선스가 필요합니다.