誇りをもってご提供します

Olign、Olewaveのランセットのように精密な、音声とテキストの強制アライメントサービス

録音を、その書き起こしテキスト、またはASRの結果とあわせて送信してください。どちらもない場合は、Olignが自ら音声を文字起こしします。すべての単語と音素が、開始時刻と終了時刻、そして0から100までのスコアとともに返されます。Olignの単語タイムスタンプは、Montreal Forced Aligner、Qwen3-ForcedAligner、WhisperXのものより正確です。

REST · ベータ https://api.olewave.com/olign/v1

無料のベータアクセスを受け付けています。招待コードをリクエストして、ご自身のAPIキーを作成してください。

単語タイムスタンプは、見た目ほど正確ではないことがよくあります。FA-Benchの論文によると、Whisperは単語を約150 ms早い位置に置きます。また、8つの商用音声テキスト変換APIのうち7つは単語の開始が遅く、そのうち3つは50 ms以上遅れています。強制アライナーは、失敗の仕方が異なります。Buckeyeのテスト分割に背景ノイズを加えると、Montreal Forced Aligner 3.4は4,513発話のうち354発話でアライメントを返しませんでした。

私たちは、ノイズの多い録音も含めた実際の録音で、単語境界を正確に置けるようにOlignを開発しました。

すべての強制アライナーの中で最高の境界F1

同じ書き起こしテキストを与えた場合、OlignはFA-Benchが評価する他のどの強制アライナーよりも正確に単語境界を置きます。これは両方のコーパスで、クリーンな音声でもノイズを加えた音声でも同じです。TIMIT core-testでの単語境界F1は、Olignが0.782、Montreal Forced Aligner 3.4が0.644です。Olignの単語の開始は、平均で3.1 ms早い位置に収まります。F1はこのベンチマークの主要指標です。システムが配置できなかった単語もすべて数えるためです。平均絶対誤差は、そうした単語を計算に含めません。

すでにお使いのASRに、より正確なタイミングを

音声認識エンジンはそのまま使い、単語のタイミングはOlignに任せてください。TIMIT core-testでGoogle Chirp 2が認識した単語をOlignに渡すと、その単語境界F1は0.443から0.734に上がります。認識された単語は変わりません。そのため、向上分はすべてタイミングによるものです。この方法で実行すると、Olignはベンチマーク内の8つの商用APIすべてのタイムスタンプを、どの分割でも上回ります。

ノイズの多い音声でも安定したアライメント

Buckeyeのテスト分割全体では、クリーンな音声と4種類の劣化を加えた音声の合計22,565発話のうち、Olignがアライメントを返さなかったのは3発話だけでした。Montreal Forced Aligner 3.4は573発話で何も返しませんでした。

ご自身で確認できる数値

このページの結果はすべてFA-Benchによるものです。FA-Benchはオープンソースで、arXivの論文で解説されています。公表した数値を出したv0.9 APIは引き続き利用できます。そのため、数値を再現できるほか、現在お使いの技術スタックに対して同じベンチマークを実行できます。

音声をネットワークの外に出せない場合はセルフホスト

録音データをご自身のVPC内にとどめる必要がある場合は、セルフホストでの導入についてご相談に応じます。

FA-Benchにおける単語タイムスタンプの精度

FA-Bench
0.0 0.2 0.4 0.6 0.8 1.0 F1 0.763 Olign 0.663 MFA 0.415 Qwen3 0.172 WhisperX 静かな環境 0.664 Olign 0.603 MFA 0.384 Qwen3 0.168 WhisperX ノイズ環境
OlignMFAQwen3-FAWhisperX
単語境界の20 msでのF1です。値が高いほど良好です。境界が正しいと数えられるのは、両側の単語が正解と一致し、人手でラベル付けされた境界から20 ms以内に収まった場合だけです。分割は、FA-Benchで定義されたTIMIT core-testとBuckeye testで、2026年9月のスナップショットを使っています。スコアはfabenchプロトコルに従い、10 msのグリッド上で算出し、ブートストラップによる95 %信頼区間を付けています。4つのシステムはすべて、正解書き起こしのトラックで実行しています。それぞれに正解の単語が渡されるため、測定されるのはタイミングだけです。これらの数値に認識誤りは含まれません。どちらの分割もホールドアウトされ、話者が重なりません。TIMIT core-testは、コーパスのドキュメントが求めるとおりSA文を除外しています。Buckeyeのテスト分割は、そのコーパス固有の性別と年齢の組み合わせによる設計に沿って層化されており、話者数は24名、8名、8名です。分割への所属は、発話ごとにリポジトリへコミット済みです。ノイズ環境は、4種類の劣化の平均値です。劣化は、残響、ノイズ、音楽、多人数の話し声です。比較対象は、Montreal Forced Aligner 3.4.1、Qwen3-ForcedAligner-0.6B、WhisperX 3.8.6です。TIMITとBuckeyeの全結果をご覧いただけます。

無料のベータアクセスを、アメリカ英語とイギリス英語向けに受け付けています。対応言語は今後増やす予定です。招待コードをリクエストしてAPIキーを作成すると、最長60分の録音を丸ごとジョブとして送信できます。ベータでは、1アカウントあたり1日60分の音声を処理できます。ジョブの実行時間は、録音の長さのおよそ8分の1です。このページの精度の数値は、アメリカ英語で測定したものです。

ベータ期間中はOlignを無料でお試しください。

招待コードをリクエストして、APIキーを作成してください。ベータでは1日60分の音声を利用できます。現在お使いのアライナーやASRとOlignを比べて測定するには、十分な量です。

招待コードをリクエスト →