利用野生資料進行高投資回報率語音 R&D——我們的 ICASSP 2024 聚焦演講
我們的創始人兼 CEO Wei Chu 的 ICASSP 2024 聚焦演講,關於為什麼傳統語音服務構建的投資回報率低——以及過濾野生資料 + 使用大型開源語音模型自動標記私有資料如何改變局面。
在首爾舉辦的 IEEE ICASSP 2024 上,我們的創始人兼 CEO Wei Chu 發表了一場聚焦演講,談論了使企業語音 R&D 戲劇性降低成本的轉變:停止為人工標籤和現成資料集付費,開始利用野生資料和開源基礎模型。
為什麼傳統語音服務構建的投資回報率低
每家構建語音 AI 的企業都面臨相同的三個誘人的捷徑。每個都有隱藏的投資回報率上限:
呼叫雲 API 快速原型化,極小的 R&D 成本。但不能針對你的產品進行定製,在你的特定資料上的性能不夠令人滿意,大規模使用時成本高昂,每個請求都是潛在的資料洩露向量。
從供應商購買 從紙面上看比自助開發便宜。實際上:來自資料和系統供應商的大額帳單、性能不佳(因為公司間通訊開銷),以及仍然存在資料洩露風險。
像科技巨頭一樣自助 (Alexa、Siri、Google Voice Search) 自研堆棧、完整的資料安全——以及在你推出之前,在 R&D 團隊、資料策劃和基礎設施上花費五年時間和數千萬投資。
其他「便宜」替代方案表現也不佳。海外合同團隊、現成模擬資料集或收購陷入困境的初創公司都會犧牲投資回報率以節省現金。
高投資回報率替代方案——站在大型語音模型的肩膀上
兩個轉變支撐了 Olewave 的方法:
遵循規模法則。 自 2022 年以來,科技巨頭一直在開源 CC-BY 大型語音模型——Whisper、SeamlessM4T 等。你不再需要重新發明輪子。微調基礎模型到你的利基,而不是從頭訓練。這消除了大部分 R&D 團隊、資料策劃和訓練基礎設施支出。
過濾野生資料並自動標籤化私有資料。 過濾的野生資料——由 AI 驅動的標籤系統生成的已驗證轉錄、時間戳和主題標籤——用於微調域模型。該域模型隨後使用置信度分數標籤你的專有資料。無人工標籤人員。無資料離開你的基礎設施。無洩露風險。無預模擬資料集的帳單。
我們的四步客製化標籤化流程
- 快速開始——選擇與用戶相同領域的野生資料,並從大型語音/語言基礎模型微調域模型。
- 自動標籤化——域模型使用每詞和每話語置信度分數標籤用戶的專有資料。不需要人工標籤人員——因此也沒有資料洩露風險。
- 迭代學習——編譯一組標籤化的私有和公共資料,再次微調域模型,然後用改進版本重新標籤化私有資料。重複直到質量停滯。
- 準備好開始——當質量充分時停止迭代。我們授權我們的 Tycho SDK,以便你可以繼續在自己的基礎設施上標籤化和構建。
為什麼這很重要
- 無需人工標籤人員的域特定模型的監督訓練——企業語音項目中最大的經常性成本。
- 無資料洩露風險——私有資料永不離開你的環境。
- 明顯更低的標籤成本——模型進行工作;人工審查邊界情況。
- 相同的微調工作流程擴展到新的領域、語言和使用案例,隨著你的產品成熟。
與我們聯繫
如果你正在為語音 AI 產品評估構建與購買,或試圖減少現有語音產品上的資料標籤支出,我們很樂意比較意見。
發送電子郵件至 [email protected] 或通過網站聯繫——我們將在一個工作日內回復。
