LioShuTan 使用 SIRAYA Model Router,透過語音轉文字(ASR)與文字轉語音(TTS)技術,支援 AI 驅動的語言學習與口說評估體驗。
概述
LioShuTan 是一個專注於語言學習體驗的教育平台,涵蓋 AI 口說練習、聽力訓練、發音評估及互動式學習流程。
該平台目前使用 BytePlus 語音轉文字(ASR)與文字轉語音(TTS)服務,用於口說驗證與 AI 輔助聽力互動。其核心流程會評估使用者在不同學習情境與年齡層中,是否能準確發音並表達單字與句子。
同時,該平台也正積極評估 Azure Pronunciation Assessment 等進階發音評估能力,以實現更細緻的語音分析與詳細的發音回饋。
隨著產品即將在未來數月內全面正式上線,擴展性、低延遲回饋以及彈性的 AI 編排變得越來越重要。
實際挑戰
在 AI 驅動的語言學習環境中,LioShuTan 遇到了多項生產級挑戰:
- 不同 ASR 模型在發音評估準確度上呈現明顯差異
- 目前的單字層級信心分數無法精確識別具體的發音問題
- 不同語言、年齡層與學習情境需要不同的 AI 語音能力
- 即時口說評量工作負載需要低延遲與穩定的基礎架構
- 該平台需要在多個語音 AI 供應商之間進行持續評估與測試
此外,與一般語音 AI 使用情境相比,教育類語音應用對回饋品質、回應速度與使用者體驗有更高的要求。
解決方案
SIRAYA 為 LioShuTan 提供統一的 Model Router 架構,支援集中存取多項語音 AI 服務、動態路由,以及彈性的模型評估。
透過 SIRAYA Model Router,該平台能夠靈活編排 BytePlus ASR/TTS、Azure Pronunciation Assessment 及其他語音 AI 服務,並針對不同學習任務與發音評估情境動態選擇最合適的模型。
主要能力包括:
- 跨多項語音 AI 服務的統一存取與管理
- 靈活測試不同的 ASR 與發音評估模型
- 根據學習情境進行動態語音 AI 編排
- 提升即時口說評量工作負載的穩定性
- 降低多供應商語音 AI 整合的複雜度
可衡量的成效
整合 SIRAYA Model Router 後,LioShuTan 在 AI 語言學習體驗與語音 AI 營運方面皆取得顯著改善:
- 更穩定的 AI 口說回饋與互動式學習體驗
- 在測試不同 ASR 與發音評估能力方面具備更高彈性
- 更能適應不同年齡層與語言學習情境
- 降低多供應商語音 AI 系統的營運複雜度
- 更容易擴展至新的 AI 語言學習功能與工作流程
更重要的是,LioShuTan 建立了可擴展的語音 AI 基礎架構,專為長期 AI 輔助語言學習環境而設計。