LioShuTan:AI 驅動的口說評估與語言學習平台

LioShuTan 使用 SIRAYA Model Router,透過語音轉文字(ASR)與文字轉語音(TTS)技術,支援 AI 驅動的語言學習與口說評估體驗。

概述

LioShuTan 是一個專注於語言學習體驗的教育平台,涵蓋 AI 口說練習、聽力訓練、發音評估以及互動式學習流程。

該平台目前使用 BytePlus 語音轉文字(ASR)與文字轉語音(TTS)服務,用於口說驗證與 AI 輔助聽力互動。其核心流程會評估使用者在不同學習情境與年齡層中,是否能準確地發音並表達單字與句子。

同時,該平台也正積極評估 Azure Pronunciation Assessment 等進階發音評估能力,以實現更細緻的語音分析與詳細的發音回饋。

隨著產品即將在未來數月內正式全面上線,擴充性、低延遲回饋以及靈活的 AI 編排變得越來越重要。

實際挑戰

在 AI 驅動的語言學習環境中,LioShuTan 遇到了多項生產級挑戰:

  • 不同 ASR 模型在發音評估準確度上呈現明顯差異
  • 目前的單字層級信心分數無法精確識別特定的發音問題
  • 不同語言、年齡層與學習情境需要不同的 AI 語音能力
  • 即時口說評量工作負載需要低延遲且穩定的基礎架構
  • 該平台需要在多個語音 AI 供應商之間進行持續評估與測試

此外,與標準語音 AI 使用情境相比,教育類語音應用在回饋品質、反應速度與使用者體驗方面需要顯著更高的標準。

解決方案

SIRAYA 為 LioShuTan 提供了統一的 Model Router 架構,可集中存取多個語音 AI 服務、進行動態路由,並支援彈性的模型評估。

透過 SIRAYA Model Router,該平台能彈性協調 BytePlus ASR/TTS、Azure Pronunciation Assessment 及其他語音 AI 服務,同時針對不同學習任務與發音評估情境動態選擇最合適的模型。

主要能力包括:

  • 跨多個語音 AI 服務的統一存取與管理
  • 彈性測試不同的 ASR 與發音評估模型
  • 依據學習情境進行動態語音 AI 編排
  • 提升即時口說評量工作負載的穩定性
  • 降低多供應商語音 AI 整合的複雜度

可衡量的成效

整合 SIRAYA Model Router 後,LioShuTan 在 AI 語言學習體驗與語音 AI 營運方面皆取得顯著提升:

  • 更穩定的 AI 口說回饋與互動式學習體驗
  • 在測試不同 ASR 與發音評估能力方面具備更高彈性
  • 更能適應不同年齡層與語言學習情境
  • 降低多供應商語音 AI 系統的營運複雜度
  • 更容易擴展至新的 AI 語言學習功能與工作流程

更重要的是,LioShuTan 建立了可擴展的語音 AI 基礎架構,專為長期 AI 輔助語言學習環境而設計。

「SIRAYA Model Router 讓我們能更有效率地評估不同的語音 AI 服務與發音評估能力。」
— 技術長,IT 團隊,LioShuTan

分享此案例研究:

其他客戶案例

看看 SIRAYA 能做些什麼 為您!

您可以成為下一個精彩故事。讓我們向您展示如何做到!