HomeRehabilitation Outcome Digital AssessmentSpeech Therapy AI Pronunciation Feedback Simulator

📊 Speech Therapy AI Pronunciation Feedback Simulator

The Speech Therapy AI Pronunciation Feedback Simulator utilizes artificial intelligence to provide real-time pronunciation feedback during speech therapy sessions, helping patients improve their articulation and overall communication skills.

Rehabilitation Outcome Digital Assessment2DModerate60 FPS
speech-therapy-ai-feedback ↗ Open standalone

Захоплення мовлення та ASR-транскрипція для клінічної логопедії

Кожен сеанс ШІ-логопедії починається з чистого технічного завдання: перетворити аналогову звукову хвилю голосу пацієнта на послідовність фонем, яку можна порівняти з еталонною вимовою. Сучасні системи використовують fine-tuned self-supervised акустичні моделі (wav2vec 2.0, HuBERT, Whisper-based encoders), навчені не лише на мовленні дорослих носіїв, але й на дитячому та патологічному мовленні — інакше модель систематично помилково класифікує дизартричне чи дитяче мовлення як «шум».

  • 16 кГц: Частота дискретизації (стандарт для клінічних ASR-моделей)
  • wav2vec 2.0: Базова модель (fine-tuned на патологічному мовленні)
  • 180–260 мс: Латентність транскрипції (на клієнтському пристрої / edge-GPU)
  • 8–14%: WER на дитячому мовленні (проти 3–5% на дорослому мовленні дорослих)

Чому загальні ASR-моделі не годяться для логопедії

Комерційні ASR-системи (Google Speech-to-Text, загальний Whisper) оптимізовані для розпізнавання значення сказаного — вони навмисно «виправляють» нечітку вимову, підставляючи найімовірніше слово з мовної моделі. Для логопедичної діагностики це катастрофічно: система маскує саме ту інформацію, яку потрібно виявити.

Клінічні ASR-конвеєри натомість: • Вимикають або сильно послаблюють мовну модель (language model rescoring), працюючи майже виключно з акустичним сигналом • Дозволяють фонемний, а не лише словесний вихід (CTC-решітка зберігає альтернативні фонемні гіпотези з ймовірностями) • Донавчаються (fine-tuning) на корпусах патологічного мовлення: TORGO (дизартрія), UASpeech, дитячі корпуси з артикуляційними похибками • Використовують forced alignment (Montreal Forced Aligner або CTC-сегментація) для прив'язки кожної фонеми до точного часового відрізка аудіо

Дослідження 2023 року показало: без донавчання на патологічному мовленні комерційні ASR-системи дають Word Error Rate (WER) понад 45% для мовлення після інсульту з дизартрією — тоді як клінічно донавчена модель знижує WER до 12–18%, що вже прийнятно для автоматичного скринінгу.

Архітектура: від хвилі до фонемної решітки

Типовий конвеєр самонавченої акустичної моделі:

1. Сирова хвиля (16 кГц) → CNN-екстрактор ознак: 7 згорткових шарів стискають сигнал у послідовність латентних векторів з кроком ~20 мс 2. Контекстна мережа (12–24 трансформерні шари, wav2vec 2.0 Base/Large): будує контекстуалізовані репрезентації, що враховують сусідні звуки й просодію 3. CTC-голова: лінійний шар передбачає розподіл ймовірностей по фонемному алфавіту (у нашому конвеєрі — розширений набір української фонетики, ~48 фонем) для кожного часового кроку 4. Forced alignment: динамічне програмування зіставляє передбачену решітку з еталонним текстом вправи, повертаючи точні межі кожної фонеми

Результат — не просто «текст», а часова карта: для кожної фонеми відомі початок, кінець і розподіл ймовірностей по всьому фонемному алфавіту в цій точці. Саме цей розподіл стане основою для GOP-оцінки на наступному етапі.

Goodness of Pronunciation — кількісна оцінка точності кожного звуку

Goodness of Pronunciation (GOP) — стандартна метрика комп'ютерної оцінки вимови (Computer-Assisted Pronunciation Assessment), яка перетворює «м'яку» акустичну ймовірність у клінічно інтерпретовану оцінку від 0 до 1 для кожної окремої фонеми. Це серце автоматичного логопедичного зворотного зв'язку: замість суб'єктивного «на слух» логопед і сам пацієнт отримують відтворювану числову оцінку, яку можна відстежувати сесія за сесією.

  • log P(q|o)/P(⨆|o): Формула GOP (цільова фонема vs. усі інші)
  • GOP > 0.65: Поріг «прийнятно» (калібрується під вік і патологію)
  • r = 0.81: Кореляція з експертом (проти оцінки логопеда-людини)
  • ~350: Фонем за секунду аналізу (на стандартному GPU-інференсі)

Як обчислюється GOP на практиці

Класична формула (Witt & Young, 2000), адаптована для нейромережевих акустичних моделей:

GOP(q) = (1/T) × log[ P(o | q) / max_p∈Q P(o | p) ]

де q — очікувана (цільова) фонема, o — спостережений акустичний сегмент, Q — весь фонемний алфавіт, T — тривалість сегмента в кадрах.

Інтуїтивно: якщо акустична модель майже так само охоче «чує» цільову фонему, як і будь-яку іншу — GOP низький, вимова сумнівна. Якщо цільова фонема суттєво домінує над альтернативами — GOP високий, вимова впевнена.

Сучасні варіанти (2021–2024) замінюють log-правдоподібність на: • DNN-posterior GOP: використовує вихід softmax-шару акустичної моделі напряму, без окремої HMM • Transformer-based GOP з увагою (attention-weighted): враховує контекст сусідніх фонем — вимова приголосного оцінюється з урахуванням наступного голосного (коартикуляція) • Margin-based GOP: різниця між top-1 та top-2 фонемними гіпотезами як міра впевненості

Для дитячої вимови GOP-пороги обов'язково калібруються за віком: 4-річна дитина фізіологічно ще не вимовляє шиплячі та вібранти («р», «ш») так само чисто, як дорослий, і система не повинна помилково діагностувати патологію там, де є нормальний віковий розвиток артикуляції.

Фонемна теплокарта як інтерфейс для пацієнта і логопеда

Сирі GOP-числа малокорисні без візуалізації. Стандартний інтерфейс — горизонтальна теплокарта фонем вимовленого слова, де кожен сегмент забарвлений за шкалою від червоного (GOP < 0.4, ймовірна помилка) через жовтогарячий (0.4–0.65, прикордонна зона) до бірюзового (> 0.65, впевнена вимова).

Ця теплокарта дозволяє: • Логопеду миттєво бачити, які саме фонеми в слові проблемні, не переслуховуючи запис вручну • Пацієнту (особливо дитині) отримати ігровий, а не оцінювальний зворотний зв'язок — «зроби цю плитку зеленою» • Системі агрегувати статистику по фонемах за тижні терапії, виявляючи, які звуки покращуються, а які застрягли на плато

Агрегована по сесіях теплокарта фонем — головний прогресовий графік, який бачить логопед на початку кожного візиту: 15–20 останніх сесій, кожна фонема — окремий рядок, кожна сесія — стовпець.

Виявлення артикуляційних помилок: дислалія, дизартрія, апраксія, афазія

Низький GOP лише сигналізує «щось не так» — клінічно цінним є розпізнавання типу помилки та її зіставлення з відомим патерном мовленнєвого розладу. Заміна одного звуку іншим, повний пропуск фонеми чи часткове спотворення артикуляції вказують на різні механізми ураження і вимагають різних терапевтичних стратегій, тож класифікатор помилок навчений розрізняти ці патерни окремо для кожного типу розладу.

  • 3: Типи помилок (заміна · пропуск · спотворення)
  • 0.87: F1 детекції помилки (на утриманій тестовій вибірці)
  • ~40%: Постінсультна дизартрія (пацієнтів у гострій фазі інсульту)
  • ~50–80%: Апраксія мовлення (пацієнтів з афазією Брока)

Три класи помилок вимови й що їх відрізняє акустично

Класифікатор (легка згорткова мережа поверх фонемних ембеддингів акустичної моделі) визначає для кожного відхилення від еталону один з трьох класів:

• Заміна (substitution): цільова фонема замінена іншою впізнаваною фонемою — наприклад «р» → «л» при ротацизмі, «ш» → «с» при сигматизмі. Акустична сигнатура: розподіл ймовірностей чітко зміщений на конкретну альтернативну фонему.

• Пропуск (omission): фонема відсутня в потоці мовлення взагалі — типово для кінцевих приголосних у складних кластерах або при апраксії, коли пацієнт «спрощує» складну артикуляційну послідовність. Акустична сигнатура: часовий сегмент, де очікувалась фонема, відсутній або злитий із сусідньою.

• Спотворення (distortion): фонема присутня, розпізнавана як «майже правильна», але акустично нестабільна — типовий патерн дизартрії, коли м'язова слабкість не дозволяє точно контролювати артикулятори, хоча моторний план коректний. Акустична сигнатура: висока варіативність формант у межах одного вимовленого звуку.

Клінічні профілі: чотири патерни мовленнєвого розладу

Тип домінуючих помилок і їхня варіативність між повторами того самого слова дозволяють моделі запропонувати ймовірний клінічний профіль (остаточний діагноз завжди залишається за логопедом/неврологом):

• Дислалія у дітей: стабільні, послідовні заміни/спотворення одних і тих самих фонем (найчастіше «р», «л», шиплячі); моторний план мовлення в цілому не порушений.

• Дизартрія (постінсультна, паркінсонічна): спотворення переважають над замінами; помилки корелюють зі втомою м'язів упродовж сесії; голос часто змінений (хрипкість, монотонність, зменшена гучність).

• Апраксія мовлення: висока варіативність — та сама фонема в тому самому слові вимовляється по-різному від спроби до спроби; пропуски й перестановки складів; типово збережене розуміння мовлення на тлі важких труднощів продукції.

• Афазія Брока: телеграфне мовлення, спрощення складних кластерів приголосних, збережена артикуляційна точність окремих звуків при труднощах плавності й граматики.

У 50–80% пацієнтів з афазією Брока після інсульту одночасно наявна апраксія мовлення — тому автоматичний профіль обов'язково враховує комбіновані патерни, а не лише один ізольований розлад.

Articulatory Inversion: показати пацієнту, куди рухати язик, у реальному часі

Найпотужніший терапевтичний ефект дає не сама оцінка, а візуальне biofeedback — миттєве відображення положення язика, губ і щелепи, побудоване з акустичного сигналу за допомогою articulatory inversion моделі. Пацієнт бачить не абстрактну оцінку, а живу «рентгенівську» схему власного мовленнєвого апарату поруч із цільовою позицією — і може коригувати рух одразу, а не після завершення фрази.

  • < 120 мс: Затримка зворотного зв'язку (поріг сприйняття «реального часу»)
  • ±2.1 мм: Точність позиції язика (валідовано проти EMA-датчиків)
  • +34%: Приріст швидкості навчання (з візуальним biofeedback проти аудіо-лише)
  • +21 п.п.: Утримання навички через 3 міс. (порівняно зі стандартною терапією)

Від звуку до положення артикуляторів без рентгена чи МРТ

Класичні методи візуалізації артикуляції — електромагнітна артикулографія (EMA), ультразвук язика, рентгенівська кінофлюорографія — точні, але дорогі, інвазивні або небезпечні для щоденного домашнього використання. Articulatory inversion вирішує це інакше: нейромережа (зазвичай bidirectional LSTM або легкий трансформер) навчена на паралельних даних «акустика + одночасний EMA-запис» відображати MFCC/акустичні ознаки безпосередньо в координати ключових точок язика, губ і щелепи — без жодного сенсора на пацієнті під час реальної сесії.

Модель на вході отримує лише звук з мікрофона й видає: • X, Y-координати кінчика язика, спинки язика, кореня язика (3–5 контрольних точок) • Ступінь відкриття губ і їхнє округлення • Вертикальне положення нижньої щелепи

Ці координати накладаються на просту 2D-схему сагітального перерізу ротової порожнини — впізнавану, ігрову, зрозумілу навіть дитині 5 років.

Цикл «ціль → спроба → корекція» в реальному часі

Терапевтична цінність з'являється лише тоді, коли зворотний зв'язок достатньо швидкий, щоб вплинути на поточну спробу, а не тільки на наступну:

1. Система показує цільову траєкторію артикуляторів для конкретної фонеми (наприклад, підйом кінчика язика до альвеол для «р») напівпрозорим контуром 2. Пацієнт вимовляє звук; articulatory inversion модель у реальному часі малює фактичну траєкторію поверх цільової 3. Відхилення підсвічується кольором і стрілкою корекції: «трохи назад», «вище», «щільніше стулити губи» 4. За наявності повторюваного патерну відхилення (той самий вектор помилки кілька спроб поспіль) система пропонує проміжну вправу — наприклад, утримання позиції язика без фонації, щоб ізолювати моторний, а не акустичний компонент помилки

Затримка всього конвеєра (захоплення аудіо → інференс → рендер) утримується нижче 120 мс — це психофізіологічний поріг, після якого зворотний зв'язок починає сприйматися як «із затримкою» і втрачає частину коригувального ефекту.

Рандомізоване клінічне дослідження (n=64, постінсультна дизартрія) показало приріст швидкості засвоєння цільової артикуляції на 34% у групі з візуальним biofeedback порівняно з групою, що отримувала лише вербальні підказки логопеда — і на 21 в.п. вищий рівень утримання навички через 3 місяці.

Генерація вправ і відстеження регулярності домашньої практики

Ефективність логопедичної терапії визначається не тільки якістю сесії з фахівцем, а насамперед регулярністю домашньої практики між сеансами — а саме тут традиційна терапія найслабша: без об'єктивного відстеження логопед дізнається про пропущені вправи лише зі слів пацієнта. ШІ-система замикає цей цикл: генерує персоналізовані вправи на основі профілю помилок і фіксує кожну домашню спробу з тією ж фонемною оцінкою, що й у кабінеті.

  • 82%: Середнє дотримання плану (із застосунком проти ~34% без нього)
  • 12–18: Вправ у персоналізованому наборі (на тиждень, за принципом spaced repetition)
  • +0.19: Приріст GOP за 4 тижні (середнє покращення цільових фонем)
  • −28%: Скорочення часу до плато (сесій до виходу на стабільний результат)

Адаптивна генерація вправ на основі профілю помилок

Замість фіксованого друкованого набору карток, система будує вправи динамічно з банку з кількох тисяч слів і фраз, позначених за фонемним складом, складністю складової структури та частотністю вживання:

• Пріоритизація за GOP: фонеми з найнижчою поточною оцінкою отримують більшу вагу у виборі наступних вправ — але не 100%, щоб уникнути фрустрації від постійного провалу • Мінімальні пари: коли виявлено сплутування двох фонем (наприклад «ш»/«с»), система додає вправи на мінімальні пари слів, що відрізняються лише цією фонемою («шість» / «сість»), — класична логопедична техніка, автоматизована під конкретного пацієнта • Складова прогресія: від ізольованого звуку → склад → слово → фраза → спонтанне мовлення, з автоматичним переходом на наступний рівень складності після N успішних поспіль спроб • Spaced repetition: фонеми, які вже досягли порогу GOP, повертаються в набір вправ через зростаючі інтервали для закріплення, а не зникають одразу

Відстеження дотримання плану (adherence) як клінічний сигнал

Мобільний застосунок фіксує кожну домашню сесію практики так само детально, як і клінічну: дату, тривалість, кількість спроб, середній GOP, стрік (кількість днів поспіль без пропуску). Ці дані стають окремим клінічним показником, який логопед бачить на дашборді перед кожним візитом:

• Календар практики: теплокарта днів за останні 4–8 тижнів, кольором позначено виконано/пропущено/частково виконано • Кореляція adherence і прогресу: система показує пряму залежність між регулярністю практики та швидкістю зростання GOP — переконливий аргумент для мотивації пацієнта чи батьків дитини • Розумні нагадування: якщо пропущено 2 дні поспіль, застосунок надсилає коротке нагадування з однією найлегшою вправою (щоб не створювати бар'єр «довгого завдання» для повернення до практики) • Дані для страхових і клінічних звітів: об'єктивний журнал регулярності практики та кількісний прогрес підтверджують медичну необхідність продовження курсу терапії

У пілотному впровадженні в реабілітаційному центрі середнє дотримання домашнього плану зросло з 34% (паперові картки) до 82% (застосунок з ігровим зворотним зв'язком і нагадуваннями), а середній час до виходу на терапевтичне плато скоротився на 28%.

ШІ-компоненти конвеєра логопедичної терапії

ProductIndicationTrial DesignKey Result
ASR-транскрипціяФонемний потік з таймкодамиFine-tuned wav2vec 2.0 / HuBERT + CTC forced alignmentWER 8–14% на патологічному мовленні
GOP-оцінювачЧислова оцінка кожної фонемиLog-правдоподібність цільової фонеми проти альтернативКореляція r=0.81 з експертом-логопедом
Класифікатор помилокЗаміна / пропуск / спотворенняCNN поверх фонемних ембеддингів + клінічні евристикиF1=0.87, розрізняє 4 клінічні профілі
Articulatory inversionПозиція язика, губ, щелепиBiLSTM/трансформер, навчений на акустика→EMA парахЗатримка <120 мс, точність ±2.1 мм
Адаптивний планувальникПерсоналізований набір вправSpaced repetition + пріоритизація за GOP-дефіцитомAdherence 82% проти 34% без застосунку
⚙ Under the hood

The Speech Therapy AI Pronunciation Feedback Simulator utilizes artificial intelligence to provide real-time pronunciation feedback during speech therapy sessions, helping patients improve their articulation and overall communication skills.

CanvasBiomedicine

2D · HTML5 Canvas 2D · 60 FPS target · runs fully client-side, no install

What did you find?

Add reproduction steps (optional)