Инструментальная роль LLM: как экономить деньги при создании сервиса для изучения английского
Разработчик сервиса Yet Another English объясняет, почему в создании образовательного тренажера искусственный интеллект используется лишь как узкоспециализированный подрядчик, а основу работы составляют проверенные частотные списки и алгоритмы интервальных повторений 1987 года.

# Инструментальная роль LLM: экономика создания языка-тренажера
В эпоху, когда каждый новый сервис обещает революцию на основе генеративного искусственного интеллекта, проект «Yet Another English» предлагает альтернативный подход. Автор, менеджер продукта с уровнем английского B1, создал веб-приложение (PWA) для самостоятельного изучения языка. Ключевой философией разработки стало использование больших языковых моделей (LLM) не как основы продукта, а как решения для узких задач, которые невозможно выполнить традиционными методами. Итоговый бюджет расходов на генерацию контента с помощью ИИ составил около 10 долларов.
Воронка обработки данных: когда модель не нужна
Типичный сценарий создания словаря из видео подразумевает отправку транскрипта в нейросеть с просьбой выделить слова уровня B1. Однако автор проекта утверждает, что такая стратегия неэффективна: модели не знают реального словарного запаса конкретного пользователя, а обработка текстов объемом в несколько тысяч слов требует дорогих вычислительных ресурсов и времени.
Вместо этого была построена многоступенчатая «воронка», где ИИ задействован только на финальном этапе:
1. Извлечение субтитров: Скрипт автоматически скачивает текстовую основу видео с YouTube без распознавания аудио. 2. Лемматизация и очистка: Используется бесплатное программное обеспечение для приведения слов к начальной форме и удаления лишнего шума. 3. Частотный фильтр: На этом этапе, основываясь на статистических данных, алгоритм отсекает слова, которые пользователь, скорее всего, уже знает. 4. Сверка со словарем: Система сопоставляет оставшиеся слова со собственной базой данных из 48 000 лексем, где хранятся формы слов, транскрипции, уровни сложности и примеры использования. Это делается мгновенно и бесплатно. 5. Роль LLM: Искусственный интеллект вызывается ровно один раз на каждое видео. Его задача — только перевод фразовых глаголов, идиом и выражений, которые не были найдены в базе данных. Это «конечная миля», где нейросеть выступает работягой, выполняющей специфическую задачу, которую сложно автоматизировать классическими правилами.
Такой подход позволяет избежать ошибок, свойственных нейросетям, и обеспечивает стабильную работу сервиса. Если модель выдаст неверный ответ, система просто пропустит фразу, не ломая общий процесс обучения.
Алгоритмизация вместо магии: супермнемоника
Сервис «Yet Another English» опирается на алгоритм интервальных повторений SM-2, разработанный в 1987 году в рамках системы SuperMemo. Этот метод считается одним из самых эффективных для запоминания информации.
Когда пользователь пропускает карточку с определенным словом, система не переносит задание на следующий день. Вместо этого карточка возвращается в текущую сессию, но позже, через несколько заданий. Это предотвращает монотонность процесса и учит мозг оптимизировать время.
Для разнообразия ежедневных тренировок дневная сессия автоматически ротировает шесть типов упражнений:
* Карточки с переводом; * Выбор правильного перевода; * Угадай слово по определению; * Подстановка синонима; * Вставка слова в предложение; * Сборка слова из букв.
Все данные, включая прогресс пользователя, хранятся локально в базе данных браузера (IndexedDB). Синхронизация между устройствами осуществляется через Яндекс ID, что гарантирует сохранение данных даже при удалении кэша или очистке браузера. Бэкенд системы представляет собой единый процесс на Node.js с использованием SQLite.
Адаптивный тест как фильтр самообмана
Критически важным элементом сервиса является определение уровня пользователя. Простой выбор из вариантов «A2» или «B1» часто приводит к ошибочным решениям из-за самообмана. Для борьбы с этим автор создал адаптивный тест.
Слова разбиты на частотные полосы от самых популярных (top-1000) до крайне редких. Ответы пользователя формируют его профиль: чем точнее он определяет известные слова, тем выше его оценка. В процессе теста пользователю могут попадаться «ловушки» — слова, которые кажутся знакомыми, но имеют нюансированное значение или редкую форму, что снижает уровень оценки при ошибке.
Математическая модель экстраполирует результат тестирования на шкалу CEFR. Хотя сертификат по итогам теста не выдается, его цель — продуктивная: за пару минут найти «золотую середину» сложности, где обучение будет интересным, но не вызывающим боли.
Этот подход позволяет сразу формировать персональную подборку слов следующего уровня, готовую к занятиям.
Заключение: факты важнее трендов
Разработка проекта длилась два месяца вечерней работы и привела к 595 коммитам кода. Главный вывод автора заключается в том, что в задачах по обработке языковых данных часто дешевле и надежнее обратиться к статистическим датасетам и алгоритмам, а ИИ оставить только для задач, где нужны творческие решения или перевод редких коллокаций.
В отличие от большинства современных решений, сервис не требует подписок или рекламы, полностью бесплатен и доступен как веб-приложение, так и через приложение в RuStore. Проект демонстрирует, что «сайт эпохи ИИ» может быть построен на прочном фундаменте классической педагогики и инженерной точности, где нейросеть выступает в роли помощника, а не главного архитектора.