Не всегда нужно думать: новая система учит модели экономить ресурсы в задачах генерации SQL
Методы преобразования текста в SQL традиционно полагаются на сложные цепочки рассуждений, даже для простых запросов. Исследователи представили подход AutoThinkSQL, который научил модели динамически отключать логическое мышление для простых операций и использовать его только там, где это действительно необходимо.
# Отказ от лишних вычислений в задачах Text-to-SQL
Системы искусственного интеллекта, преобразующие естественный язык в языки запросов к базам данных (Text-to-SQL), столкнулись с дилеммой производительности. Методы, основанные на цепочках рассуждений (Chain-of-Thought или CoT), демонстрируют высокие результаты на сложных задачах, но требуют значительных вычислительных ресурсов. Часто они принудительно требуют от модели выстраивать логические цепочки даже для элементарных запросов на выбор данных.
Новое исследование, опубликованное на arXiv, предлагает решение этой проблемы через метод AutoThinkSQL. Данная архитектура позволяет модели самостоятельно определять сложность запроса: если речь идет о простой выборке или агрегации, модель пропускает этап глубокого анализа, а если требуется многошаговая логика — активация механизма CoT происходит автоматически.
Суть проблемы: расточительство алгоритмов
В современных реалиях обработки данных большинство запросов пользователей не требуют сложного дедуктивного анализа. Например, запрос «Покажи销售额 за последний месяц» может быть решен простым сканированием таблицы. Однако традиционные алгоритмы, оптимизированные для тестовых бенчмарков с высокими сложностями, часто пытаются строить длинные логические цепочки для таких простых задач.
Это приводит к неоправданным затратам времени и вычислительной мощности. В инференс-режимах (при генерации ответов в реальном времени) каждое лишнее токен-генерирование увеличивает задержку, что критично для интерактивных приложений.
Как работает AutoThinkSQL
Предложенный подход интегрирует механизм «автоматического размышления» (auto-thinking) непосредственно в процессы обучения: как в этапе супервизированной дообучения (SFT), так и в прямой оптимизации предпочтений (DPO). Модель не просто «знает» ответы, она учится *решир*, когда и зачем применять интеллект.
В процессе обучения модель получает сигнал: «Этот запрос был решен успешно без длинных рассуждений». Это формирует у нейросети понимание, что глубокое анализирование избыточно для простых случаев. В результате модель выстраивает внутреннюю корреляцию между степенью сложности запроса и необходимостью активации логических механизмов.
Результаты на стандартных тестах
Исследование проводилось на базе модели Qwen3-Coder-30B-A3B. Эксперименты показали устойчивое улучшение показателей на двух ключевых бенчмарках: Spider и BIRD.
Ключевые улучшения включают: * Сокращение среднего количества сгенерированных токен-ов на 24.6% для Spider и 18.3% для BIRD. * Снижение средней задержки (латентности) ответа на 17.1% для Spider и 11.5% для BIRD.
Важно отметить, что эти улучшения достигнуты без потери точности. Более того, точность системы осталась на уровне лучших базовых методов (baseline), но при существенно меньших затратах ресурсов.
Технический взгляд на процесс
Для неспециалистов термины SFT и DPO могут звучать сложно. SFT (Supervised Fine-Tuning) — это стандартный способ дообучения модели на размеченных данных, где мы говорим модели «правильный ответ». DPO (Direct Preference Optimization) — более современный метод, который обучает модель выбирать предпочтительные ответы, сравнивая варианты друг с другом, без необходимости собирать дополнительные данные для обучения.
В рамках AutoThinkSQL эти техники объединяются: сначала модель обучается различать простые и сложные запросы, а затем оптимизируется так, чтобы она «любала» более короткие пути решения там, где это возможно, не жертвуя качеством.
Авторы отмечают, что анализ показывает: модель действительно учится согласовывать свои действия со сложностью запроса. Она перестает быть «фанатом» логического мышления и начинает применять этот навык избирательно.