Необходимо разработать интеллектуальный сервис с применением языковых моделей (LLM), который будет анализировать SQL-запросы, логическую и физическую структуру хранилища данных на базе S3, Apache Iceberg, Trino и Spark.
Цель - выдавать рекомендации по изменению запросов и моделей хранения для повышения производительности и более рационального использования ресурсов.
Современные Data Lakehouse - системы обеспечивают гибкость и масштабируемость для хранения и аналитики данных, но быстрое развитие технологий делает задачу их оптимизации крайне важной. Автоматизированные рекомендации по улучшению производительности позволяют компаниям снижать издержки и ускорять аналитику.
Текущая схема данных (DDL), список запросов и количество выполнений каждого запроса, строка подключения к демонстрационному датасету в Trino (для оценки состава данных). Вычислительные мощности для отработки запросов для финалистов.
- Егор Шипилов – ML-engineer
- Никита Кирнасов – Fullstack-разработчик
- Владислав Апухтин – Data Scientist
- Фёдор Дубовицкий – Data Storyteller
- Ярослав Кудрявцев – Капитан, Data Analyst
FastAPI + Uvicorn - высокопроизводительный REST API и ASGI-сервер для развертывания
SQLCoder 2 + SFT/LoRA - базовая LLM с эффективным дообучением через адаптеры RAG-система + Optuna - база знаний по оптимизации запросов с автоматической настройкой гиперпараметров
Кастомный модуль оценки - проверка валидности, безопасности и оптимизации SQL-запросов Многокритериальная оценка Интегральные метрики - взвешенная оценка качества запросов
Анализ SQL-запросов во временном ряду и построение графа нагрузки, чтобы выявлять узкие места и предлагать оптимизацию структуры БД.
Подробнее про реструктуризацию базы данных
-
Запрос через REST API → пользователь отправляет SQL-запрос
-
Бенчмарк SQL-запроса до обработки
-
Обработка моделью → система анализирует и оптимизирует запрос с использованием контекста из RAG
-
Возврат результата → клиент получает оптимизированную версию запроса
-
Бенчмарк SQL-запроса после обработки
