mnipotano

Руководство пользователя

Инструкция по подготовке датасетов в формате JSONL для файн-тюнинга языковых моделей на задачах веб-разработки.

Назначение

Инструмент преобразует исходный HTML-код и текстовые описания дизайна в структурированный формат JSONL. Этот формат является стандартом для обучения и дообучения (fine-tuning) моделей, таких как Qwen 2.5 Coder, с использованием фреймворков Unsloth или Hugging Face.

Режимы работы

01

Одиночный режим

Предназначен для точечного добавления качественных примеров. Вы вставляете HTML-код вручную или загружаете отдельный файл. Кнопка "Из title" автоматически извлекает содержимое тега <title> и подставляет его в поле описания, что ускоряет разметку. Рекомендуется для формирования эталонных пар "запрос-ответ".

02

Массовая загрузка

Позволяет выбрать сразу множество HTML-файлов. Система автоматически генерирует описания (instruction) на основе содержимого тега <title> и ключевых слов в именах файлов (например, "dark-coffee-landing.html" преобразуется в "лендинг, кофейня, тёмная тема"). После загрузки каждый сгенерированный промпт можно отредактировать вручную в общем списке.

Опции обработки

Перед добавлением записи в датасет применяются фильтры очистки. Их можно настроить в верхней части интерфейса:

Экспорт данных

После формирования списка записей нажмите кнопку "Скачать JSONL". Браузер сгенерирует и загрузит файл web_design_dataset.jsonl. Каждая строка этого файла представляет собой валидный JSON-объект со следующей структурой:

{ "system": "Ты — эксперт по веб-дизайну...", "instruction": "Создай лендинг кофейни в тёмных тонах...", "output": "..." }
Дальнейшие действия: Загрузите полученный файл web_design_dataset.jsonl в Google Colab или другую среду обучения. Используйте его в качестве аргумента data_files при инициализации объекта Dataset из библиотеки Hugging Face.