Изначальная структура моих .jsonl в файлах:
{
"rank": 1,
"platform": "Яндекс (34 проекта*)",
"audience_millions": 26.01
}
{
"rank": 2,
"platform": "Mail.ru (30 проектов)",
"audience_millions": 25.188
}
{
"rank": 3,
"platform": "В контакте",
"audience_millions": 20.877
}
{
"rank": 4,
"platform": "Google (домены .ru и .com)",
"audience_millions": 19.775
}
{
"rank": 5,
"platform": "Одноклассники",
"audience_millions": 16.074
}
{
"rank": 6,
"platform": "Wikipedia.org",
"audience_millions": 15.946
}
{
"rank": 7,
"platform": "Rambler (30 проектов)",
"audience_millions": 14.46
}
{
"rank": 8,
"platform": "YouTube.com",
"audience_millions": 14.402
}
{
"rank": 9,
"platform": "Livejournal.com",
"audience_millions": 11.666
}
{
"rank": 10,
"platform": "Depositfile.com",
"audience_millions": 10.756
}
{
"rank": 11,
"platform": "Marketgid.com",
"audience_millions": 10.338
}
{
"rank": 12,
"platform": "Letitbit.net",
"audience_millions": 9.157
}
{
"rank": 13,
"platform": "Adobe.com",
"audience_millions": 7.96
}
{
"rank": 14,
"platform": "Liveinternet.ru",
"audience_millions": 7.69
}
{
"rank": 15,
"platform": "Novoteka.com",
"audience_millions": 7.567
}
{
"rank": 16,
"platform": "Gismeteo.ru",
"audience_millions": 7.489
}
{
"rank": 17,
"platform": "Facebook.com",
"audience_millions": 7.412
}
{
"rank": 18,
"platform": "Qip.ru",
"audience_millions": 7.403
}
{
"rank": 19,
"platform": "Kinopoisk.ru",
"audience_millions": 7.001
}
{
"rank": 20,
"platform": "Rian.ru",
"audience_millions": 6.875
}
Для адаптации структуры jsonl под обучение ИИ нужно добавить поля
role и content для преобразования
из формата "Данные" в формат
"Диалог".
Пример:
{
"messages": [
{"role": "system", "content": "Ты эксперт по статистике рунета. Отвечай строго на основе предоставленных данных за сентябрь 2010 года."},
{"role": "user", "content": "Какая интернет-площадка занимала 1 место по ежемесячной аудитории в сентябре 2010 года?"},
{"role": "assistant", "content": "На 1 месте — Яндекс (34 проекта*) с аудиторией 26.01 млн человек."}
]
}
Так же при необходимости нужно делить большие тексты на части потому что у ИИ есть лимит на длину контекста, который он может обработать за один раз.