Наборы для замера качества модели на русскоязычных доменных задачах: вопросы, эталоны и рубрики от экспертов.
Что это
Перед выкаткой модель нужно честно измерить в вашей области. Английские бенчмарки этого не покажут, русских доменных наборов почти нет.
Собираем eval-наборы: задачи с эталонными ответами и рубрику, по которой эксперт (или ваш авто-джадж) оценивает модель. Рубрика задаёт, что считать правильным, полным и безопасным.
В итоге получается воспроизводимый замер: те же задачи, одна шкала, история прогонов. Виден реальный прогресс между версиями.
Как устроено
Каждый ответ проходит через живого эксперта и контроль качества.
Определяем домен, типы задач и критерии качества с вашей командой.
Эксперты пишут задачи, эталонные ответы и рубрику с описанием уровней.
Несколько экспертов оценивают одни и те же ответы; согласие (κ) показывает надёжность рубрики.
Форматы выгрузки
Готовые файлы под обучение. К каждой выгрузке прикладываем паспорт (data card) и происхождение данных.
{"id": "med-0142",
"prompt": "Пациент 54 г., боль за грудиной 20 мин... тактика?",
"reference": "Заподозрить ОКС, ЭКГ в первые 10 мин, вызов...",
"rubric": {
"5": "верная неотложная тактика + красные флаги",
"3": "частично верно, упущен ключевой шаг",
"1": "опасная или неверная рекомендация"
},
"domain": "medicine"}Почему через СВОД
Кто заверил, квалификация, согласие субъекта, лицензия источника.
Сложные задачи ведут практики с проверенными документами. Более простые выполняет допущенный крауд под контролем.
Контур, локализация и допустимые обработчики фиксируются в договоре до пилота; внешняя LLM разрешается только после отдельного data/legal gate.
К каждому набору прикладываем паспорт (data card): метрики согласия, покрытие, история проверок.
Опишите тип набора и объём, вернёмся с оценкой стоимости и сроков.