Попарное сравнение ответов (chosen / rejected) и ранжирование от людей, которые разбираются в теме.
Что это
Чтобы модель отвечала как специалист, ей нужны человеческие предпочтения: из двух ответов какой лучше и почему. Это основа RLHF и DPO.
Суждения дают не случайные разметчики, а проверенные эксперты отрасли: сравнивают пары, ранжируют и обосновывают выбор. Обоснование тоже попадает в набор.
На выходе JSONL с chosen / rejected для DPO или полные ранжировки для reward-модели. К каждому суждению прикладываем данные об эксперте.
Как устроено
Каждый ответ проходит через живого эксперта и контроль качества.
Готовим промпты и по нескольку ответов-кандидатов.
Практик выбирает лучший ответ, ранжирует и обосновывает выбор.
Пересечение экспертов, при расхождении арбитраж. Уверенность фиксируется.
Форматы выгрузки
Готовые файлы под обучение. К каждой выгрузке прикладываем паспорт (data card) и происхождение данных.
{"prompt": "Как объяснить пациенту отказ от антибиотика при ОРВИ?",
"chosen": "Вирусная инфекция антибиотиком не лечится... эмпатично поясняем",
"rejected": "Антибиотики не нужны. Всё.",
"reason": "chosen корректен и сохраняет контакт с пациентом",
"expert": "expert_id:88, врач-терапевт"}Почему через СВОД
Кто заверил, квалификация, согласие субъекта, лицензия источника.
Сложные задачи ведут практики с проверенными документами. Более простые выполняет допущенный крауд под контролем.
Контур, локализация и допустимые обработчики фиксируются в договоре до пилота; внешняя LLM разрешается только после отдельного data/legal gate.
К каждому набору прикладываем паспорт (data card): метрики согласия, покрытие, история проверок.
Опишите тип набора и объём, вернёмся с оценкой стоимости и сроков.