Темы, тональность, сущности (NER), приоритет: размеченные данные для классификаторов и модерации на русском.
Что это
Классификаторам и модерации нужны чистые примеры: тема, тональность, сущности, приоритет. Качество модели зависит от качества разметки.
Размечаем по вашей схеме с пересечением: каждый пример видят несколько человек, итог берём по согласию большинства, спорное решает эксперт. Согласие (κ) держится высоким.
Подходит для соцмониторинга обращений, поддержки клиентов, модерации площадок и любой классификации русского текста.
Как устроено
Каждый ответ проходит через живого эксперта и контроль качества.
Фиксируем классы, определения и краевые случаи в инструкции.
Каждый пример размечают несколько исполнителей; метку берём по согласию большинства.
Метрика κ, скрытые gold-примеры; спорное решает эксперт.
Форматы выгрузки
Готовые файлы под обучение. К каждой выгрузке прикладываем паспорт (data card) и происхождение данных.
{"text": "Опять всю ночь не работал фонарь у дома 12, темно и страшно",
"topic": "благоустройство/освещение",
"sentiment": "negative",
"priority": "high",
"entities": [{"type": "address", "text": "дом 12"}],
"agreement": "3/3"}Почему через СВОД
Кто заверил, квалификация, согласие субъекта, лицензия источника.
Сложные задачи ведут практики с проверенными документами. Более простые выполняет допущенный крауд под контролем.
Контур, локализация и допустимые обработчики фиксируются в договоре до пилота; внешняя LLM разрешается только после отдельного data/legal gate.
К каждому набору прикладываем паспорт (data card): метрики согласия, покрытие, история проверок.
Опишите тип набора и объём, вернёмся с оценкой стоимости и сроков.