Как модели справляются с русскоязычными отраслевыми задачами: по эталонам и рубрикам экспертов СВОД. Единая шкала, воспроизводимые прогоны.
Концепт
Публичные бенчмарки в основном на английском и на общих задачах. Как модель справляется с русской медициной, обращениями граждан или методикой преподавания, они не показывают.
Арена СВОД замеряет именно это: отраслевые задачи с эталонными ответами и рубрикой. Эксперты оценивают по единой шкале, сравнение честное и воспроизводимое.
Таблица ниже это иллюстрация формата. Публичные результаты появятся после первых прогонов; методика и наборы разрабатываются с экспертным сообществом.
Предварительный формат. Значения в таблице это демонстрация структуры, а не итоговые результаты. Реальные прогоны публикуются по мере готовности наборов.
Демо-рейтинг
Оценка экспертами по рубрике, шкала 0–100. Иллюстративные данные.
| Модель | Домен | Балл | Комментарий |
|---|---|---|---|
| 1. Модель A | Медицина | … | прогон запланирован |
| 2. Модель B | Медицина | … | прогон запланирован |
| 3. Модель C | Соцмониторинг | … | прогон запланирован |
| 4. Модель D | Педагогика | … | прогон запланирован |
| 5. Ваша модель | Любой | … | предложите на оценку |
Как считаем
Эксперты пишут задачи, эталонные ответы и рубрику с описанием уровней.
Ответы оцениваются без указания модели, чтобы исключить предвзятость.
Несколько экспертов на ответ, метрика κ; наборы фиксированы для воспроизводимости.
Предложите модель на Арену или закажите приватный eval-набор под ваш домен.