EM-AI-03 · Предметная модель · W3
Оценка AI и доказательства безопасности
План оценки, benchmark, запуск, результаты, оценка рисков и решение о допустимом применении. Метрика, dataset и evidence переиспользуются.
В очереди исследования
Claude: not-started; Grok: not-started.
Entire research brief pending
Предметная граница и кандидатные типы
- EvaluationPlan
- EvaluationRun
- BenchmarkSpecification
- SafetyAssessment
- DeploymentDecision
Вопросы глубокого исследования
- Как выявлять утечку benchmark в training?
- Как отделить измерение способности от допустимости применения?
- Как учитывать неопределённость и смену контекста?
Проверяемые инварианты
- Результат закрепляет model и dataset версии
- Оценка не универсальна вне контекста
- Решение имеет ответственного и условия
Сквозной приёмочный сценарий
Смена датасета и контекста применения приводит к отдельной оценке и явному решению, а не к переносу прежнего одобрения.
Отрицательный пример
Один высокий benchmark score объявляет систему безопасной для всех задач.
Сопоставляемые подходы
- NIST AI RMF: контекст, оценка и управление риском
- PROV/SPDX: происхождение данных, артефактов и действий
- Практика model registry/evaluation tooling; сопоставить system, artifact, run и endpoint
Кандидаты в действующем каталоге
- WM-AI-003 · AI Model Evaluation · 0.3.0-research.1 · доступна для установки
Смысловое соответствие требует исследования границ; наличие опубликованной модели не завершает эту карточку. - WM-AI-009 · Evaluation Dataset / Benchmark · 0.3.0-research.1 · доступна для установки
Смысловое соответствие требует исследования границ; наличие опубликованной модели не завершает эту карточку. - WM-AI-008 · AI Safety / Governance Assessment · 0.3.0-research.1 · доступна для установки
Смысловое соответствие требует исследования границ; наличие опубликованной модели не завершает эту карточку. - WM-AI-010 · AI Incident Report · 0.3.0-research.1 · доступна для установки
Смысловое соответствие требует исследования границ; наличие опубликованной модели не завершает эту карточку.
Требования к результату
Каждая карточка исполняется вместе с полным контрактом исследования: определения, поля и кратности, жизненный цикл, источники, мастерство данных, права, пять граней объекта, минимум восемь инвариантов, положительные и отрицательные примеры, зависимости, миграция и ограничения применимости.