AIRUS ModelCatalogTruthOps · Verified Model Registry

Большое число моделей уже не преимущество, а обязательство: каждую нужно идентифицировать, протестировать, описать, оценить, тарифицировать, контролировать и вовремя вывести. Каталог AIRUS отвечает не на вопрос «какие модели мы можем технически вызвать», а «какие AIRUS проверил, для каких задач и данных их безопасно использовать и когда они тестировались последний раз».

AVAILABLE ≠ PRODUCTION

модель показана клиенту → технически вызывается → «доступна»   ← слишком слабый стандарт

Lifecycle: ANNOUNCED → AVAILABLE → TESTING → VERIFIED → PRODUCTION
                                                → RESTRICTED / DEGRADED / DEPRECATED / RETIRED

PRODUCTION ⟸ ТОЛЬКО персистнутый прошедший eval-результат
declared (provider claim / client pass_rate) ⟹ максимум TESTING

Карточка говорит «Structured output: supported», а на практике модель добавляет пояснение вокруг JSON, пропускает поля, ломает schema на длинном контексте. Нужен не boolean-флаг, а schema pass rate + test cases + last verified — и только из реального теста.

Честная граница: claim vs verified

evalops умеет считать pass_rate, но пока не персиститит результаты прогонов → независимой персистной verification ещё нет → модели честно упираются в AVAILABLE/TESTING. Это и есть запрет фейкового PRODUCTION.

Provider claim ≠ AIRUS verification
Заявленная функция и реально работающая — разные вещи. Карточка хранит их в РАЗНЫХ полях; verified_* заполняется только из персистного eval-результата, никогда из тела запроса.
Badge создаётся тестом
client-заявленный pass_rate в теле — declared, он не двигает модель в VERIFIED. Как backup-restore и exit-test прошлых циклов: VERIFIED не выдаётся из body.
Рекомендации без скрытой маржи
Функция quality-ранжирования структурно не имеет доступа к марже — bias невозможен, а не задекларирован. commercial-ранжирование отдельно и раскрывается.
Реальный eval-движок — впереди
Прогон golden sets, judge governance, statistical release gate, cost per accepted outcome — следующий цикл (ModelEvaluationOps). Здесь — truth реестра поверх результатов.

Движки

Catalog Truth Gate
Флагман. Статус PRODUCTION/VERIFIED — ТОЛЬКО при ссылке на реальный ПЕРСИСТНУТЫЙ прошедший eval-результат. Provider claim → AVAILABLE. Client/provider declared pass_rate → максимум TESTING. Клиент не может протолкнуть PRODUCTION декларацией — гейт понижает. Badge создаётся тестом, не заявлением.
Catalog Integrity Receipt
Fail-closed: TRUSTED ⟺ unverified_claims=0 (ни одна модель не PRODUCTION/VERIFIED без персистного eval). production_verified честно = число моделей с реальным verified-результатом. sha256 authoritative:false, verify-from-sealed, seal-once.
Verified Model Card
Provider claim и AIRUS verification — РАЗНЫЕ поля, не смешиваются. verified_pass_rate показывается только при verified_persisted-провенансе; client-заявленный провенанс сервис понижает до declared (declared_only, не выдаётся за verified).
Unbiased Recommendation
Quality-ранжирование СТРУКТУРНО не получает маржу на вход → commercial bias невозможен (не декоративный ярлык). Рекомендации по quality / cost / latency раздельно; commercial-ранжирование отдельно и раскрывается. Поставщик может оплатить тест, но не проходной балл.
Price Normalization + Freshness
Провайдеры тарифицируют по-разному (1M токенов / 1k слов / сек аудио). Нормализация к ₽/1M в Decimal (не float). Price freshness по timestamp: цена старше max-age → устарела, quote может быть неверным.
OpenAI Parity Matrix
OpenAI-совместимый endpoint ≠ функциональный паритет. response_format / tools / files / images / reasoning / seed проверяются на уровне модели; 'verified' — только из реального теста, иначе declared/unknown.

Проверить решением

Публичный what-if: declared pass_rate → максимум TESTING (не PRODUCTION).

curl -sX POST https://airus.world/v1/airus/model-catalog/truth-gate \
  -H 'content-type: application/json' \
  -d '{"identity_resolved":true,"verification":{"provenance":"declared","passed":true}}'
# → {"status":"TESTING","is_production":false, ...}  (declared не даёт PRODUCTION)

Тенант-путь /v1/airus/model-catalog/evaluate прогоняет каждую модель через Truth Gate и собирает Catalog Integrity Receipt (fail-closed, seal-once). Смежное — Каталог моделей, ProviderGovernanceOps, Eval Pack.