AIRUS ModelCatalogTruthOps · Verified Model Registry
Большое число моделей уже не преимущество, а обязательство: каждую нужно идентифицировать, протестировать, описать, оценить, тарифицировать, контролировать и вовремя вывести. Каталог AIRUS отвечает не на вопрос «какие модели мы можем технически вызвать», а «какие AIRUS проверил, для каких задач и данных их безопасно использовать и когда они тестировались последний раз».
AVAILABLE ≠ PRODUCTION
модель показана клиенту → технически вызывается → «доступна» ← слишком слабый стандарт
Lifecycle: ANNOUNCED → AVAILABLE → TESTING → VERIFIED → PRODUCTION
→ RESTRICTED / DEGRADED / DEPRECATED / RETIRED
PRODUCTION ⟸ ТОЛЬКО персистнутый прошедший eval-результат
declared (provider claim / client pass_rate) ⟹ максимум TESTINGКарточка говорит «Structured output: supported», а на практике модель добавляет пояснение вокруг JSON, пропускает поля, ломает schema на длинном контексте. Нужен не boolean-флаг, а schema pass rate + test cases + last verified — и только из реального теста.
Честная граница: claim vs verified
evalops умеет считать pass_rate, но пока не персиститит результаты прогонов → независимой персистной verification ещё нет → модели честно упираются в AVAILABLE/TESTING. Это и есть запрет фейкового PRODUCTION.
Движки
Проверить решением
Публичный what-if: declared pass_rate → максимум TESTING (не PRODUCTION).
curl -sX POST https://airus.world/v1/airus/model-catalog/truth-gate \
-H 'content-type: application/json' \
-d '{"identity_resolved":true,"verification":{"provenance":"declared","passed":true}}'
# → {"status":"TESTING","is_production":false, ...} (declared не даёт PRODUCTION)Тенант-путь /v1/airus/model-catalog/evaluate прогоняет каждую модель через Truth Gate и собирает Catalog Integrity Receipt (fail-closed, seal-once). Смежное — Каталог моделей, ProviderGovernanceOps, Eval Pack.