AIRUS LocalModelOps
Наличие российской или open-weight модели не гарантирует качество и экономику. Рынок перешёл от «можно ли запустить LLM» к «какую модель → в какой точности → на каком железе → под какой workflow → с какой себестоимостью → и с каким падением качества». AIRUS продаёт не «свою LLM», а доказательство, что конкретная локальная конфигурация лучше внешнего API.
Что делает
Local Model Challenge + Benchmark
Клиент даёт 100–1000 реальных кейсов. AIRUS сравнивает GigaChat 3.1 Lightning/3.5 Ultra, T-lite, T-pro, YandexGPT на его договорах/обращениях — публичный ruMMLU не заменяет проверку на данных клиента.
Quantization Quality Gate
INT4 экономит память и первым ломает tool calling. Нельзя публиковать вариант только потому что загрузился: BF16/FP8/AWQ/GGUF проходят business accuracy, JSON, tool, numerical — статус approved выводится из benchmark, не назначается.
Hardware Fit + API-vs-Local TCO
weights + KV-cache × concurrency → GPU count, precision, runtime, TCO. Cost считается за принятый бизнес-результат, не за токен. AIRUS честно скажет «останьтесь на API», если self-hosting не окупается.
Adapter Registry + Fine-tune Decision
legal-v2-final-new не размножаются: каждый adapter имеет base model, dataset, owner и Quality Receipt. Production adapter без lineage — 400. Fine-tune только после prompt/RAG/few-shot, не для меняющихся цен и законов.
Quality–Cost–Latency Frontier
AIRUS показывает не одну «лучшую» модель, а границу выбора под workflow:
- local/fast (T-lite FP8) — массовые простые задачи, дёшево.
- local/balanced (T-pro AWQ) — основной route.
- local/reasoning (GigaChat Ultra) — сложные случаи, кластер.
- external_flagship — только escalation при низкой уверенности (если не rf-only).
Дешёвая модель с 20% ручных исправлений часто дороже дорогой с 2% — поэтому единица AIRUS = cost per accepted result.
Как использовать
# Quantization gate + hardware fit + TCO (public калькуляторы)
POST /v1/airus/local-models/quantization-gate { "baseline": {...}, "variant": {...}, "floor_accuracy": 0.94 }
POST /v1/airus/local-models/hardware-fit { "total_params_b": 8, "precision": "fp8", "context_tokens": 8192, "target_concurrency": 8, "gpu_memory_gb": 80 }
POST /v1/airus/local-models/tco { "managed_api_monthly_rub": 820000, "local_tco_monthly_rub": 610000, "monthly_volume_results": 100000, "api_human_correction_rate": 0.1, "local_human_correction_rate": 0.03 }
POST /v1/airus/local-models/fine-tune-decision { "data_volatility": "changing" } # → dont_fine_tune (RAG)
# Benchmark + variant (DERIVED статус) + adapter (lineage) (JWT)
POST /v1/airus/local-models/benchmarks { "dataset": "customer_cases_v4", "candidate_id": "t_pro_it_2_0", "cases": 842, "business_accuracy": 0.961 }
POST /v1/airus/local-models/variants { "candidate_id": "t_pro_it_2_0", "precision": "awq_int4", "floor_accuracy": 0.94, "baseline": {...}, "variant": {...} }
POST /v1/airus/local-models/adapters { "name": "legal", "base_model_version": "...", "dataset_version": "...", "quality_receipt_id": "...", "status": "production" }Честно про слой
- Движки детерминированы: quantization gate, hardware/KV-cache estimator, API-vs-local TCO + cost per accepted result, fine-tune decision, model cascade, optimization receipt.
- Правила зашиты: variant «approved» выводится из Quality Gate (нельзя без benchmark); production adapter без base_model+dataset+quality_receipt (lineage) — 400; latest в production запрещён.
- v0 = factory framework: реальный benchmark на датасете клиента, quantization/conversion, GPU serving (vLLM/SGLang), load test, multi-LoRA, adapter training — roadmap. Здесь — движки, реестры и receipts.
- Дополняет, не дублирует: SovereigntyOps (замена foreign→local — здесь КАК выбрать/оптимизировать), EvalOps (benchmark datasets), RouteEconomics. Cost — расчёт, ledger не трогаем. AIRUS hardware-neutral.