AIRUS GPUFinOps
LocalModelOps выбрал модель и прикинул железо. Но после развёртывания возникает вопрос дороже: кто следит, чтобы оплаченные GPU создавали бизнес-результат, а не простаивали, дублировали модели и обслуживали неправильную очередь? AIRUS считает не CUDA-загрузку, а финансовый результат на единицу оплаченной мощности.
Что делает
GPU Asset & Cost Ledger
Полный учёт GPU: provider, тип, VRAM, topology, тариф, commitment, владелец. Нормализация GPU-hour: bundle CPU/RAM, NVLink premium (только если реально нужен), VAT — чтобы сравнивать облака честно.
Workflow Chargeback
Расход распределяется по tenant/отделу/клиенту/workflow/модели. Chargeback запрещён, пока allocation не покрывает расход — иначе только showback. Никакого «общего корпоративного костра», где все греются и никто не признаётся.
Accepted Results per GPU-hour + Efficiency Score
Единица AIRUS — принятый бизнес-результат ÷ GPU-hour, не загрузка ядер. Efficiency Score DERIVED: высокая GPU-загрузка при плохом качестве не даёт высокий балл (accepted + throughput = 40% веса).
Waste Engine + Commitment Optimizer
Idle GPU, дублированные модели, лишний warm pool, NVLink без tensor parallelism, underused commitment → findings + месячный waste + действие. Commitment «approved» DERIVED: нельзя коммитить до FP8-миграции. Скидка ≠ гарантия capacity.
GPU Waste Receipt
Ежемесячный документ вместо спора «кто виноват в счёте облака»:
- GPU spend — сколько всего оплачено.
- Productive spend — оправдано результатом.
- Confirmed waste — подтверждённый простой/дубли.
- Protected reserve — DR-мощность (страховка).
- Savings realized — реализованная экономия.
AIRUS остаётся hardware- и cloud-neutral — иначе рекомендация «вам срочно нужны восемь GPU» выглядит подозрительно быстро.
Как использовать
# Cost model + efficiency + waste + commitment (public калькуляторы)
POST /v1/airus/gpu-finops/unified-cost { "hourly_cost_rub": 4270, "topology": "nvlink", "uses_tensor_parallel": false }
POST /v1/airus/gpu-finops/efficiency-score { "compute_utilization": 92, "accepted_result_rate": 25, ... } # → низкий score
POST /v1/airus/gpu-finops/waste/detect { "compute_utilization": 0.1, "monthly_cost_rub": 700000 }
POST /v1/airus/gpu-finops/commitment/evaluate { "forecast_utilization": 0.72, "term_months": 12, "optimization_planned": true } # → rejected
# Asset ledger + allocation + chargeback (JWT)
POST /v1/airus/gpu-finops/assets { "provider": "cloud_ru", "gpu_type": "H100", "gpu_count": 5, "hourly_cost_rub": 4270 }
POST /v1/airus/gpu-finops/assets/{id}/allocations { "allocation_key": "legal", "allocated_cost_rub": 84000 }
POST /v1/airus/gpu-finops/chargeback { "department": "legal", "period": "2026-07", "total_gpu_cost_rub": 100000, "accepted_results": 6000 }Честно про слой
- Движки детерминированы: unified cost model, allocation, efficiency score, waste engine, commitment/warm-pool/scheduler/portfolio, chargeback quality, waste receipt.
- Правила зашиты: Efficiency Score и Commitment decision — DERIVED (нельзя self-assert); chargeback требует allocation coverage (иначе showback); рискованное Savings Action требует approval перед изменением production capacity.
- v0 = финансовый framework: реальный импорт DCGM-телеметрии, cloud invoices, Kubernetes workload metadata, live preemption/scheduling, автозакупка capacity — roadmap. Здесь — движки, реестры и receipts.
- Дополняет, не дублирует: LocalModelOps (выбор модели/TCO), FinOps (token/request cost), ResilienceOps (DR capacity). Allocation/chargeback — вычисленная атрибуция, баланс-ledger не трогаем.